AI Notebooks - Tutoriel - Utiliser le Speech-to-Text sur des audios et vidéos
Comment faire de la reconnaissance automatique de la parole pour la transcrire sous forme de texte en utilisant AI Notebooks
Objectif
L'objectif de ce tutoriel est de vous montrer comment il est possible de convertir de la parole en texte et de générer des transcriptions grâce aux AI Notebooks.
En Natural Language Processing (NLP), le speech-to-text est une tâche de Deep Learning qui permet aux machines de comprendre et de lire le langage humain. Les applications sont nombreuses : transcription, résumés, diarisation, génération de sous-titres, ...
Cette documentation vous permet de tester et de lancer 3 AI Notebooks vous permettant de vous familiariser avec différentes fonctionnalités de speech-to-text et de les utiliser.
- Le premier vous apprendra les bases de la transcription audio. Vous pourrez transcrire de longs fichiers audio locaux ou issus de YouTube, mesurer la qualité d'une transcription, ajouter de la ponctuation et les résumer.
- Le second tutoriel vise à découvrir des étapes plus avancées telles que la détection des changements de locuteur (diarisation) et la génération de sous-titres vidéo.
- Le dernier tutoriel propose une comparaison de différents modèles Speech-to-Text afin de trouver le meilleur parmi ceux disponibles.
Les instructions suivantes s'appliquent à chacun de ces 3 tutoriels.
Prérequis
- Un projet AI Notebooks créé au sein d'un projet Public Cloud dans votre compte OVHcloud
- Un utilisateur pour AI Notebooks
Accès à l'espace client OVHcloud
- Lien direct :
- Pour accéder à vos services :
Public Cloud> Sélectionnez votre projet
En pratique
Vous pouvez lancer votre notebook depuis l' ou via le CLI ovhai.
Le lien direct vers le code complet est disponible ici.
Lancer un notebook Jupyter avec "Miniconda" via l'interface
Pour lancer votre notebook depuis l', suivez les étapes ci-dessous.
Éditeur de code
Choisissez l'éditeur de code Jupyterlab.
Framework
Dans ce tutoriel, le framework Miniconda est utilisé.
Avec Miniconda, vous pourrez configurer votre environnement en installant les bibliothèques Python dont vous avez besoin.
Vous pouvez choisir la version de conda.
La version par défaut de conda fonctionne pour ce tutoriel : conda-py39-cuda11.2-v22-4.
Ressources
Un GPU est recommandé car la transcription audio est gourmande en ressources.
Ici, l'utilisation de 1 GPU est suffisante.
Lancer un notebook Jupyter avec "Miniconda" via la CLI
Si vous souhaitez le lancer avec la CLI, choisissez l'éditeur jupyterlab et le framework conda.
Pour accéder aux différentes versions de conda disponibles, exécutez la commande suivante.
Ce tutoriel a été lancé avec la version conda-py39-cuda11.2-v22-4.
Si vous ne spécifiez pas de version, votre notebook démarre avec la version par défaut de conda.
Choisissez le nombre de CPU/GPU (<nb-cpus> ou <nb-gpus>) à utiliser dans votre notebook et utilisez la commande suivante.
Nous recommandons ici d'utiliser 1 GPU.
Vous pourrez ensuite accéder à l'URL de votre notebook une fois qu'il est en cours d'exécution.
Accéder aux notebooks
Une fois le dépôt cloné, trouvez votre notebook en suivant ce chemin : ai-training-examples > notebooks > natural-language-processing > speech-to-text.
- Vous trouverez le premier tutoriel dans le dossier
basics. Un aperçu de ce notebook est disponible sur GitHub ici. - Le second tutoriel correspond au dossier
advanced. Un aperçu de ce notebook est disponible sur GitHub ici. - Le dernier dossier, nommé
compare-models, contient le troisième tutoriel. Un aperçu de ce notebook est disponible sur GitHub ici.
Aller plus loin
- Avec le NLP, vous pouvez faire de l'analyse de sentiment. Pour plus d'informations, cliquez ici.
Pour une formation ou une assistance technique sur la mise en œuvre de nos solutions, contactez votre commercial ou consultez la page Professional Services pour obtenir un devis et faire analyser votre projet par nos experts.
Votre avis nous intéresse !
N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :
- Sur le serveur Discord OVHcloud