AI Partners Ecosystem - Voxist - Concept des modèles
Découvrez comment utiliser les modèles Voxist
Objectif
OVHcloud propose différents services d'Intelligence Artificielle grâce à son AI Partners Ecosystem. Vous bénéficierez d'un catalogue d'applications prêtes à l'emploi fournies par nos partenaires, que vous pourrez facilement déployer selon vos besoins grâce à AI Deploy.
Voxist est un partenaire OVHcloud qui propose des services d'IA dédiés à la reconnaissance vocale et au traitement du langage naturel. Ce guide vous permettra de bien comprendre le fonctionnement des services Voxist.
Pour en savoir plus sur la facturation, le lancement et les fonctionnalités de Voxist, reportez-vous à ce guide.
Introduction
Voxist est une start-up française spécialisée dans la reconnaissance vocale. La plateforme permet à toutes les organisations, des start-ups aux grands groupes, d'effectuer de la reconnaissance vocale automatique.
La reconnaissance vocale est prise en charge par deux API :
- une API REST pour la reconnaissance vocale asynchrone, avec prise en charge de la diarisation
- une API WebSocket pour la reconnaissance vocale synchrone
Langues prises en charge : français, anglais, allemand, espagnol, portugais, italien, polonais
Bientôt disponibles : néerlandais et hébreu
API REST Voxist
API Speech to text
Transcription
Cet endpoint transcrit un enregistrement audio en objet JSON. Des paramètres de configuration peuvent être transmis pour spécifier une langue, activer la reconnaissance de la ponctuation et la diarisation.
-
URL :
/transcribe -
Méthode :
POST -
Payload :
Envoyez les paramètres de configuration et les fichiers audio en utilisant le Content-Type multipart/form-data.
Paramètres de configuration (paramètre form-data config)
- punctuation :
[true, false]: active la ponctuation dans le résultat (par défaut : false) - lang :
["fr", "en", "es", "pt", "it", "de", "pl"]: définit la langue de l'audio en entrée (par défaut : "en") - sample_rate :
[8000, 16000]: la valeur par défaut est 8 kHz. - wait :
[true, false]: la valeur par défaut esttrue. La requête attendra la fin de la transcription avant de renvoyer un résultat. Si la valeur estfalse, la requête renverra immédiatement un identifiant de job ainsi qu'une estimation du temps d'exécution.
Exemple de configuration :
Réponse en cas de succès
-
Code :
200 OK -
Contenu de la réponse :
Lexical: transcription du segmentConfidence: confiance de la transcriptionStart_time: décalage du segment en secondesDuration: durée du segment en secondesSpeaker: si la diarisation est active, identifie le locuteur avec un identifiant uniqueSPEAKER_00,SPEAKER_01.
Préparer les fichiers audio pour la transcription
Pour être transcrits correctement, les fichiers audio doivent être des fichiers WAV mono (canal unique). Vous pouvez utiliser FFmpeg pour convertir votre audio d'entrée au format approprié en suivant ces étapes :
-
Installation : Assurez-vous d'abord que FFmpeg est installé sur votre machine. Si ce n'est pas le cas, téléchargez-le et installez-le depuis le site officiel ou utilisez votre gestionnaire de paquets si vous êtes sous Linux.
-
Commande : Une fois FFmpeg installé, vous pouvez utiliser la commande suivante pour convertir un fichier audio :
Détaillons cette commande :
-i input_audio.ext: spécifie le fichier audio d'entrée nomméinput_audio.ext, oùextest l'extension du fichier (par exemple mp3, aac, flac).-ac 1: définit le nombre de canaux audio en sortie à 1 (mono).-ar 16000: définit la fréquence d'échantillonnage de l'audio en sortie à 16 kHz.output_audio.wav: le nom du fichier WAV en sortie.
-
Exécution : Remplacez
input_audio.extpar le nom et l'extension de votre fichier audio source, puis exécutez la commande. FFmpeg traitera ensuite le fichier et produira le fichier WAV converti sous le nomoutput_audio.wav.
Pensez à vous placer (via la ligne de commande) dans le répertoire contenant votre fichier audio, ou à indiquer le chemin complet dans la commande, pour que cela fonctionne correctement.
Appeler l'API avec curl
- Prérequis :
Assurez-vous que curl est installé sur votre système.
Utilisez éventuellement jq pour formater la sortie JSON.
Définissez les variables d'environnement appropriées dans votre shell.
- Appel synchrone simple :
Cela renverra un tableau JSON avec la structure suivante :
- Asynchrone avec diarisation :
L'API renverra immédiatement :
jobid: un UUID représentant l'exécution du jobestimated_time: estimation prudente du temps de transcription en secondes. Il est fortement recommandé d'interroger le job après ce délai.
Récupérer la transcription :
Cela renverra un tableau JSON avec la structure suivante :
API WebSocket Voxist
Avec l'API websocket
- Payload :
Le premier message websocket envoyé est :
- punctuation :
[true, false]: active la ponctuation dans le résultat (par défaut : false) - lang :
["fr", "en", "es", "pt", "it", "de", "pl"]: définit la langue de l'audio en entrée (par défaut : "en") - sample_rate :
[8000, 16000]: la valeur par défaut est 8 kHz
Appeler l'API en Python
- Prérequis :
Installez les paquets requis :
- Code :
Merci de bien vouloir remplacer :
<path_to_audio_file>- ex : audios/audio-sample-en.wav<ovh_app_endpoint>- ex : 98b38dff-1db6-4250-96d9-02512251f247.app.gra.ai.cloud.ovh.net
Exécutez le code avec python3 asr-test.py
La transcription commence à s'afficher en continu sur la sortie standard.
Votre avis nous intéresse !
N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :
- Sur le serveur Discord OVHcloud