For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/ai-machine-learning/ai-endpoints-virtual-models.md.

AI Endpoints - Modèles virtuels

Voir en Markdown

Découvrez comment utiliser les modèles virtuels d'AI Endpoints

Info

AI Endpoints est couvert par les Conditions particulières OVHcloud Public Cloud (voir l’Annexe 10 – « Conditions spécifiques – AI Endpoints »).

Introduction

Choisir le bon grand modèle de langage (LLM) n’est pas toujours simple. Les modèles diffèrent par leurs points forts, leurs performances, leur coût et leur licence, et de nouveaux modèles apparaissent régulièrement, surpassant souvent les options précédentes. Cette évolution rapide rend essentiel d’adapter votre choix à vos besoins spécifiques, tout en restant prêt à évoluer à mesure que de meilleurs modèles apparaissent.

Pour faciliter cela, nous avons développé un système de modèles virtuels. Plutôt que de demander un modèle codé en dur, vous spécifiez les caractéristiques attendues du modèle dont vous avez besoin (taille, prix, etc.) et le système fait automatiquement correspondre votre demande à la meilleure option disponible dans notre catalogue. Dans ce guide, vous découvrirez les différentes capacités de cette fonctionnalité et comment l’utiliser avec votre code compatible OpenAI.

Prérequis

Les exemples fournis dans ce guide peuvent être utilisés avec l’un des environnements suivants :

Python
Curl

Un environnement Python avec le client openai.

pip install openai

Authentification et limitation de débit

La plupart des exemples fournis dans ce guide utilisent une authentification anonyme, ce qui simplifie leur usage mais peut entraîner des problèmes de limitation de débit. Si vous souhaitez activer l’authentification à l’aide de votre propre token, indiquez simplement votre clé API dans les requêtes.

Suivez les instructions du guide AI Endpoints - Premiers pas pour plus d’informations sur l’authentification.

DSL de modèle

Warning

Notre fonctionnalité de modèles virtuels permettant un changement de modèle dynamique, les caractéristiques du modèle (y compris la tarification ou la taille du contexte) peuvent changer lorsqu’un modèle plus récent est sélectionné pour traiter votre requête. Si vous préférez que certaines caractéristiques restent fixes, vous pouvez les verrouiller à l’aide des conditions de requête listées ci-dessous.

Lorsque vous demandez une génération LLM via notre endpoint unifié, vous pouvez fournir, dans le champ model compatible OpenAI, une requête DSL de modèle plutôt qu’un nom de modèle codé en dur.

Ces requêtes se composent de trois parties : tag, ranker et condition :

  • Tag : un tag peut être une série de modèles (llama, mistral, codestral, ...), un éditeur (meta-llama, mistralai, ...) ou un tag de cas d’usage (code_chat, code_completion, summarization, etc.). Vous trouverez les valeurs possibles dans notre catalogue.
  • Ranker : le ranker définit la capacité d’un modèle par rapport aux autres modèles. Nous prenons actuellement en charge les rankers suivants : fastest, cheapest, biggest, latest et smallest.
  • Condition : la condition vous permet de filtrer les modèles selon des exigences strictes sur certaines de leurs caractéristiques. Les spécifications actuellement prises en charge sont context_size, max_tokens, input_cost, params (nombre de paramètres) et endpoint_publication_date (date à laquelle nous avons rendu le modèle disponible sur AI Endpoints). Ces conditions prennent en charge les opérateurs de base (<, >, =).

Voici quelques exemples de requêtes et les modèles vers lesquels elles pointent actuellement. Veuillez noter que le modèle résolu peut changer, car nous mettons continuellement à jour notre catalogue avec de nouvelles sorties de modèles.

Requête de modèleModèle cible actuelUsage
code_completion@latestExemple : Qwen3.6-27BLe modèle le plus récemment publié, optimisé pour les tâches de complétion de code
meta-llama@latestExemple : Meta-Llama-3_3-70B-InstructLe modèle Llama le plus récemment publié
gpt-oss@cheapestExemple : gpt-oss-20bLe modèle GPT-OSS le moins cher
mistral@latest?context_size>100000Exemple : Mistral-Small-3.2-24B-Instruct-2506Le dernier modèle Mistral avec une fenêtre de contexte supérieure à 100k tokens
qwen@biggest?input_cost<0.5Exemple : Qwen3-Coder-30B-A3B-InstructLe plus grand modèle Qwen dont le coût du token d’entrée est inférieur à 0,50 € par million de tokens

Vous pouvez consulter notre catalogue pour en savoir plus sur les différentes caractéristiques des modèles.

Exemple d’utilisation

Les exemples de code suivants illustrent une manière simple d’interroger notre API à l’aide d’une requête de modèle.

Python
Curl
import os
from openai import OpenAI

url = "https://oai.endpoints.kepler.ai.cloud.ovh.net/v1"

client = OpenAI(
    base_url=url,
    api_key=os.getenv("OVH_AI_ENDPOINTS_ACCESS_TOKEN")
)

def chat_completion(new_message: str) -> str:
     history_openai_format = [{"role": "user", "content": new_message}]
     result = client.chat.completions.create(
         model="mistral@latest",
         messages=history_openai_format,
         temperature=0,
         max_tokens=1024
     )
     return result.model, result.choices.pop().message.content

if __name__ == '__main__':
    model, message = chat_completion("Explain gravity for a 6 years old")
    print(f"Model: {model}:", message)

Résultat :

Model: Mistral-Small-3.2-24B-Instruct-2506: Sure! Here’s a simple way to explain gravity to a 6-year-old:

**"Gravity is like a big, invisible hug from the Earth! It’s what keeps us from floating away into space. When you jump, gravity pulls you back down to the ground. It’s also why things fall—like when you drop your toy, it doesn’t float up, it falls down because of gravity. Even the Moon stays close to Earth because of gravity!"**

You can also add:
- *"If you throw a ball up, gravity pulls it back down."*
- *"Without gravity, we’d all be floating like astronauts in space!"*

Would you like a fun example or a little experiment to go with it? 😊

Conclusion

Utiliser les modèles virtuels d’OVHcloud AI Endpoints vous permet de rester à jour avec les meilleurs LLM disponibles sans avoir à modifier votre code à chaque nouvelle sortie. En définissant vos exigences via des tags, des rankers et des conditions, vous pouvez garantir que votre application s’exécute toujours sur le modèle le plus adapté à vos besoins, que vous privilégiiez la vitesse, le coût, la taille ou les capacités. Cette flexibilité facilite la création, la maintenance et la mise à l’échelle de solutions propulsées par l’IA au fil du temps.

Aller plus loin

Pour découvrir comment créer des applications complètes et performantes avec AI Endpoints, explorez nos guides AI Endpoints dédiés.

Pour une formation ou une assistance technique sur la mise en œuvre de nos solutions, contactez votre commercial ou consultez la page Professional Services pour obtenir un devis et faire analyser votre projet par nos experts.

Votre avis nous intéresse !

N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :

Cette page vous a-t-elle aidé ?