Soumettre un outil →
Groq logoG

Groq

par Groq

Une inférence à latence ultra-faible sur du matériel LPU sur mesure.

API de modèles & Infrastructure Offre gratuite, plus une tarification API à l'usage

Qu'est-ce que Groq?

Groq exécute des modèles ouverts sur ses propres puces LPU sur mesure plutôt que sur des GPU classiques, ce qui offre des vitesses d'inférence bien supérieures à celles des API cloud habituelles. C'est un choix populaire lorsque l'expérience utilisateur d'une application dépend de réponses quasi instantanées du modèle.

Fonctionnalités principales

  • Une génération de jetons extrêmement rapide comparée à l'inférence GPU classique
  • Un accès hébergé à des modèles ouverts populaires comme Llama et Mixtral
  • Une API simple, compatible OpenAI, pour une migration facile
  • Une offre gratuite assez généreuse pour prototyper la plupart des applications
  • Une latence faible et constante, même sous forte charge concurrente

Premiers pas

  1. Inscrivez-vous sur groq.com et générez une clé API gratuite
  2. Choisissez un modèle ouvert hébergé adapté à votre tâche
  3. Appelez l'API via l'interface compatible OpenAI
  4. Comparez la latence avec votre fournisseur actuel avant de changer

Groq Tarifs

No seat fee. Official production list, September 2026: GPT-OSS 20B $0.075 / $0.30 per 1M; GPT-OSS 120B $0.15 / $0.60; Whisper v3 $0.111/hour, turbo $0.04/hour.

Free tier has org rate limits. Developer unlocks Batch/Flex and higher RPM.

Cache or Batch each cut 50%, not both. Llama 8B/70B: sales only.

PlanPrixIdéal pour
Free$0 + org rate limitsLatency tests and light prototypes
GPT-OSS 20B$0.075 / $0.30 per 1MFast default text (~1000 t/s)
GPT-OSS 120B$0.15 / $0.60 per 1MHeavier open-weight quality (~500 t/s)
Whisper turbo$0.04 / audio hourCheap transcription
Developer / EnterpriseCard or commitBatch, Flex, leftover Llama SKUs

Notre avis : Groq is a speed and price play on open models, not a frontier-lab catalog. Start on GPT-OSS 20B. If your repo still says Llama 8B Instant, fix the model id before you debug 'the API is down'.

Les prix changent souvent. Consultez le site officiel ci-dessus pour connaître les conditions actuelles avant de décider.

Cas d'usage

  • Agents vocaux en temps réel nécessitant des réponses quasi instantanées
  • Applications interactives où la latence affecte directement l'expérience utilisateur
  • Hébergement économique de modèles à poids ouvert à grande échelle
  • Traitement par lots à fort débit avec des contraintes de temps strictes

Groq comparé

OutilComparaison
GroqUne inférence à latence ultra-faible sur du matériel LPU sur mesure.
Together AIune sélection de modèles plus large, sur un matériel différent
OpenRouterun routage entre de nombreux fournisseurs plutôt qu'un seul

Questions fréquentes

Peut-on utiliser Groq gratuitement ?

Les plans de Groq : Offre gratuite, plus une tarification API à l'usage. Les prix et limites du plan gratuit évoluent avec le temps, consultez donc le site officiel ci-dessus pour les informations les plus récentes.

À quoi sert Groq ?

Une inférence à latence ultra-faible sur du matériel LPU sur mesure.

Pour qui Groq est-il le plus adapté ?

Groq est idéal pour Agents vocaux en temps réel nécessitant des réponses quasi instantanées.

Quelles sont les alternatives à Groq ?

Les alternatives les plus comparées sont Together AI et OpenRouter ; consultez le comparatif ci-dessus pour voir les différences.

Combien coûte Groq ?

There is no monthly Groq subscription. Self-serve production text is GPT-OSS 20B at $0.075/$0.30 per million tokens or 120B at $0.15/$0.60. A free key exists with rate limits. Llama 3.1 8B and 3.3 70B are no longer on Free/Developer as of 16 August 2026.

Outils similaires

Dernière révision : 2026-09 · Révisé par la rédaction d'AIKetra · Comment nous évaluons les outils