G
Qué es Groq?
Groq ejecuta modelos abiertos en sus propios chips LPU personalizados en lugar de GPU estándar, lo que ofrece velocidades de inferencia mucho más rápidas que las API en la nube habituales. Es una opción popular cuando la experiencia de usuario de una aplicación depende de respuestas del modelo casi instantáneas.
Funciones principales
- Generación de tokens extremadamente rápida en comparación con la inferencia típica en GPU
- Acceso alojado a modelos abiertos populares como Llama y Mixtral
- API sencilla y compatible con OpenAI para facilitar la migración
- Nivel gratuito lo bastante generoso para crear prototipos de la mayoría de aplicaciones
- Latencia baja y constante incluso bajo una carga concurrente elevada
Primeros pasos
- Regístrate en groq.com y genera una clave de API gratuita
- Elige un modelo abierto alojado que se ajuste a tu tarea
- Llama a la API usando la interfaz compatible con OpenAI
- Compara la latencia con tu proveedor actual antes de cambiarte
Groq Precios
No seat fee. Official production list, September 2026: GPT-OSS 20B $0.075 / $0.30 per 1M; GPT-OSS 120B $0.15 / $0.60; Whisper v3 $0.111/hour, turbo $0.04/hour.
Free tier has org rate limits. Developer unlocks Batch/Flex and higher RPM.
Cache or Batch each cut 50%, not both. Llama 8B/70B: sales only.
| Plan | Precio | Ideal para |
|---|---|---|
| Free | $0 + org rate limits | Latency tests and light prototypes |
| GPT-OSS 20B | $0.075 / $0.30 per 1M | Fast default text (~1000 t/s) |
| GPT-OSS 120B | $0.15 / $0.60 per 1M | Heavier open-weight quality (~500 t/s) |
| Whisper turbo | $0.04 / audio hour | Cheap transcription |
| Developer / Enterprise | Card or commit | Batch, Flex, leftover Llama SKUs |
Nuestra opinión: Groq is a speed and price play on open models, not a frontier-lab catalog. Start on GPT-OSS 20B. If your repo still says Llama 8B Instant, fix the model id before you debug 'the API is down'.
Los precios cambian con frecuencia. Consulta el sitio oficial de arriba para conocer las condiciones actuales antes de decidir.
Casos de uso
- Agentes de voz en tiempo real que necesitan respuestas casi instantáneas
- Aplicaciones interactivas donde la latencia afecta directamente a la experiencia de usuario
- Alojamiento rentable de modelos de pesos abiertos a gran escala
- Procesamiento por lotes de alto rendimiento con plazos de tiempo ajustados
Groq comparado
| Herramienta | Comparación |
|---|---|
| Groq | Inferencia de latencia ultrabaja en hardware LPU personalizado. |
| Together AI | selección de modelos más amplia, hardware distinto |
| OpenRouter | enruta entre muchos proveedores en lugar de uno solo |
Preguntas frecuentes
¿Se puede usar Groq gratis?
Los planes de Groq: Nivel gratuito, precios de API según uso. Los precios y límites del plan gratuito cambian con el tiempo, así que consulta el sitio oficial de arriba para los detalles más actuales.
¿Para qué se usa Groq?
Inferencia de latencia ultrabaja en hardware LPU personalizado.
¿Para quién es mejor Groq?
Groq es ideal para Agentes de voz en tiempo real que necesitan respuestas casi instantáneas.
¿Cuáles son las alternativas a Groq?
Las alternativas más comparadas son Together AI y OpenRouter; consulta la comparativa de arriba para ver las diferencias.
¿Cuánto cuesta Groq?
There is no monthly Groq subscription. Self-serve production text is GPT-OSS 20B at $0.075/$0.30 per million tokens or 120B at $0.15/$0.60. A free key exists with rate limits. Llama 3.1 8B and 3.3 70B are no longer on Free/Developer as of 16 August 2026.
Herramientas relacionadas
Última revisión: 2026-09 · Revisado editorialmente por AIKetra · Cómo evaluamos las herramientas
T
O