G
O que é Groq?
O Groq roda modelos abertos em seus próprios chips LPU personalizados, em vez de GPUs padrão, entregando velocidades de inferência muito mais rápidas do que as APIs de nuvem típicas. É uma escolha popular quando a experiência do usuário de uma aplicação depende de respostas quase instantâneas do modelo.
Principais recursos
- Geração de tokens extremamente rápida em comparação à inferência típica em GPU
- Acesso hospedado a modelos abertos populares, como Llama e Mixtral
- API simples e compatível com a da OpenAI, para facilitar a migração
- Plano gratuito generoso o suficiente para prototipar a maioria das aplicações
- Baixa latência consistente mesmo sob alta carga simultânea
Primeiros passos
- Cadastre-se em groq.com e gere uma chave de API gratuita
- Escolha um modelo aberto hospedado que se encaixe na sua tarefa
- Chame a API usando a interface compatível com a da OpenAI
- Compare a latência com seu provedor atual antes de trocar
Groq Preços
No seat fee. Official production list, September 2026: GPT-OSS 20B $0.075 / $0.30 per 1M; GPT-OSS 120B $0.15 / $0.60; Whisper v3 $0.111/hour, turbo $0.04/hour.
Free tier has org rate limits. Developer unlocks Batch/Flex and higher RPM.
Cache or Batch each cut 50%, not both. Llama 8B/70B: sales only.
| Plano | Preço | Ideal para |
|---|---|---|
| Free | $0 + org rate limits | Latency tests and light prototypes |
| GPT-OSS 20B | $0.075 / $0.30 per 1M | Fast default text (~1000 t/s) |
| GPT-OSS 120B | $0.15 / $0.60 per 1M | Heavier open-weight quality (~500 t/s) |
| Whisper turbo | $0.04 / audio hour | Cheap transcription |
| Developer / Enterprise | Card or commit | Batch, Flex, leftover Llama SKUs |
Nossa opinião: Groq is a speed and price play on open models, not a frontier-lab catalog. Start on GPT-OSS 20B. If your repo still says Llama 8B Instant, fix the model id before you debug 'the API is down'.
Os preços mudam com frequência. Confira o site oficial acima para condições atuais antes de decidir.
Casos de uso
- Agentes de voz em tempo real que precisam de respostas quase instantâneas
- Aplicações interativas em que a latência afeta diretamente a experiência do usuário
- Hospedagem econômica de modelos de peso aberto em escala
- Processamento em lote de alto rendimento com restrições de tempo apertadas
Groq comparado
| Ferramenta | Comparação |
|---|---|
| Groq | Inferência de latência ultrabaixa em hardware LPU personalizado. |
| Together AI | seleção de modelos mais ampla, hardware diferente |
| OpenRouter | roteia entre vários provedores em vez de um só |
Perguntas frequentes
Dá para usar Groq de graça?
Os planos do Groq: Plano gratuito, com preços de API por uso. Preços e limites do plano gratuito mudam com o tempo, então confira o site oficial acima para os detalhes mais atuais.
Para que serve o Groq?
Inferência de latência ultrabaixa em hardware LPU personalizado.
Para quem o Groq é melhor?
Groq é ideal para Agentes de voz em tempo real que precisam de respostas quase instantâneas.
Quais são as alternativas ao Groq?
As alternativas mais comparadas são Together AI e OpenRouter; confira a comparação acima para ver as diferenças.
Quanto custa o Groq?
There is no monthly Groq subscription. Self-serve production text is GPT-OSS 20B at $0.075/$0.30 per million tokens or 120B at $0.15/$0.60. A free key exists with rate limits. Llama 3.1 8B and 3.3 70B are no longer on Free/Developer as of 16 August 2026.
Ferramentas relacionadas
Última revisão: 2026-09 · Revisado editorialmente pela AIKetra · Como avaliamos as ferramentas
T
O