Kimi K3 open weight: o modelo aberto da Moonshot e como usá-lo em produção

Kimi K3 open weight: o modelo aberto da Moonshot e como usá-lo em produção

14 min de leitura
  • kimi-k3
  • moonshot
  • open-weight
  • ia
  • llm
  • inference
  • agentes
  • coding

Em 27 de julho de 2026 a Moonshot AI publicou os pesos abertos do Kimi K3, o primeiro modelo da classe ~3T disponível para download. Em poucos dias já estava em APIs e providers de inference no mundo todo.

Aqui você encontra o que é o Kimi K3, por que open weight importa, forças e fraquezas, preços estimados e recomendações práticas. Para integrar Kimi K3 no seu produto, fale comigo.

O que é o Kimi K3

Modelo multimodal MoE da Moonshot com ~2.8T parâmetros, contexto de 1M tokens e visão nativa. Focado em trabalho agentic de longo horizonte: repos grandes, tools, debug com logs/imagens.

  • Portabilidade entre API e self-host.
  • Competição de preço entre vários hosts.
  • Controle de dados na sua infra.
  • Cache barato (~$0.30/M) para agentes.

Onde é forte

  • Coding agentic com contexto enorme.
  • Visão nativa + ferramentas.
  • Multi-provider no dia zero.
  • Caminho self-host para quem tem cluster.

Prós e contras

Prós

  • Open weight frontier competitivo.
  • Lista oficial ~$3 / $15 por 1M tokens.
  • Menos vendor lock-in.
  • Multimodal + 1M de contexto.

Contras

  • Self-host exige cluster multi-nó.
  • Tooling ainda estabilizando pós-lançamento.
  • Latência/uptime variam por provider.
  • Não vence todo benchmark fechado.

Preços estimados (jul/2026)

ProviderInput /MOutput /MCache /MNotas
Moonshot AI$3.00$15.00$0.30Preço oficial
Fireworks$3.00$15.00$0.30Bom equilíbrio
Together$3.00$15.00$0.30Alternativa sólida
Baseten$3.00$15.00$0.30Managed/dedicated
Fireworks Fast$4.50$22.50$0.45Premium de velocidade
Modaltoken-basedtoken-basedShared API day-0
OpenRouterpor hostpor hostpor hostRoteia entre hosts

Recomendações

  1. Use para agentes de código com muito contexto e cache.
  2. Evite se esperava rodar em uma única GPU.
  3. Abstrair providers no backend com fallback.
  4. Medir cache hit, latência p95 e erros de tool-call.

Quer desenvolver aplicações com Kimi K3? Entre em contato.

Conecte com contato, dados e IA e Claude Opus 5 .

Perguntas frequentes

Kimi K3 é grátis por ser open weight?

Não. Os pesos são baixáveis, mas servir o modelo custa GPUs. APIs cobram por token.

Qual o preço da API?

Cerca de $3 input / $15 output por 1M tokens, com cache ~$0.30/M. Tiers Fast podem custar mais.

Dá para hospedar em um servidor só?

Na prática, não: o checkpoint passa de 1 TB e exige cluster multi-nó.

É melhor que Opus 5 ou GPT-5.6 Sol?

Depende do caso. Avalie com tarefas reais do seu produto.

Você integra isso na minha aplicação?

Sim. Comece pela página de contato com o caso de uso e o stack.