O Kimi K3 é um daqueles lançamentos que se tornam mais interessantes quando se vai além dos números principais. Sim, ele possui 2,8 trilhões de parâmetros no total, uma janela de contexto de 1.048.576 tokens e entrada de imagens. Mais importante ainda, os primeiros resultados de benchmark indicam que se trata de um modelo desenvolvido para tarefas exigentes de programação, pesquisa e trabalho intelectual, e não para conversas rápidas e superficiais.
Minha opinião: comece com o K3 se você escreve ou depura código, trabalha com grandes conjuntos de dados de pesquisa ou fornece regularmente à IA mais material do que uma janela de bate-papo normal consegue processar. Os resultados da Moonshot AI em programação e trabalho de conhecimento são excelentes, e os primeiros testes de desempenho realizados por terceiros reforçam a ideia de que este é um modelo de ponta. A desvantagem é que o K3 pensa intensamente por padrão, por isso faz mais sentido para trabalhos importantes do que para rascunhos rápidos.
Se o K3 é o tipo de modelo que você quer experimentar para trabalhos sérios, GlobalGPT oferece uma maneira mais abrangente de desenvolver projetos em torno dele. Um único espaço de trabalho abrange bate-papo, pesquisa, redação, ajuda com programação, revisão de documentos, geração de imagens, criação de vídeos e troca de modelos, de modo que O K3 é capaz de lidar com tarefas de raciocínio em contextos extensos enquanto o GPT, o Claude, o Gemini, o Perplexity e outros modelos cuidam das etapas em que se destacam mais. Com cobrança anual, a versão Pro é $10,80/mês e o plano “Unlimited” é $25/mês, tornando o GlobalGPT uma maneira prática de utilizar várias ferramentas líderes de IA sem precisar pagar por uma assinatura separada para cada etapa do fluxo de trabalho.
O que é o Kimi K3?
O Kimi K3 é o principal modelo de raciocínio da Moonshot AI, lançado em 16 de julho de 2026. O postagem oficial de lançamento descreve um modelo de mistura de especialistas com um total de 2,8 trilhões de parâmetros, Kimi Delta Attention, Attention Residuals, compreensão visual nativa e uma janela de contexto de um milhão de tokens. Ele aceita texto e imagens e retorna texto.
O título “2.8T” precisa de uma pequena explicação. O K3 não utiliza todos os parâmetros para cada token. A Moonshot afirma que ele encaminha cada etapa por meio de 16 dos 896 especialistas, o que é uma maneira prática de alocar mais capacidade para solicitações complexas, sem tratar cada pequena consulta como uma tarefa pesada.
Visão geral do Kimi K3
| Lançamento | 16 de julho de 2026 |
|---|---|
| Total de parâmetros | 2,8 T de MoE; 16 dos 896 especialistas estão ativos |
| Contexto | 1.048.576 tokens |
| Modalidades | Entrada de texto e imagem; saída de texto |
| API de lançamento | Apenas raciocínio máximo; configurações de amostragem fixas |
O que a arquitetura está tentando resolver
O Kimi Delta Attention e o Attention Residuals são as respostas da Moonshot para um problema comum em contextos longos: manter as informações relevantes disponíveis quando a entrada se torna muito grande. A Moonshot afirma que a abordagem melhora a eficiência de escalabilidade em comparação com o Kimi K2. Trata-se de uma afirmação do fornecedor; portanto, deve ser interpretada como uma intenção de projeto, e não como um resultado de eficiência reproduzido de forma independente.
A API de lançamento tem uma consequência mais imediata para os compradores. Sua guia rápido oficial suporta apenas máx. raciocínio, com configurações fixas de solicitação, incluindo temperatura 1.0, top_p 0,95, e n 1. Em outras palavras, o K3 é voltado, em primeiro lugar, para problemas complexos; ainda não é possível simplificá-lo para uma reescrita rápida e barata.
Testes de desempenho do Kimi K3: Dados oficiais x resultados independentes
O K3 chegou com um histórico de benchmarks mais abrangente do que a maioria dos lançamentos. Os próprios resultados da Moonshot abrangem programação, agentes, navegação, planilhas e trabalho de conhecimento. A Artificial Analysis acrescenta um índice de inteligência independente, enquanto a Arena oferece uma visão preliminar de como as pessoas reagem aos resultados apresentados. Em conjunto, os números constituem um forte argumento para incluir o K3 na lista de finalistas.
Resultados divulgados pela Moonshot AI
O Moonshot apresenta resultados particularmente sólidos em tarefas que envolvem programação de longo prazo, trabalho com agentes, pesquisa na web e trabalho de conhecimento. Os destaques incluem 88,3 no Terminal-Bench 2.1, 81,2 no FrontierSWE, 77,8 no Program Bench, um Elo GDPval-AA v2 de 1.668 e 91,2 no BrowseComp. Seu gráfico de agentes visuais apresenta 91,3 em questões de pesquisa do CharXiv com o uso de ferramentas.
A conclusão prática é bem direta. O K3 parece especialmente bem posicionado para codificação em várias etapas, trabalhos com grande volume de pesquisa e tarefas nas quais o modelo precisa manter um amplo contexto em vista. O Moonshot também o coloca no grupo de ponta, em vez de afirmar que ele vence em todas as categorias, o que parece ser a maneira correta de posicionar um novo modelo com um público-alvo tão amplo.


| Referência | Resultado divulgado |
|---|---|
| Banco de terminais 2.1 | 88.3 |
| FrontierSWE | 81.2 |
| GDPval-AA v2 | 1668 Elo |
| NavegarComp | 91.2 |
| CharXiv RQ com ferramentas | 91.3 |
Os resultados relatados pelos fornecedores constituem evidências úteis para triagem, mas não representam uma replicação independente.
O K3 já está entre os melhores
Um dos primeiros sinais mais evidentes é a posição em que o K3 aparece fora das próprias paradas da Moonshot. Ele obteve 57 pontos na Índice de Inteligência Artificial em Análise, ficando em quarto lugar entre 189 modelos comparáveis, segundo dados coletados em 17 de julho de 2026. Trata-se de uma estreia sólida para um novo lançamento, especialmente porque o K3 tem como alvo o segmento mais exigente do mercado: programação, tarefas do tipo “agente”, raciocínio científico e análise complexa, em vez de simples conversas.
Seu perfil de desempenho também faz sentido. O K3 começa a responder em cerca de 1,99 segundos e gera aproximadamente 62 tokens de saída por segundo, mas utiliza mais saída do que a média dos modelos comparados. Em linguagem simples, ele foi projetado para resolver um problema em vez de correr atrás de uma resposta rápida. É exatamente isso que você precisa ao depurar código, analisar um relatório ou compilar uma pesquisa. Para uma reescrita rápida ou uma resposta de uma linha, provavelmente é mais potência do que você precisa.

É difícil ignorar seus primeiros resultados no desenvolvimento web
O K3 estreou em primeiro lugar no quadro preliminar Code WebDev da Arena, com uma pontuação de 1.679 +17/-17, com base em 1.757 votos. Seu resultado geral na categoria de texto foi inferior, ficando em nono lugar com 1.486 ±11, com base em 3.024 votos. Essa divisão revela algo interessante: o K3 não está tentando vencer apenas com conversas casuais. Sua vantagem inicial fica evidente quando a tarefa se assemelha a um trabalho real com produtos.
Se você desenvolve front-ends, cria protótipos de ideias de produtos ou passa o dia todo fazendo a ponte entre o código e os requisitos do produto, vale a pena experimentar o K3 agora. O indicador do WebDev também coincide com os próprios resultados de programação da Moonshot, portanto, trata-se de mais do que apenas um número chamativo. Para ter uma visão mais ampla do mercado, consulte nosso guia sobre os melhores modelos de IA.

- Os resultados do lançamento do K3 são mais expressivos nas áreas de programação, agentes, navegação e trabalho de conhecimento.
- Dados de fontes independentes confirmam sua posição entre os modelos mais eficientes disponíveis atualmente.
- A janela de contexto de 1M oferece uma vantagem real em tarefas que exigem grande volume de dados de origem.
- Use-o quando um raciocínio mais aprofundado justifique o tempo e o custo de produção adicionais.
Onde o Kimi K3 parece ser mais útil
O K3 não pretende ser a resposta padrão para todas as tarefas de IA. Seus primeiros sinais mais promissores apontam para trabalhos que exigem real profundidade: documentos extensos, síntese de pesquisas, código e projetos com várias etapas. É por aí que eu começaria a usá-lo.
A janela de contexto de 1 milhão de tokens oferece ao K3 espaço para relatórios, pacotes de pesquisa e históricos detalhados de projetos, sem precisar dividir tudo em prompts minúsculos.
Documentos longos: um ponto de partida natural
Uma janela de 1 milhão de tokens oferece ao K3 espaço para relatórios anuais, anexos jurídicos, pacotes de pesquisa e históricos de grandes projetos. Só isso já o torna atraente se você está cansado de dividir documentos em fragmentos antes de fazer uma pergunta. Seus parâmetros de referência para trabalho de conhecimento reforçam esse ponto. Para a análise de documentos, eu usaria o K3 para uma primeira análise e, em seguida, verificaria os números e as referências de página mais importantes. Nosso guia para Como os assistentes de IA leem arquivos PDF explica por que a etapa de extração é tão importante quanto o modelo.
O K3 parece ser particularmente útil para transformar um grande conjunto de fontes em um briefing claro, mapear argumentos contraditórios e identificar o fio condutor em meio a uma pesquisa desorganizada.
Síntese de pesquisas: útil para a fase intermediária, que costuma ser confusa
A pesquisa geralmente fica complicada no meio do caminho: muitas fontes, pequenas divergências e muito contexto para assimilar de uma só vez. O BrowseComp, a pontuação de inteligência independente e a janela de contexto do K3 tornam a ferramenta uma boa opção para essa etapa do trabalho. Use-a para mapear um argumento, identificar divergências e transformar um grande conjunto de fontes em um resumo útil. A ferramenta de pesquisa na web do Moonshot ainda estava sendo atualizada no momento do lançamento; portanto, para trabalhos com prazos apertados, traga suas próprias fontes e mantenha-as à mão.
Os benchmarks de programação do K3 e os resultados iniciais no desenvolvimento web o tornam uma opção sólida para correção de bugs, desenvolvimento de recursos e projetos com mais de um componente interligado.
Programação: o motivo mais claro para experimentar
O conjunto oficial de ferramentas de programação do K3 e seu resultado no Arena WebDev são a razão mais clara para experimentá-lo. Esse é o modelo que eu escolheria quando a solicitação envolve várias etapas: entender a base de código, rastrear um bug, fazer uma alteração e explicar as vantagens e desvantagens. Um teste adequado deve utilizar um bug real ou uma alteração do tamanho de um recurso do seu próprio repositório, e não um prompt genérico de programação. É aí que seu contexto extenso e sua capacidade de raciocínio têm a chance de mostrar seu valor.
A inserção nativa de imagens torna o K3 um ótimo aliado para relatórios, gráficos, diagramas e capturas de tela quando você precisa obter rapidamente o essencial da matéria.
Gráficos e análise visual: úteis para uma análise inicial
A capacidade de receber imagens nativas torna o K3 mais útil do que um modelo apenas de texto quando um relatório está repleto de gráficos, diagramas e capturas de tela. Os resultados do agente visual do Moonshot são animadores, especialmente para equipes que dedicam mais tempo a apresentações e relatórios do que a arquivos CSV organizados. Eu o usaria para apresentar a história em um gráfico e, em seguida, criaria o hábito de verificar rapidamente os eixos, a legenda e as unidades antes de transmitir a conclusão.
O K3 oferece espaço suficiente para notas de reuniões, resumos de vários documentos e pacotes de análise que sobrecarregariam um chat comum.
Trabalho em escritório e com vários arquivos: uma estratégia sensata para aumentar a produtividade
Notas de reuniões, resumos de vários documentos e pacotes de análise são todos casos de uso sensatos para o K3. O modelo possui margem de manobra contextual para o material de origem e referências de trabalho profissional que conferem credibilidade à ideia. A experiência completa dependerá dos arquivos e das ferramentas envolvidas, mas, para o trabalho intelectual do dia a dia, este é um modelo que eu colocaria no primeiro grupo a ser testado. Se você precisar processar vários arquivos de origem, este guia para trabalhar com uma pasta inteira é uma lista de verificação útil para saber o que verificar.
O K3 é uma opção interessante quando um agente precisa coletar informações contextuais, raciocinar ao longo de várias etapas e concluir uma tarefa bem definida.
Fluxos de trabalho de agentes: promissores quando a tarefa tem um objetivo claro
Os parâmetros de referência do agente K3 o tornam uma opção interessante para trabalhos com um objetivo final bem definido: investigar uma questão, reunir o material relevante, fazer uma alteração ou preparar um resumo. O Kimi Work e o Kimi Code podem oferecer ferramentas úteis em torno do modelo, enquanto os usuários da API podem criar seu próprio caminho. Os melhores resultados serão obtidos ao definir para o agente um objetivo claro e uma forma de verificar seu trabalho. Para agentes voltados para pesquisa, nosso guia detalhado sobre o fluxo de trabalho de pesquisa aborda os hábitos que vale a pena manter.
O que experimentar primeiro
O que experimentar primeiro
| Fluxo de trabalho | Por que o K3 é a escolha certa | Melhor tarefa inicial |
|---|---|---|
| Codificação | O sinal inicial mais forte | Uma alteração que se trata de um verdadeiro bug ou de uma funcionalidade |
| Documentos longos | Janela de contexto de 1M | Um relatório anual ou um pacote de pesquisa |
| Pesquisa | É bom para reunir fontes concorrentes | Uma apresentação baseada em fontes |
| Análise visual | Entrada de imagem nativa | Um relatório repleto de gráficos |
| Trabalho de escritório | Margem de contexto útil | Notas da reunião e arquivos complementares |
Motivos para avaliar
- Janela de contexto de 1 milhão de tokens
- Sinal de codificação inicial forte
- Entrada de texto e imagem
- Resultado competitivo do índice independente
Motivos para ter cuidado
- Raciocínio máximo apenas no lançamento
- Tôkens de saída $15/M
- A confiabilidade no nível da tarefa não foi verificada aqui
- Os pesos e o relatório técnico não foram divulgados no momento da captura
Limitações do Kimi K3 e ressalvas sobre o dia do lançamento
O principal que você precisa saber antes de adotar o K3 é que ele foi desenvolvido para trabalhos exigentes. O raciocínio máximo está sempre ativado, e os controles de amostragem fixos oferecem menos flexibilidade para ajustar velocidade, custo e estilo de resposta. Essa é uma troca justa para depuração ou pesquisa. É um recurso exagerado para classificações de alto volume, reescritas curtas ou tarefas em que uma resposta longa é, em grande parte, um desperdício.
A geração de tokens é a parte mais cara da conta. A um custo de $15 por milhão de tokens de saída, um modelo que pensa em voz alta pode se tornar caro rapidamente. Isso não é necessariamente um impedimento: alguns centavos ou dólares podem ser insignificantes quando poupam uma tarde de trabalho a um engenheiro. Isso significa que você deve analisar tanto a entrada quanto a saída das tarefas que executa semanalmente antes de definir um orçamento.
Em terceiro lugar, a questão do peso aberto do K3 ainda era uma promessa na data da apresentação das evidências. A Moonshot informou que os pesos definitivos seriam divulgados até 27 de julho de 2026, juntamente com mais detalhes técnicos. Quando verificado em 17 de julho, o site oficial Organização Moonshot AI Hugging Face não mencionou o K3. Até que o repositório, a licença, a ficha técnica e os arquivos estejam disponíveis, a expressão “lançamento planejado na categoria open-weight” é mais precisa do que “disponível para hospedagem própria”.”


Limites a serem observados no dia do lançamento
- A API suporta apenas raciocínio máximo e configurações fixas de amostragem.
- O custo de saída pode ser o fator determinante em um fluxo de trabalho de raciocínio extenso.
- A ferramenta oficial de busca na web foi marcada como atualizada.
- Um recurso do produto ou uma integração com terceiros não é, automaticamente, uma funcionalidade do modelo básico.
Preços do Kimi K3
A Moonshot divulgou os preços da API Kimi K3 em $0,30 por milhão de tokens de entrada com acerto no cache, $3 por milhão de tokens de entrada sem cache e $15 por milhão de tokens de saída em 17 de julho de 2026. A janela de contexto é de 1.048.576 tokens. Esses são os preços de tabela oficiais da API, antes de impostos e de qualquer margem de lucro de provedores terceirizados.

Preços oficiais da API por milhão de tokens
O custo é, em grande parte, uma questão de produção
O cálculo é simples: tokens de entrada na taxa de cache relevante, mais tokens de saída a $15 por milhão. Uma solicitação com 100.000 tokens de entrada não armazenados em cache e 10.000 tokens de saída resulta em cerca de $0,45. Um relatório de 200.000 tokens com 5.000 tokens de saída equivale a cerca de $0,675. Um milhão de tokens de entrada não armazenados em cache e 50.000 tokens de saída resultariam em cerca de $3,75. Esses são exemplos aritméticos, não faturas de um teste privado.
Exemplos ilustrativos de custos de API
| Solicitação | Custo estimado |
|---|---|
| 100 mil entradas sem cache + 10 mil saídas | $0.45 |
| 200 mil entradas não armazenadas em cache + 5 mil saídas | $0.675 |
| 1 milhão de entradas sem cache + 50 mil saídas | $3.75 |
O acesso para consumidores e o acesso à API são compras diferentes
Um plano para consumidores, uma conta direta de API e uma assinatura multimodelo de terceiros resolvem problemas diferentes. Os planos para consumidores costumam ser a opção mais simples para chat e arquivos; as APIs servem para criar fluxos de trabalho e rastrear tokens. Os direitos dos planos e a disponibilidade regional podem mudar; portanto, verifique a opção que você pretende usar antes de considerar um preço de lançamento como uma oferta permanente.
Escolha a rota de acesso para o trabalho
Planos para consumidores geralmente são a opção mais simples para bate-papo e arquivos. APIs servem para criar e avaliar fluxos de trabalho. Espaços de trabalho multimodelo pode ser útil quando você deseja comparar a mesma tarefa real entre modelos. A disponibilidade e as cotas podem variar de acordo com o plano e a região.
Onde é possível experimentar o Kimi K3?
Você pode avaliar o K3 por meio dos produtos para consumidores ou da API da Moonshot, sujeito à disponibilidade e aos limites de uso de cada canal. Se sua dúvida prática for “qual modelo lida melhor com essa tarefa?”, um espaço de trabalho multimodelo pode ser a maneira mais prática de começar: use o mesmo prompt e os mesmos arquivos representativos e, em seguida, compare os resultados sem precisar reconfigurar a API para cada modelo.
Experimente o Kimi K3 em GlobalGPT se você quiser testá-lo junto com outros modelos disponíveis em um único espaço de trabalho. Essa é uma opção de acesso, não uma afirmação de que todos os planos incluem todos os recursos do K3 ou de que ele substitui uma API direta para desenvolvimento.
- Produtos de consumo inovadores para bate-papos gerais e fluxos de trabalho com arquivos.
- API do Moonshot para desenvolvimento, rastreamento de tokens e integrações personalizadas.
- Um espaço de trabalho multimodelo para comparar uma tarefa representativa entre os modelos disponíveis.
Quem deveria incluir o Kimi K3 na lista de finalistas?
O K3 é uma excelente opção para pesquisadores, analistas e desenvolvedores que trabalham regularmente com material de origem complexo ou projetos de grande porte. Também vale a pena experimentá-lo para relatórios repletos de gráficos e tarefas administrativas, quando o briefing for substancial o suficiente para se beneficiar de um raciocínio verdadeiro, em vez de uma resposta rápida baseada em modelos.
Eu procuraria outras alternativas se a prioridade fosse o menor custo de tokens possível, um modo leve para tarefas rotineiras ou pesos auto-hospedados já hoje. Todos os demais devem considerar o K3 como uma nova opção atraente: teste-o em uma tarefa real, compare o resultado com as ferramentas nas quais você já confia e veja se o raciocínio adicional vale a pena a espera.
Veredicto final
O Kimi K3 é um dos lançamentos de modelos mais interessantes do ano. Os primeiros números independentes e o sinal do WebDev corroboram o que a Moonshot afirma, enquanto a janela de contexto de 1 milhão oferece uma perspectiva prática clara. Comece pela programação, pesquisa e trabalho com documentos extensos; são nessas áreas que seu design parece mais útil.
O K3 não será a melhor opção para todas as solicitações, e seu preço não é o mesmo de um modelo de bate-papo casual. Mas, se o trabalho for complexo o suficiente para justificar um modelo que dedique tempo para refletir, ele merece um lugar no seu conjunto de ferramentas. A maneira mais simples de decidir é atribuir a ele o tipo de tarefa que normalmente atrasa sua equipe e comparar o resultado com o modelo que você usa atualmente.
Se você quiser uma maneira mais simples de comparar o caimento na prática, consulte os planos GlobalGPT e execute a mesma tarefa real nos modelos que você tem à disposição.
Perguntas frequentes
O que é o Kimi K3?
O Kimi K3 é o principal modelo de raciocínio da Moonshot AI, lançado em 16 de julho de 2026. A Moonshot afirma que ele possui 2,8 trilhões de parâmetros no total, aciona 16 dos 896 especialistas, aceita texto e imagens e suporta uma janela de contexto de 1.048.576 tokens.
O Kimi K3 é de código aberto ou de peso aberto?
A Moonshot AI informou que os pesos completos do K3 seriam divulgados até 27 de julho de 2026. Quando verificado em 17 de julho, a organização oficial Hugging Face não listava o K3. Até que o repositório e a licença sejam publicados, a divulgação planejada dos pesos abertos é a descrição mais precisa.
Quanto custa o Kimi K3?
O preço oficial da API registrado em 17 de julho foi de $0,30 por milhão de tokens de entrada armazenados em cache, $3 por milhão de tokens de entrada não armazenados em cache e $15 por milhão de tokens de saída. Impostos, margens de lucro dos provedores, cotas e preços regionais podem alterar o custo final.
Posso experimentar o Kimi K3 de graça?
A página de preços para consumidores da Kimi exibia um plano Adagio gratuito em 17 de julho, e o K3 também estava disponível por meio de planos pagos ou com cota. A disponibilidade gratuita pode ser limitada por região, capacidade e limite de uso; portanto, não se deve presumir que seja ilimitada.
O Kimi K3 realmente suporta uma janela de contexto de 1 milhão de tokens?
Sim. A página oficial de introdução rápida e preços indica uma janela de contexto de 1.048.576 tokens. Trata-se de uma capacidade máxima de contexto, não de uma garantia de que todas as respostas com documentos longos serão precisas ou totalmente citadas.
O Kimi K3 consegue analisar PDFs, gráficos e planilhas?
O K3 aceita texto e imagens, e o Moonshot apresenta os resultados em benchmarks de planilhas e agentes visuais. Esta análise não apresenta uma verificação no nível das tarefas de PDFs, gráficos ou planilhas; portanto, os usuários devem verificar os valores exatos, as referências de página, as legendas, as fórmulas e as linhas omitidas.
O Kimi K3 é bom para pesquisa e trabalho de escritório?
Com base nos resultados dos testes de desempenho disponíveis, o K3 merece ser considerado para trabalhos de pesquisa e de escritório, especialmente no caso de documentos longos e análises estruturadas. No entanto, ainda não foi comprovada sua precisão nas citações, sua confiabilidade no processamento de vários arquivos nem a qualidade dos resultados em um fluxo de trabalho específico.
Posso usar o Kimi K3 no Codex?
A Moonshot publica um guia de integração do Codex que utiliza o CC Switch para converter o tráfego da API de respostas do Codex em sugestões do Kimi Chat. O CC Switch é um software de terceiros; portanto, as organizações devem analisar sua rota de dados e os requisitos de segurança antes de utilizá-lo com repositórios ou documentos confidenciais.
Qual é a diferença entre o Kimi K3 e o Kimi Work?
O modelo é o Kimi K3. O Kimi Work é um ambiente de produto que combina modelos com arquivos, ferramentas, ações no navegador, criação de documentos do Office, tarefas agendadas e outros recursos de fluxo de trabalho. Um recurso apresentado no Kimi Work não é, necessariamente, uma funcionalidade de uma simples chamada à API do K3.


