Kimi K3 + Engenharia de Grafos: 85% de redução nos custos de tokens e 18% mais precisão

@noisyb0y1
INGLÊShá 3 dias · 22 de jul. de 2026
173K
211
28
14
489

TL;DR

Um guia abrangente para construir arquiteturas de IA usando Kimi K3 e Engenharia de Grafos, alcançando 85% menos custos de tokens e 18% mais precisão em comparação com o RAG tradicional.

A maioria das pessoas usa IA como um motor de busca caro. Abre um chat, faz uma pergunta, obtém uma resposta, fecha a aba. No dia seguinte, começam do zero porque a IA não se lembra de nada.

Mas há desenvolvedores ganhando $10.000 a $20.000 por mês simplesmente porque o sistema de IA deles responde duas vezes mais rápido, dá respostas mais precisas e custa 85% menos que o dos concorrentes. Eles não estão usando um modelo secreto. Eles construíram a arquitetura certa em torno de um modelo comum.

Chama-se Kimi K3 + Graph Engineering. A Microsoft passou anos provando que funciona – 85% menos custos, 18% mais precisão.

Aqui está como construir isso do zero em uma semana.

Por que o RAG tradicional para de funcionar em algum ponto

A maioria dos desenvolvedores constrói sistemas de IA da mesma forma. O usuário pergunta algo, o sistema pesquisa em documentos, encontra fragmentos de texto semelhantes, o modelo gera uma resposta. Funciona bem para perguntas simples. Desmorona completamente para perguntas complexas.

Pergunte "por que nossas vendas caíram em março?" e o RAG tradicional encontra documentos com as palavras "vendas" e "março". Ele encontra fragmentos. Ele não encontra a cadeia de causas.

text
1Resposta do RAG tradicional:
2Aqui estão 5 documentos mencionando vendas em março.
3
4Resposta do Graph Engineering:
5As vendas caíram devido a um atraso no lançamento
6causado por um problema com o fornecedor
7desencadeado por uma falha no armazém
8que gerou avaliações negativas
9que reduziu a conversão em 23%.

Mesmo modelo. Mesmos dados. Resultado completamente diferente – porque um sistema busca texto e o outro busca conexões entre fatos reais.

Isto é o que a Microsoft, Stanford e a Anthropic descobriram, cada uma de forma independente. E é por isso que os desenvolvedores que entendem isso estão se movendo mais rápido que todos os outros.

O que realmente é um grafo de conhecimento

Um grafo de conhecimento armazena informações como triplas:

text
1Sujeito → Relação → Objeto

Exemplos reais:

text
1Kimi K3 → desenvolvido por → Moonshot AI
2Kimi K3 → janela de contexto → 1 milhão de tokens
3Microsoft → construiu → GraphRAG
4GraphRAG → reduz custos em → 85%
5Anthropic → criou → Claude
6Claude → suporta → MCP

Cada informação é uma conexão explícita entre duas entidades. Não é um parágrafo de texto que pode conter essa informação em algum lugar – é um fato estruturado que você pode consultar diretamente.

text
1Banco de dados comum:
2Tabela de empresas
3Tabela de produtos
4Sem conexões explícitas entre eles
5
6Grafo de conhecimento:
7Empresa → criou → Produto
8Produto → compete com → Outro Produto
9Outro Produto → pertence a → Outra Empresa
10Empresa → investiu em → Outra Empresa

O grafo não apenas armazena fatos. Ele armazena como os fatos se conectam uns aos outros. É isso que torna o raciocínio complexo possível – e o que o RAG tradicional nunca pode fazer, não importa o quão bom seja o modelo.

O Stanford AI Lab define um grafo de conhecimento como um banco de dados estruturado onde a informação é representada como uma rede de entidades e relacionamentos em triplas sujeito-relação-objeto. Usado em busca, recomendações e tarefas onde você precisa encontrar conexões indiretas.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Por que o Kimi K3 é o modelo certo para esta arquitetura

A maioria dos modelos tem janelas de contexto de 128.000 a 200.000 tokens. O Kimi K3 tem um milhão. Este não é apenas um número impressionante – é uma vantagem arquitetônica especificamente para Graph Engineering.

Um grafo retorna subgrafos, cadeias de evidências, listas de entidades conectadas. Tudo isso ocupa espaço na janela de contexto. Com um contexto pequeno, você precisa cortar o grafo. Com um milhão de tokens, toda a parte relevante do grafo cabe em uma sessão.

text
1Arquitetura do Kimi K3:
22,8 trilhões de parâmetros totais
3896 especialistas em MoE, 16 ativos por token
4Janela de contexto de 1.048.576 tokens
5Análise de imagem nativa
6Kimi Delta Attention para sequências longas
7Attention Residuals para preservar sinais entre camadas

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention é um mecanismo híbrido que reduz o custo de trabalhar com sequências longas. Para Graph Engineering, isso significa que o sistema pode passar ao modelo subgrafos grandes, longas listas de evidências, dezenas de documentos e estrutura de repositórios sem aumentos de custo catastróficos.

Mas mesmo um milhão de tokens é memória temporária. Após a sessão, tudo desaparece.

text
1Contexto de 1M tokens = grande superfície de trabalho por sessão
2Grafo de conhecimento = memória estruturada permanente entre sessões

Kimi K3 fornece escala e raciocínio. Graph Engineering fornece memória e estrutura. Juntos, eles resolvem problemas diferentes ao mesmo tempo.

Documento 1 – Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

A Microsoft construiu o GraphRAG e o tornou open-source. Os números de sua pesquisa são a evidência mais concreta disponível sobre o que o Graph Engineering realmente entrega em comparação com o RAG tradicional.

A arquitetura converte texto não estruturado em um grafo de conhecimento completo:

text
1Carregar documentos
2
3Dividir documentos em chunks
4
5Extrair entidades e relações
6
7Construir grafo
8
9Detectar comunidades
10
11Gerar relatórios de comunidades
12
13Incorporar (embed) entidades e relatórios
14
15Busca Local / Busca Global

Insight chave da Microsoft: o RAG tradicional responde bem a perguntas locais – encontre informações sobre esta entidade específica. Ele falha em perguntas globais – quais são os principais padrões nestes 10.000 documentos, o que conecta esses eventos em todo o conjunto de dados.

Graph Engineering responde a ambas.

text
1Busca Local | o que aconteceu com o fornecedor X em março
2 | encontra o nó específico e suas conexões
3
4Busca Global | quais são os principais padrões de risco
5 | em todos os nossos relacionamentos com fornecedores
6 | encontra padrões em todo o grafo

Números reais da pesquisa ChatP&ID:

text
1Melhoria de precisão | 18% maior que a abordagem de documento bruto
2Redução de custo de token | 85% menor que carregar arquivos estruturados diretamente
3Custo por tarefa | aproximadamente $0,004 na configuração testada

Documento 2 – Três modos de combinar LLM e Grafo de Conhecimento

arxiv.org/abs/2306.08302

Um dos artigos teóricos mais fortes sobre a combinação de modelos de linguagem e grafos de conhecimento descreve três modos:

text
1Modo 1 – LLM aprimorado por KG
2O grafo fornece fatos e estrutura ao modelo
3O modelo gera melhores respostas
4
5Modo 2 – KG aumentado por LLM
6O modelo cria, limpa e expande o grafo
7O grafo melhora com o tempo
8
9Modo 3 – LLM + KG sinergizados
10Grafo e modelo melhoram um ao outro mutuamente
11Modo mais poderoso

Para Kimi K3 + Graph Engineering, o terceiro modo funciona melhor. Kimi K3 extrai novos fatos e os adiciona ao grafo. O grafo fornece a Kimi K3 contexto estruturado para raciocínio. O ciclo se repete e o sistema melhora a cada iteração.

Documento 3 – Memória Relacional para modelos de linguagem

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

A pesquisa mostra o que acontece quando você conecta um modelo de linguagem à memória relacional – um grafo de conhecimento de relacionamentos em vez de fragmentos de texto.

text
1Contexto de texto
2
3Extrair relações relevantes do grafo
4
5Memória Relacional
6
7Modelo de linguagem
8
9Geração mais coerente e precisa

Descoberta chave: modelos com acesso a estruturas de relacionamento explícitas produzem texto mais coerente e cometem menos erros lógicos do que modelos trabalhando apenas com texto.

Esta é a explicação científica para o porquê do Graph Engineering funcionar. O modelo não precisa inferir relacionamentos a partir do texto. Os relacionamentos são explícitos no grafo. O modelo os usa diretamente.

Publicado sob CC BY 4.0 – pode ser usado livremente com atribuição.

Documento 4 – Leis de Escala para Engenharia de Grafos de Conhecimento

arxiv.org/abs/2505.16276

Pesquisa que comparou 26 modelos open-source em tarefas de engenharia de grafos de conhecimento. A conclusão é uma das descobertas mais importantes no campo:

text
1Modelo maior + grafo ruim | resultados piores
2Modelo menor + grafo bom | resultados melhores

O grafo certo vence o modelo maior. Todas as vezes.

A mesma conclusão que a Microsoft alcançou com GraphRAG e a Anthropic alcançou com Claude Code – o sistema em torno do modelo determina a saída mais do que o próprio modelo. Graph Engineering é a implementação mais concreta desse princípio.

Documento 5 – Agente-como-Grafo

arxiv.org/abs/2511.18194

Este artigo mostra como representar não apenas conhecimento, mas agentes e ferramentas como nós em um grafo.

text
1Pergunta do usuário
2
3Grafo de capacidades
4
5Selecionar agente de pesquisa
6
7Selecionar ferramenta GitHub
8
9Selecionar ferramenta ArXiv
10
11Selecionar ferramenta de banco de dados de grafo
12
13Kimi K3 coordena a execução

Os autores relatam melhoria de 14,9% no Recall@5 e 14,6% no nDCG@5 em comparação com retrievers comparáveis no LiveMCPBenchmark.

Para Kimi K3, isso significa que o grafo pode gerenciar não apenas o conhecimento, mas também qual agente e qual ferramenta usar para cada tarefa específica.

Documento 6 – Kimi Code e Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code é um agente de terminal que pode:

text
1Ler e editar código
2Executar comandos de shell
3Pesquisar arquivos
4Buscar páginas da web
5Analisar o resultado de cada etapa
6Escolher independentemente a próxima ação
7Suporta MCP
8Hooks de ciclo de vida
9Modos de aprovação

Kimi Agent SDK permite que você use Kimi Code como base para seu próprio agente. Ele reutiliza as ferramentas, habilidades e configuração do servidor MCP do Kimi Code.

Para Graph Engineering, esta é uma camada de execução pronta para uso. O grafo fornece conhecimento estruturado e caminhos de raciocínio. Kimi Code realiza ações no ambiente real. O SDK une tudo.

A arquitetura completa do sistema

text
1Etapa 1 – Camada de Ingestão
2PDFs, sites, bancos de dados, APIs, Slack, Notion
3
4
5Etapa 2 – Camada de Extração
6Kimi K3 extrai entidades e relacionamentos
7
8{
9 "entity": "Kimi K3",
10 "type": "AI model",
11 "relations": [
12 {
13 "predicate": "developed_by",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Etapa 3 – Camada de Resolução
23O sistema resolve se estas são a mesma entidade:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Etapa 4 – Armazenamento do Grafo
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Etapa 5 – Camada de Recuperação
34Busca vetorial + Consulta de entidade + Busca de caminho
35Busca de comunidade + Filtragem temporal
36
37
38
39Etapa 6 – Camada de Agente
40Kimi K3:
41Planeja a abordagem
42Escolhe a ferramenta certa
43Gera consultas Cypher ou SPARQL
44Analisa subgrafo
45Executa pesquisa na web
46Tira conclusões
47Identifica a próxima lacuna de conhecimento
48
49
50
51Etapa 7 – Camada de Verificação
52Verifica a cobertura de evidências
53Encontra contradições
54Avalia a confiança
55Verifica fontes
56
57
58
59Etapa 8 – Atualização do Grafo
60Novos fatos adicionados ao grafo
61Contradições sinalizadas
62Informações antigas recebem timestamp

Este é um ciclo fechado de conhecimento-ação. Kimi K3 não apenas lê o grafo. Ele identifica o que está faltando, forma sub-perguntas, seleciona um nó ou subgrafo, executa uma busca, verifica o resultado, adiciona um novo fato e reavalia a hipótese.

Cinco prompts que executam todo o pipeline

Graph Engineering não substitui prompts. Ele os usa em cada estágio específico.

Prompt 1 – Extração

text
1Extraia todas as organizações, pessoas, produtos e eventos.
2
3Para cada entidade retorne:
4- canonical_name
5- type
6- description
7- source
8
9Para cada relacionamento retorne:
10- source_entity
11- relation_type
12- target_entity
13- evidence
14- confidence_score

Prompt 2 – Normalização

text
1Compare as seguintes entidades.
2Determine se elas se referem a:
3- a mesma entidade
4- entidades relacionadas, mas diferentes
5- entidades não relacionadas
6
7Retorne o nome canônico e a explicação.
8Não mescle entidades sem evidências claras.

Prompt 3 – Consulta ao Grafo

text
1Traduza a pergunta do usuário em uma consulta Cypher.
2Use apenas relacionamentos presentes no esquema.
3Não invente rótulos ou propriedades.
4Retorne a consulta e a explicação da lógica.

Prompt 4 – Resposta Fundamentada

text
1Responda usando apenas os caminhos do grafo recuperados.
2Para cada conclusão:
3- identifique os nós de suporte
4- identifique o caminho de relacionamento
5- declare a incerteza claramente
6- não infira causalidade a partir de correlação

Prompt 5 – Manutenção do Grafo

text
1Compare novos fatos com o grafo existente.
2Classifique cada fato como:
3- novo
4- duplicado
5- contradição
6- atualização
7- incerto
8
9Não sobrescreva fatos existentes sem evidências.

Cinco negócios que você pode construir neste sistema

1 – Pesquisa de Investimentos

text
1Empresa
2├── fundadores e seus projetos anteriores
3├── investidores e seu portfólio
4├── concorrentes e suas estratégias
5├── riscos legais
6├── patentes
7├── vagas de emprego como sinal de estratégia
8└── métricas financeiras ao longo do tempo

Kimi K3 lê relatórios e notícias. O grafo mostra conexões ocultas entre empresas, investidores compartilhados, dependências de fornecedores e sinais de pessoal. Clientes: fundos de investimento, escritórios de advocacia, consultores de M&A. $2.000 a $10.000 por cliente por mês.

2 – Inteligência de Engenharia

text
1Commits do GitHub + Tickets do Jira + Tarefas do Linear
2
3Grafo do Trabalho de Engenharia
4
5Detecção de incidentes 5x mais rápida
650% menos tempo em reuniões
7Notas de versão automáticas

anthropic.com/customers/graph

LaunchNotes já vende isso. O mercado é toda equipe de engenharia que usa mais de uma ferramenta de gerenciamento de projetos.

3 – Motor de Pesquisa Científica

text
1Artigo → autor → instituição → método → conjunto de dados → resultado
2
3Quais métodos GraphRAG usam detecção de comunidades,
4em quais conjuntos de dados foram testados
5e quais artigos se contradizem

A busca comum dá uma lista de documentos. Um sistema de grafo constrói um mapa de evidências e contradições.

4 – Grafo de Ameaças Cibernéticas

text
1IP → domínio → certificado → malware → campanha → ator
2
3Kimi K3 analisa relatórios de ameaças
4Mapeia indicadores entre fontes
5Explica caminhos de ataque
6Atualiza o grafo de ameaças automaticamente

5 – SO de Conhecimento Pessoal

text
1Pessoas ↔ Reuniões ↔ Projetos ↔ Documentos ↔ Decisões ↔ Promessas
2
3Perguntas que Kimi K3 pode responder:
4Quem está bloqueando esta tarefa?
5Que decisão tomamos e em que ela se baseou?
6O que prometi fazer este mês?
7Quais suposições antigas não são mais válidas?

Por onde começar esta semana

text
1Dia 1 | instale o Neo4j localmente
2 | leia o README do DSPy
3 | github.com/stanfordnlp/dspy
4 | entenda a diferença entre usar prompt
5 | e programar um sistema
6
7Dia 2 | pegue um conjunto de documentos
8 | execute Kimi K3 via API
9 | extraia primeiras entidades e relacionamentos
10 | salve no Neo4j
11
12Dia 3 | construa a primeira camada de recuperação
13 | combine busca vetorial e busca em grafo
14 | teste em uma pergunta complexa que o RAG não consegue responder
15
16Dia 4 | conecte Kimi Code via MCP
17 | github.com/MoonshotAI/kimi-code
18 | deixe o agente ler o grafo e adicionar novos fatos
19 | execute o primeiro ciclo conhecimento-ação
20
21Dia 5 | meça o resultado
22 | compare a precisão vs. RAG tradicional
23 | compare os custos de token
24 | encontre o primeiro caso de uso de cliente real

O que Microsoft, Stanford e Anthropic descobriram juntos

text
1Microsoft GraphRAG | grafo reduz custos em 85%, melhora precisão em 18%
2Stanford DSPy | modelo é um nó em um grafo, não o centro
3Stanford Leis de Escala | modelo menor + grafo bom vence modelo maior
4MIT Press Pesquisa | relacionamentos explícitos melhoram coerência e precisão
5Anthropic LaunchNotes | detecção de incidentes 5x mais rápida, 50% menos tempo de reunião

Kimi K3 é o motor. Graph Engineering é o mapa, a memória e o sistema de coordenadas. Sem o motor, o grafo não age. Sem o grafo, o motor se move muito rápido, mas nem sempre sabe para onde está indo.

A maioria dos desenvolvedores continuará construindo RAG tradicional e se perguntará por que perguntas complexas dão respostas ruins. Alguns passarão uma semana construindo um sistema de grafo e nunca mais voltarão a buscar texto.

Você constrói sua própria vida – então escolha o caminho certo.

/ Se isso foi útil – siga /

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais