Um assistente de conhecimento interno só é tão bom quanto sua última resposta errada
A partir de certo tamanho, todas as empresas têm o mesmo problema de conhecimento, e não é que falte conhecimento. Ele está no Confluence, no Drive, na wiki que ninguém atualizou desde a reorganização, em uma conversa de março. O que falta é o caminho até ele: pesquisar é lento, os resultados estão desatualizados e perguntar a uma pessoa no Slack é mais rápido e confiável. Então as pessoas perguntam no Slack — as mesmas perguntas, toda semana, às mesmas três pessoas.
Um assistente que responda a essas perguntas a partir dos documentos é uma ideia evidente. A maioria dos que são construídos deixa de ser usada no primeiro mês. A diferença entre uns e outros não é o modelo.
Por que a maioria deixa de ser usada
As pessoas confiam em um assistente de conhecimento como confiam em um colega: uma resposta errada, dada com segurança, sobre a política de folgas e ninguém volta a perguntar. Três coisas causam essa resposta.
Ele responde de memória em vez de usar o documento. Um modelo geral, quando questionado sobre sua política, produz um parágrafo fluente, plausível e errado. O assistente precisa recuperar informações primeiro e responder apenas com base no que encontrou — e mostrar onde encontrou, para que quem leia possa conferir.
Ele não sabe que o documento mudou. A política foi atualizada na terça-feira; o índice ainda tem a versão de segunda. O assistente informa com segurança a regra antiga. Estar atualizado não é um detalhe desejável; é a razão pela qual as pessoas deixaram de confiar na wiki.
Ele mostra às pessoas coisas que não deveriam ver. As faixas salariais também são um documento. Se o assistente indexa tudo e responde a todos, ele é um vazamento com uma interface amigável. A recuperação precisa respeitar as mesmas permissões que os documentos já têm, por usuário, no momento da consulta.
O que um bom assistente faz
- Responde com citações ou diz "não sei". Toda resposta inclui um link para o trecho de onde veio. Quando a recuperação não encontra resultados ou é ambígua, o assistente informa isso e oferece a pessoa que saberia responder. Um "não tenho essa informação" correto vale mais do que uma suposição fluente.
- Reindexa quando há mudanças, não conforme um calendário. Quando um documento é editado, seus embeddings são reconstruídos naquele momento — para que o assistente nunca fique atrás da fonte.
- Fica onde as perguntas já acontecem. Dentro do Slack ou do Google Chat, não em um portal que as pessoas precisam lembrar de acessar. A ideia é receber a pergunta no lugar em que ela é feita.
- Encaminha os casos sem atrito. As perguntas que não consegue responder são direcionadas à pessoa responsável — e esses encaminhamentos viram a lista de documentos que precisam ser escritos.
O trabalho que ninguém inclui no orçamento
O assistente mostra a realidade da sua documentação de uma maneira que a wiki nunca mostrou. As primeiras semanas de perguntas revelam toda página desatualizada, contraditória ou ausente, porque agora o assistente as está lendo em voz alta. Isso não é uma falha do projeto; é seu resultado mais útil. Reserve tempo para uma pessoa responsável corrigir o que ele encontrar.
A outra parte é um conjunto de avaliação: cinquenta perguntas reais que as pessoas fizeram, com a resposta que um colega bem informado daria. Execute-o sempre que os documentos, os prompts ou o modelo mudarem. Sem ele, "parece funcionar" é o único sinal, e foi esse sinal que levou à wiki em que ninguém confia.
A tecnologia, em poucas palavras
Nada disso precisa de infraestrutura exótica. Embeddings e busca vetorial nos documentos — Postgres com uma extensão vetorial é suficiente para a maioria das empresas —, uma etapa de recuperação com filtragem de permissões, um modelo de linguagem para escrever a resposta a partir dos trechos recuperados e a integração com o chat. Tudo roda dentro da sua nuvem e das suas permissões, porque os documentos já estão lá e as perguntas são sobre eles.
O que medir
A proporção de perguntas respondidas com uma citação. A proporção que o assistente se recusou a responder e quais eram os assuntos. Correções relatadas pelos usuários. E a que importa às pessoas que antes respondiam a tudo: quantas perguntas repetidas deixaram de chegar até elas.
Comece com as perguntas de uma equipe — RH e operações costumam ser as mais ativas — e um canal. Se conquistar confiança ali, a mesma base se estende à documentação de engenharia, aos manuais operacionais de suporte e ao material de vendas; se não, você saberá o motivo em um mês, e a resposta estará nos documentos, não no modelo.
O que aprendemos ao prototipá-lo
Construímos isso como uma prova de conceito com nossa própria documentação: embeddings e busca vetorial no Postgres (pgvector), recuperação e indexação com LlamaIndex, um modelo de pesos abertos (Gemma 3) escrevendo as respostas a partir dos trechos recuperados e uma integração com o Google Chat para que as perguntas pudessem ser feitas onde já aconteciam.
O modelo foi a decisão menos interessante. Um modelo pequeno de pesos abertos respondia bem quando a recuperação era boa e mal quando não era — esse é o ponto: a qualidade estava no que era indexado, em como era dividido em trechos e em o índice estar atualizado. A primeira versão reindexava todas as noites; uma política editada de manhã continuava gerando respostas erradas até o dia seguinte, e aquela resposta errada custava mais confiança do que uma semana de respostas certas. A reindexação na mudança foi incorporada imediatamente.
As permissões foram a restrição de projeto que definiu todo o resto. Filtrar no momento da consulta, por usuário, conforme as regras de acesso dos próprios documentos, não é um complemento; isso determina a estrutura do índice. Construa primeiro.
E o assistente foi implacável com nossa própria documentação. Em poucos dias, revelou as contradições e as páginas em que ninguém havia mexido em um ano — exatamente o resultado que justifica o projeto, se alguém assumir a responsabilidade por corrigi-las.
O que a produção acrescenta: tratamento de entidades nomeadas para pessoas e produtos, para que a recuperação corresponda à maneira como as perguntas realmente são feitas; um conjunto de avaliação baseado em perguntas reais; e uma pessoa responsável pela dívida de documentação que o assistente continuará encontrando.