MLOps
Modelos são software. Opere-os como tal.
O piloto funcionou; produção é outro esporte. Construímos a camada de operação — deploy, monitoramento, avaliação, retreinamento — que mantém modelos e aplicações com LLM honestos depois do lançamento.
O que construímos
- Pipelines de deploy para modelos e aplicações com LLM
- Monitoramento em produção: qualidade, drift, latência e custo
- Avaliação como rotina, não como cerimônia
- Ciclos de atualização e retreinamento com revisão humana onde importa
Provas
Nossa própria contratação
O agente que escreve os perfis dos nossos candidatos roda em produção há um ano sem mudanças — instrumentado, avaliado sobre a saída real e deixado em paz porque o log continuou silencioso.
Ler a nota- Um ano em produção
- Nenhuma mudança necessária
Quando os times nos procuram
- Um modelo que funciona num notebook que ninguém ousa colocar em produção
- Qualidade caindo em silêncio até um cliente perceber
- Custos de IA que surpreendem o financeiro todo mês
Como construímos
Linha de base e métricas
definir o que significa "bom" antes de mexer em nada
Pipeline de deploy
modelos e aplicações com LLM são liberados como software
Monitorar o que importa
qualidade, drift, latência, custo
Ciclo de atualização
retreinamento e mudanças de prompt com revisão humana
O que se degrada em silêncio
Nada em produção quebra aos gritos. Deriva:
Qualidade
as entradas mudam e o modelo não. Uma versão do produto muda o que os tickets dizem; uma estação muda o que a câmera vê. A acurácia decai enquanto o dashboard segue verde, porque ninguém está comparando as saídas com uma amostra da verdade toda semana.
Prompts e versões
um prompt editado para resolver um caso quebra outros três; um fornecedor atualiza um modelo sob o mesmo nome. Sem um conjunto de avaliação rodando em cada mudança, "parece estar bom" é o único sinal, e não é um sinal.
Latência
uma funcionalidade que respondia em dois segundos agora leva seis, um passo de recuperação por vez. Os usuários param de usar antes de alguém abrir um ticket.
Custo
o preço por chamada escala com o sucesso. A funcionalidade que funciona é a que surpreende o financeiro, e a correção é um orçamento por tenant que o produto respeita, não uma planilha atrasada.
O piloto prova que o modelo pode funcionar. Operar é provar, toda semana, que ele continua funcionando.
Como é operar bem
Todo modelo ou aplicação com LLM que operamos tem as mesmas quatro coisas acopladas, e elas são acopladas antes do lançamento, não depois do primeiro incidente: um conjunto de avaliação com casos reais e respostas conhecidas, executado automaticamente em cada mudança de prompt, de modelo ou dos dados; um pipeline de deploy em que uma versão do modelo é liberada como uma liberação de código — revisada, etiquetada, reversível; monitoramento das quatro coisas que se degradam, com limites decididos junto ao time que vai receber o alerta; e um ciclo de atualização em que o retreinamento ou uma mudança de prompt passa por uma pessoa antes de chegar à produção.
A verdade pouco glamourosa é que a maior parte disso é disciplina comum de software aplicada a um componente que por acaso é probabilístico. Times que já entregam software bem têm quase todo o caminho feito; o que normalmente falta é o conjunto de avaliação — o único artefato que ninguém constrói no piloto e todos precisam em produção.
Funciona bem com
Perguntas frequentes
Só usamos APIs de LLM — ainda precisamos disso?
Sim: prompts, versões, avaliações e custos também se degradam em silêncio.
Vocês operam modelos que nosso time construiu?
Caso comum: primeiro instrumentamos, depois melhoramos.
Quanto custa operar IA?
Depende do volume — a prática é tornar o custo visível e revisado como código, para que a resposta nunca seja uma surpresa.
O que é um conjunto de avaliação, e por que tudo volta a ele?
De algumas dezenas a algumas centenas de entradas reais com a resposta que uma pessoa competente daria, guardadas ao lado do código e executadas em cada mudança. É a única forma de saber se uma mudança melhorou o sistema ou moveu as falhas para um lugar onde você não estava olhando. Sem ele, cada edição de prompt é um palpite.
Quanto custa manter o monitoramento?
Uma fração do custo do próprio modelo — a amostragem que pega o drift compara uma fatia das saídas com a verdade, não cada chamada. O caro não é o monitoramento: é o cliente que percebe primeiro.
Vocês trabalham com modelos de pesos abertos na nossa infraestrutura?
Sim, e a camada de operação tem a mesma forma de qualquer jeito: versões, avaliação, monitoramento, um pipeline reversível. O que muda é que o custo passa a ser uma decisão de capacidade em vez de uma decisão por chamada, e o modelo pode ser atualizado no seu calendário e não no de um fornecedor.