MLOps

Modelos são software. Opere-os como tal.

O piloto funcionou; produção é outro esporte. Construímos a camada de operação — deploy, monitoramento, avaliação, retreinamento — que mantém modelos e aplicações com LLM honestos depois do lançamento.

O que construímos

  • Pipelines de deploy para modelos e aplicações com LLM
  • Monitoramento em produção: qualidade, drift, latência e custo
  • Avaliação como rotina, não como cerimônia
  • Ciclos de atualização e retreinamento com revisão humana onde importa

Provas

Nossa própria contratação

O agente que escreve os perfis dos nossos candidatos roda em produção há um ano sem mudanças — instrumentado, avaliado sobre a saída real e deixado em paz porque o log continuou silencioso.

Ler a nota
Um ano em produção
Nenhuma mudança necessária

Quando os times nos procuram

  • Um modelo que funciona num notebook que ninguém ousa colocar em produção
  • Qualidade caindo em silêncio até um cliente perceber
  • Custos de IA que surpreendem o financeiro todo mês

Como construímos

  1. Linha de base e métricas

    definir o que significa "bom" antes de mexer em nada

  2. Pipeline de deploy

    modelos e aplicações com LLM são liberados como software

  3. Monitorar o que importa

    qualidade, drift, latência, custo

  4. Ciclo de atualização

    retreinamento e mudanças de prompt com revisão humana

O que se degrada em silêncio

Nada em produção quebra aos gritos. Deriva:

Qualidade

as entradas mudam e o modelo não. Uma versão do produto muda o que os tickets dizem; uma estação muda o que a câmera vê. A acurácia decai enquanto o dashboard segue verde, porque ninguém está comparando as saídas com uma amostra da verdade toda semana.

Prompts e versões

um prompt editado para resolver um caso quebra outros três; um fornecedor atualiza um modelo sob o mesmo nome. Sem um conjunto de avaliação rodando em cada mudança, "parece estar bom" é o único sinal, e não é um sinal.

Latência

uma funcionalidade que respondia em dois segundos agora leva seis, um passo de recuperação por vez. Os usuários param de usar antes de alguém abrir um ticket.

Custo

o preço por chamada escala com o sucesso. A funcionalidade que funciona é a que surpreende o financeiro, e a correção é um orçamento por tenant que o produto respeita, não uma planilha atrasada.

O piloto prova que o modelo pode funcionar. Operar é provar, toda semana, que ele continua funcionando.

Como é operar bem

Todo modelo ou aplicação com LLM que operamos tem as mesmas quatro coisas acopladas, e elas são acopladas antes do lançamento, não depois do primeiro incidente: um conjunto de avaliação com casos reais e respostas conhecidas, executado automaticamente em cada mudança de prompt, de modelo ou dos dados; um pipeline de deploy em que uma versão do modelo é liberada como uma liberação de código — revisada, etiquetada, reversível; monitoramento das quatro coisas que se degradam, com limites decididos junto ao time que vai receber o alerta; e um ciclo de atualização em que o retreinamento ou uma mudança de prompt passa por uma pessoa antes de chegar à produção.

A verdade pouco glamourosa é que a maior parte disso é disciplina comum de software aplicada a um componente que por acaso é probabilístico. Times que já entregam software bem têm quase todo o caminho feito; o que normalmente falta é o conjunto de avaliação — o único artefato que ninguém constrói no piloto e todos precisam em produção.

Funciona bem com

E todo modelo que construímos — ou que vocês construíram.

Perguntas frequentes

  • Só usamos APIs de LLM — ainda precisamos disso?

    Sim: prompts, versões, avaliações e custos também se degradam em silêncio.

  • Vocês operam modelos que nosso time construiu?

    Caso comum: primeiro instrumentamos, depois melhoramos.

  • Quanto custa operar IA?

    Depende do volume — a prática é tornar o custo visível e revisado como código, para que a resposta nunca seja uma surpresa.

  • O que é um conjunto de avaliação, e por que tudo volta a ele?

    De algumas dezenas a algumas centenas de entradas reais com a resposta que uma pessoa competente daria, guardadas ao lado do código e executadas em cada mudança. É a única forma de saber se uma mudança melhorou o sistema ou moveu as falhas para um lugar onde você não estava olhando. Sem ele, cada edição de prompt é um palpite.

  • Quanto custa manter o monitoramento?

    Uma fração do custo do próprio modelo — a amostragem que pega o drift compara uma fatia das saídas com a verdade, não cada chamada. O caro não é o monitoramento: é o cliente que percebe primeiro.

  • Vocês trabalham com modelos de pesos abertos na nossa infraestrutura?

    Sim, e a camada de operação tem a mesma forma de qualquer jeito: versões, avaliação, monitoramento, um pipeline reversível. O que muda é que o custo passa a ser uma decisão de capacidade em vez de uma decisão por chamada, e o modelo pode ser atualizado no seu calendário e não no de um fornecedor.

Mantenha sua IA honesta em produção.