Por que Evals existe
Quando a resposta de um agente piora, a pergunta é: foi o modelo ou foi o contexto? O time de dados não controla o modelo, mas controla tudo que chega até ele — o perfil da entidade, as fontes consultadas, o frescor dos dados. Evals separa as duas coisas. Ele avalia a camada de contexto de forma isolada, para que o time saiba exatamente por que as respostas melhoram ou pioram, e o que mudar para melhorar. Sem essa separação, um perfil incompleto e uma alucinação do modelo aparecem como o mesmo sintoma. Com Evals, o time vê que o contexto entregue não tinha o campo que faltava, e corrige a fonte em vez de culpar o modelo.As três dimensões da qualidade do contexto
Evals avalia o contexto em três dimensões. Cada uma responde a uma pergunta que o time de dados pode acionar.Completude
O contexto tinha tudo que era necessário para a decisão? Mede quantos dos campos exigidos do perfil estavam preenchidos e quantas das fontes configuradas efetivamente contribuíram. Exemplo: um perfil de tomador de crédito precisa de renda, histórico de pagamentos e contratos ativos. Se a fonte de contratos não sincronizou, a completude cai e o Evals aponta qual dimensão faltou.Precisão
As informações estavam corretas e atualizadas? Mede se os dados entregues refletem o estado real da fonte, sem valores obsoletos ou divergentes entre sistemas.Relevância
Havia ruído no contexto que poderia distorcer a decisão? Mede se o que foi entregue era pertinente à pergunta, sem eventos ou fontes irrelevantes ocupando o orçamento de tokens.Métricas que o Evals consome
Memory e Knowledge emitem métricas de qualidade que o Evals agrega. Cada métrica alimenta uma das três dimensões acima.Os limiares de cada métrica são configurados por cliente. Quando uma métrica viola o limiar, o evento é emitido para o Observability, que monitora o contexto em produção.
Como se conecta aos outros produtos
Evals fica na camada de Ops Engineering, ao lado do Observability. Um mede a qualidade do contexto de forma avaliativa; o outro monitora essa qualidade em produção.Casos de uso
Diagnóstico de regressão de qualidade
Diagnóstico de regressão de qualidade
A qualidade das respostas de um agente de atendimento cai. O time abre o Evals e vê que a completude do perfil caiu de 95% para 70% na última semana. A causa é uma fonte de contratos que parou de sincronizar — não o modelo. A correção é no pipeline, não no prompt.
Validação antes de subir uma nova fonte
Validação antes de subir uma nova fonte
Antes de expor um novo conector aos agentes, o time avalia se o contexto resultante melhora a completude e a cobertura de fontes das entidades afetadas. Evals dá a medida antes e depois. [verificar: fluxo exato de avaliação pré-deploy na UI]
Próximos passos
Observability
Monitore a qualidade do contexto em produção e receba alertas antes que um problema impacte o agente.
Memory
Entenda como o contexto de entidade é montado e quais métricas ele emite.
Knowledge
Veja como a base de conhecimento é indexada e recuperada.