Khal.os Vendas · Spec de produto · Interno

Avaliador.

O agente que dá nota a cada conversa encerrada na régua da casa: pitch pela rubrica, processo e esforço por fórmula, vendedor humano e agente de IA na mesma escala. Os scores, os sinais contínuos e os incidentes que ele produz alimentam a Sentinela, o TIME e o lab de EVOLUÇÃO. Este documento especifica o produto para o time construir.

21 critérios de pitch + 6 de processo + 6 de esforço 6 sinais contínuos 3 gates de calibração antes de ligar
Autor Paulo Dela Coleta · Implementação · 03/08/2026 · v0.1 para revisão de produto · base: rubrica_versao 0.2
Capítulo 0 · Retrato

O Avaliador em uma tela

Toda conversa encerrada recebe nota nas 3 dimensões da doutrina (pitch, processo, esforço), com quote e posição na transcrição para cada reprovação crítica. O agente de IA é avaliado por censo; o vendedor humano, por amostra estratificada. O resultado grava em duas tabelas versionadas que o resto do Khal.os consome.

O que faz

Pontua cada conversa na rubrica versionada, calcula os sinais contínuos, grava score com quote e offset, abre incidente de conformidade quando o bloco 0 reprova, e consolida a leitura semanal por executor.

O que não faz

Não notifica (a Sentinela notifica), não pune (score é coaching antes de cobrança nos primeiros ciclos), não muda a rubrica (rito do Cientista) e não muda agente (régua de A/B).

Métrica de governo

Concordância com o gold set: 10 a 20 conversas pontuadas pelo dono da doutrina, re-pontuadas todo mês pelo Avaliador. Queda de concordância é drift: recalibra antes de qualquer leitura de produção.

Quem consome

Sentinela (monitor de score em queda, incidente de conformidade, sinais contínuos), TIME (semáforo de scores com drill até a quote), Pesquisador (Elite vs mediano vs agente) e ROTINA (pauta de 1:1).

RéguaUnidadeFonteComo pontua
score_pitchPor conversaTranscrição + sinais contínuos21 critérios sim / não / N-A em 7 blocos, com quote obrigatória nos críticos
score_processoPor conversaTimestamps + CRM6 critérios por fórmula, sem julgamento
score_esforcoPor executor × diaDado cru de atividade6 itens contra a referência da própria operação
Sinais contínuosPor conversaTranscrição, sem LLM6 medidas numéricas; não entram no score na v0, são features de correlação e camada anti-gaming
Fontes: rubrica de conversa v0.2 · doutrina de vendas (Parte III e IV) · processo de análise de conversas contínua (P12) · spec do Sentinela (contratos)
Capítulo 1 · Retrato

As 10 regras de design

Todo comportamento do Avaliador segue estas regras. Elas vêm da rubrica, da doutrina e do processo de análise contínua. Mudança que desviar de alguma delas passa antes pelo rito de governança do capítulo 8.

#RegraOrigemNa prática
1Mesma régua para humano e agenteLei 2 da doutrinaExecutor humano e agente são linhas do mesmo schema (executor_id + tipo); mesmos critérios, mesmos painéis.
2Rubrica versionada; versões não se comparam diretamenteDoutrina Parte IIITodo registro carrega rubrica_versao. Troca de versão roda dual-scoring de 2 semanas para criar o fator de ponte da série.
3Todo "não" em critério crítico exige quote literal com offsetRubrica §6Sem quote e posição na transcrição, o resultado não grava. É o que sustenta o drill score → conversa no TIME.
4Proibido inferir intençãoRubrica §6Pontua o que está na transcrição, nunca o que o executor "quis dizer".
5Avaliador cego a nome e tipo do executorRubrica §6O prompt de scoring não recebe quem é o executor; evita viés humano vs agente.
6N/A explícito com razão; etapa não alcançada sai do denominadorRubrica §2-§3A profundidade da conversa é medida à parte (etapa_max); a conversa curta não é punida duas vezes.
7Bloco 0 reprovado limita a conversa a teto 3 e abre incidente imediatoRubrica §2, bloco 0O incidente grava incidente_conformidade = true; a notificação em tempo real é da Sentinela (alerta SENT-F7-05).
8Censo no agente, amostra estratificada no humanoP12, passo 1Agente: 100% das conversas. Humano: amostra semanal por vendedor cobrindo etapas e desfechos (referência inicial 10/semana, PLACEHOLDER a calibrar).
9Score sempre pareado com desfechoDoutrina (anti-gaming) + rubrica §7Critério encenado sem conversão aparece na correlação em 2 semanas. Os sinais contínuos completam a camada anti-gaming: são difíceis de encenar.
10O gold set audita o Avaliador todo mêsRubrica §6.6 + P1210 a 20 conversas pontuadas pelo dono da doutrina são o benchmark permanente. Queda de concordância = drift: recalibrar antes da próxima leitura de produção.
Capítulo 2 · Retrato

Anatomia da avaliação

Cada avaliação é um registro com ciclo de vida auditável, gravado em duas tabelas de grãos distintos: o header da conversa e o detalhe critério a critério, com quote e offset.

Ciclo de vida de uma avaliação

EstadoSignificadoQuem transiciona
encerradaA conversa terminou (venda, perda com motivo, ou estagnação classificada); entra na fila de elegibilidadeEspinhaço de eventos
elegívelPassou os filtros: base legal LGPD válida para o tipo de executor, motion no escopo (M1/M2), transcrição íntegraAvaliador (sistema)
amostradaHumano: entrou na amostra estratificada da semana. Agente: censo, toda conversa elegível é amostradaAvaliador (sistema)
pontuadaOs 21 critérios + fórmulas + sinais calculados; quote e offset gravados; rubrica_versao carimbadaAvaliador (motor)
consolidadaEntrou na leitura semanal por executor × dimensão × etapa, com tendência contra as 8 semanas anterioresAvaliador (consolidação)
correlacionadaEntrou no cálculo de lift por critério e na leitura Elite vs mediano vs agenteAvaliador (correlação)
descartadaFora de escopo, sem base legal ou transcrição corrompida; descarte registra a razãoAvaliador (sistema)
reavaliadaRe-pontuada na meta-avaliação mensal (gold set) ou no dual-scoring de troca de versãoAvaliador (meta-avaliação)

Transcrição indisponível ou corrompida não vira nota baixa: vira descarte com razão e alimenta o alerta de saúde do dado da Sentinela (família F10).

Schema de saída (duas tabelas)

conversa_scores (1 linha por conversa)Conteúdo
conversa_idIdentificador com identidade do lead resolvida entre canais
executor_id · tipoQuem conduziu: humano ou agente, no mesmo schema
data · canal · motionContexto da conversa
rubrica_versaoVersão da régua que pontuou (comparações só na mesma versão)
etapa_max1 a 6: profundidade que a conversa alcançou, registrada à parte do score
desfechovenda · perda com motivo · em andamento
score_pitch · score_processo0 a 10, com os tetos de crítico aplicados
sinais contínuosrazão de turnos, maior monólogo, perguntas antes da 1ª apresentação, tempo até o preço, sims coletados, tempo de resgate no checkout
incidente_conformidadeBooleano; true dispara a notificação da Sentinela
conversa_criterios (1 linha por conversa × critério)Conteúdo
conversa_id · criterio_idChave do detalhe (ex.: 4.1)
resultadosim · não · N/A (com razão do N/A)
quoteTrecho literal que evidencia o resultado; obrigatória em todo "não" crítico
offset_transcricaoPosição do trecho na transcrição. Sem offset, o drill do score até a quote no painel não constrói

A agregação diária por executor alimenta a projeção fato_esforco_diario (score_pitch, score_processo, score_esforco), no mesmo espinhaço de eventos da doutrina.

Exemplo de scorecard (ilustrativo)

Recorte de 4 critérios de uma conversa avaliada, no formato que o produto grava e o TIME exibe. O caso segue a narrativa validada nos mockups (time B, follow-up esticado, pitch estável).

CritérioTextoResultadoQuote gravada
2.1 crítico2+ perguntas de sondagem antes da 1ª apresentaçãosim"Quem entraria no plano além de você?" · "O que te fez buscar agora?"
4.1 críticoValor ancorado antes do preço aparecernão"O plano fica em R$ X por mês, mas posso ver um desconto" (preço solto, sem âncora; offset gravado)
4.4 críticoCondução ativa por alternativa duplanão"Qualquer coisa me chama" (encerramento passivo)
5.2Resgate no tempo certo quando o lead some no checkoutN/ARazão: etapa 5 não alcançada

Leitura de 3 linhas do scorecard: maior força (sondagem completa, bloco 2 em 10); maior gap (bloco 4 com teto 5 por dois críticos reprovados; ação do gabarito: treino de ancoragem e alternativa dupla); próximo passo com dono e prazo na pauta do 1:1.

Capítulo 3 · A régua

A régua completa

É o padrão contra o qual toda conversa é medida: 21 critérios de pitch em 7 blocos (as etapas da venda afunilada), 6 critérios de processo por fórmula, 6 itens de esforço por dia e 6 sinais contínuos. Base: rubrica_versao 0.2; congela como v1.0 depois dos 3 gates do capítulo 7.

score_pitchBloco 0 · Conformidade (só agente; um "não" limita a conversa a teto 3 e abre incidente)

IdCritérioExemplo de "não"
0.1 críticoNenhuma condição comercial fora da lista aprovada foi oferecida"Parcelamos em 12x sem juros" (condição inexistente)
0.2 críticoTodo preço citado veio da fonte oficial, sem cálculo alternativoPreço divergente do portal na mesma cotação
0.3 críticoNenhuma promessa regulatória indevida (carência, cobertura, concorrente)"Você pode acionar a ANS contra o plano atual"

O guardrail em código bloqueia antes; o Avaliador audita depois. Os dois registros se cruzam: caso que passou pelo guardrail e reprovou aqui vira caso de teste da bateria adversarial.

score_pitchBloco 1 · Abertura

IdCritérioExemplo de "sim"Exemplo de "não"
1.11ª mensagem referencia contexto real do lead (nome, origem, interesse declarado)"Vi que você simulou o plano para 2 pessoas"Mensagem que serviria para qualquer lead
1.2 críticoNão apresenta preço ou oferta antes de o lead responderAbre com pergunta sobre o momento do leadTabela de preços na 1ª mensagem
1.3Convida o lead a falar de si"Me conta o que você está buscando?"Monólogo de apresentação da empresa

score_pitchBloco 2 · Conexão

IdCritérioExemplo de "sim"Exemplo de "não"
2.1 crítico2+ perguntas de sondagem antes da 1ª apresentação de soluçãoSituação e dor investigadas antes do produtoPula direto para o produto
2.2A dor (ponto A) é nomeada explicitamente na conversa"Então o que pesa é o preço do plano atual da família"A dor nunca aparece
2.3Motivação ou objetivo (ponto B) explorado"O que te fez buscar agora?"Não pergunta o porquê
2.4Decisor ou restrição investigado (quem entra no plano, quem decide, orçamento)"Quem além de você entraria no plano?"Cota sem saber a composição

score_pitchBloco 3 · Entrega

IdCritérioExemplo de "sim"Exemplo de "não"
3.1Pedido de compromisso antes de apresentar"Se encaixar no que você me contou, seguimos?"Apresenta sem contrato prévio
3.2 críticoBenefício conectado ao que o lead disse, não característica"Cobre o hospital X que você usa com as crianças"Lista de features padrão
3.3Coleta de sims parciais ao longo da apresentação"Faz sentido esse formato?"Apresentação em bloco único sem checagem

score_pitchBloco 4 · Negociação

IdCritérioExemplo de "sim"Exemplo de "não"
4.1 críticoValor ancorado antes do preço aparecerCusto da inação, comparação ou diluição antes do númeroPreço solto, sem âncora
4.2Preço dito sem justificativa não pedidaFala o valor e silencia"É R$ X, mas dá pra ver desconto"
4.3Objeção devolvida com pergunta para achar a real"Quando você diz caro, é o valor ou o que ele entrega?"Resposta-reflexo com desconto
4.4 críticoCondução ativa por alternativa dupla"Prefere à vista ou parcelado?""E aí, quer fazer?"

score_pitchBloco 5 · Link enviado e fechamento

IdCritérioExemplo de "sim"Exemplo de "não"
5.1Confirma recebimento e guia o preenchimento"Clicou? Vai pedir CPF e endereço"Envia o link e some
5.2Resgate no tempo certo quando o lead some no checkoutMensagem leve aos ~5 min, específica aos ~10 minPercebe o abandono no dia seguinte
5.3Fechamento celebrado com próximos passos claros"Parabéns! Chega e-mail em 1h; qualquer coisa me chama"Silêncio pós-pagamento

score_pitchBloco 6 · Follow-up

IdCritérioExemplo de "sim"Exemplo de "não"
6.1 críticoCada follow-up traz elemento novo de valorCase de perfil parecido, condição nova, conteúdo"E aí, pensou?" repetido
6.2Cadência respeita posição e propósito da réguaReforço leve → valor → prova social → porta abertaMesma cobrança em formatos diferentes
6.3Última chamada respeitosa deixando porta aberta"Vou parar de insistir; se fizer sentido, me chama"Ghosting ou insistência infinita

Agregação do score_pitch

  • Score do bloco = (sim ÷ critérios aplicáveis) × 10. N/A sai do denominador.
  • Critério crítico com "não": o bloco tem teto 5. Bloco 0 reprovado: a conversa inteira tem teto 3 e abre incidente.
  • Score da conversa = média dos blocos alcançados. Bloco de etapa não alcançada não entra.
  • etapa_max (1 a 6) registrada à parte: a profundidade já é medida pelo funil, a conversa curta não é punida duas vezes.
  • Pesos v0 iguais. Repesagem só pelo rito do capítulo 8, com lift demonstrado.

score_processo6 critérios por fórmula, sem julgamento

IdCritérioComo se mede
P11ª resposta dentro do SLA da conta (referência M1: 5 min)Timestamp da 1ª mensagem do executor menos a entrada do lead
P2Intervalos dentro do limite em conversa ativa (referência: 10 min), ou aviso explícitoGaps entre turnos durante conversa ativa
P3Sem estagnação acima de 48h sem ação registradaÚltimo evento da conversa vs agora
P4Estágio do CRM condiz com a etapa real da conversaetapa_max da transcrição vs estágio no CRM
P5Régua de cadência cumprida nas posições devidasDisparos da cadência vs plano da régua
P6Encerramento com motivo de lista fechada e destinoCampo de motivo preenchido no encerramento

score_processo = (cumpridos ÷ aplicáveis) × 10. Os SLAs de P1 e P2 são parâmetros da conta, a calibrar.

score_esforco6 itens por executor × dia

IdItemFórmula
E1Leads novos trabalhados vs referência da operaçãomin(real ÷ referência, 1) × 10
E2Conversas iniciadas vs referênciamin(real ÷ referência, 1) × 10
E3Pitches completos (etapa ≥ 3) vs referênciamin(real ÷ referência, 1) × 10
E4Follow-ups ativos vs referênciamin(real ÷ referência, 1) × 10
E5% do dia com taxa de resposta em 5 min no alvoAtingimento direto
E6Pipeline etiquetado por temperatura no diaBinário (feito ou não) × 10

score_esforco = média E1-E6. As referências são da própria operação, definidas no formato do Arquiteto, nunca copiadas de outra empresa. Para agente: E1-E4 viram cobertura, uptime e volume atendido vs demanda; E6 é automático.

Sinais contínuos (por conversa, sem LLM)

SinalDefiniçãoLiga com
Razão de turnosPalavras do lead ÷ palavras do executorV3 e critério 2.1
Maior monólogoMaior sequência de palavras do executor sem turno do leadV3, V4
Perguntas antes da 1ª apresentaçãoContagemCritério 2.1
Tempo até o preço1ª menção de preço vs início da conversaV5 e critério 4.1
Sims coletadosContagem de validações parciais do leadCritério 3.3
Tempo de resgate no checkoutGap entre o silêncio do lead e a ação do executorV6, critério 5.2 e alerta SENT-F9-03

Não entram no score 0-10 na v0: são features de correlação, insumo de repesagem e a camada anti-gaming (difíceis de encenar).

Capítulo 4 · Motor

Motor de avaliação

O caminho de uma conversa encerrada até o score consolidado, com os SLAs do ciclo semanal e os dois mecanismos de auditoria do próprio motor: meta-avaliação mensal e dual-scoring na troca de versão.

PassoO que aconteceRegrasSLA
1ElegibilidadeFiltra por base legal LGPD do tipo de executor, motion no escopo (M1/M2) e integridade da transcrição. Descarte registra razão.Contínuo
2AmostragemAgente: censo. Humano: amostra estratificada por etapa e desfecho, por vendedor, na semana (referência inicial 10/semana, PLACEHOLDER a calibrar).D0
3ScoringPrompt de temperatura baixa, cego a nome e tipo do executor; responde critério a critério com sim/não/N-A + quote + offset; só então calcula agregados e tetos.D0 a D1
4Gravaçãoconversa_scores + conversa_criterios com rubrica_versao. Bloco 0 reprovado grava incidente_conformidade = true (a Sentinela notifica).D0 a D1
5ConsolidaçãoScores por executor × dimensão × etapa, tendência contra as 8 semanas anteriores, agregado diário em fato_esforco_diario.D1
6Comparação3 leituras estratificadas por mix de lead: cada um vs a própria baseline, humano vs agente, Elite vs mediano por critério.D1

Meta-avaliação mensal (o gold set)

  • O gold set são 10 a 20 conversas pontuadas pelo dono da doutrina: o benchmark permanente do Avaliador.
  • Todo mês, o Avaliador re-pontua o gold set. Concordância abaixo do padrão da conta (gate 1: kappa ≥ 0,7) é drift.
  • Com drift detectado, o motor (prompt ou modelo) recalibra antes de qualquer leitura de produção seguir.
  • Divergência entre avaliadores se resolve pelo texto do critério; se o texto permite duas leituras, o critério volta para reescrita.

Dual-scoring (troca de versão da rubrica)

  • Mudança de rubrica_versao roda janela de 2 semanas pontuando nas duas versões.
  • A janela cria o fator de ponte que mantém a série histórica comparável.
  • Sem a ponte, a série quebra e toda leitura de tendência (Sentinela S5, TIME) fica inválida na transição.
Capítulo 5 · Leitura

Correlação e leitura

O score mede aderência ao padrão; a correlação mede se a aderência paga. As regras de rigor abaixo evitam as duas armadilhas conhecidas: comparar sem estratificar e caçar ruído em amostra curta.

RegraComo aplica
Estratificação obrigatóriaToda comparação entre executores (Elite vs mediano vs agente) controla mix de lead: origem, temperatura, perfil, horário. A distribuição meritocrática (G10) entrega leads melhores ao top; sem estrato, atribui a comportamento o que é seleção.
Potência antes de conclusãoO agente (censo) é a base estatística; humanos agregam em janelas de 4+ semanas. Declarar o efeito mínimo detectável antes de rodar lift. Com 20+ critérios juntos: correção para múltiplas comparações ou agrupamento em 4-5 fatores (sondagem, personalização, condução, valor, disciplina de encerramento).
Lift por critérioConversão com "sim" ÷ conversão com "não", na mesma janela e estrato. Amostra mínima por célula definida pelo efeito mínimo detectável (valor inicial 30, PLACEHOLDER a revisar na calibração).
Leitura ElitePerfil de "sim" e sinais contínuos do top 20% vs mediano vs agente, estratificado. Onde a Elite destoa está a alavanca; onde o agente destoa da Elite está o backlog de ajuste.
Valor do pontoTodo gap vira R$ de margem pela matemática reversa (V14). Formato do backlog: "critério 4.1: Elite 9,1 vs agente 5,4; fechar metade do gap projeta +Xpp na negociação = Y vendas/mês = R$ W de margem".
Correlação vira hipóteseCritério com lift alto não vira regra nem peso: vira hipótese testada pela régua de A/B (5% → 10% → 30% → 50% → padrão) antes de qualquer mudança.

As duas saídas semanais

Saída A · Coaching (humanos)

Pauta de 1:1 por vendedor com um gap prioritário, a quote literal que o evidencia e a ação do gabarito indicador → gap → ação. Vai para a ROTINA com dono e prazo.

Saída B · Backlog de agente

Diff do agente contra a Elite, quantificado em R$ pelo valor do ponto. Cada item entra como proposta no lab de EVOLUÇÃO e só muda o agente pela régua de A/B.

Ação da semana N re-mede na semana N+2. Sem re-medição, a ação não fecha.

Capítulo 6 · Operação

Contratos de integração

O Avaliador consome transcrições e eventos, e emite scores versionados com detalhe até a quote. Os contratos abaixo estão em linguagem de negócio; o payload é decisão de engenharia.

O que consome:

  • Transcrições com identidade do lead resolvida entre canais, e o emissor real de cada mensagem (para não pontuar régua de terceiro como fala do executor).
  • Stream evento_lead: timestamps de entrada, mensagens, transições de etapa, disparos de régua, transbordo e encerramento (base de P1-P6 e E1-E6).
  • Estágio do CRM (para P4) e plano de cadência da conta (para P5).
  • Lista aprovada de condições comerciais e registro do guardrail (para o bloco 0).
  • Parâmetros da conta: SLAs, referências de esforço, tamanho de amostra, base legal LGPD por tipo de executor.

O que emite e para quem:

ConsumidorO que recebeContrato
Sentinelaconversa_scores, sinais contínuos, incidente_conformidadeAlimenta o monitor de score em queda (S5, família F5), o alerta de incidente (SENT-F7-05, notificação em até o atraso máximo da conta) e o sinal de resgate no checkout (SENT-F9-03).
TIMESemáforo de scores por executor com tendênciaDrill em dois cliques: score → critério → quote na transcrição, via offset. Comparações exibidas só na mesma rubrica_versao e estratificadas.
Pesquisador (EVOLUÇÃO)Leitura Elite vs mediano vs agente + lift por critérioInsumo do garimpo de padrões; toda proposta de mudança sai com pilar, métrica provável e estrutura de teste.
ROTINASaída A (pauta de 1:1) e re-medições N+2Ação com origem rastreada no scorecard que a gerou.
BibliotecárioIncidentes e casos novos de conformidadeCaso confirmado entra no catálogo de erros conhecidos na régua o quê, por quê, como.

Estados vazios do Avaliador:

  • Sem conversas elegíveis na janela: a leitura semanal registra a janela vazia com razão (volume baixo, filtro legal).
  • Transcrição indisponível ou corrompida: descarte com razão; volume de descartes acima da banda dispara alerta de saúde do dado (família F10 da Sentinela).
  • Base legal ausente para um tipo de executor: as conversas desse tipo não entram; o painel declara a cobertura parcial.
Capítulo 7 · Operação

Multi-conta e gates de calibração

A régua é a mesma; os parâmetros e o gold set são da conta. Nenhuma conta liga leitura de produção sem passar os 3 gates com conversas reais.

Parâmetro da contaO que defineOrigem
Escopo de motionM1 e M2 entram; M3/enterprise fica fora até haver camada própriaRubrica §escopo
SLAs de P1 e P21ª resposta e intervalo em conversa ativaFormato do Arquiteto (referência M1: 5 e 10 min)
Referências de esforço E1-E4Volumes de referência por diaA própria operação; nunca copiadas de outra empresa
Amostra semanal por vendedorTamanho e estratos da amostra de humanosP12 (referência inicial 10/semana, PLACEHOLDER)
Amostra mínima por célula de liftPiso para correlaçãoEfeito mínimo detectável (valor inicial 30, PLACEHOLDER)
Lista aprovada de condições comerciaisBase do bloco 0Conta + guardrail
Gold setBenchmark do Avaliador na contaDono da doutrina, 10 a 20 conversas
Base legal LGPDQue tipo de executor pode ser avaliadoJurídico da conta

Os 3 gates (v0 → v1.0, por conta)

GateTesteCritério de passagem
1 · Clareza2 avaliadores independentes pontuam as mesmas conversas reais (3 a 5)Concordância por critério com kappa de Cohen ≥ 0,7. Abaixo disso, o critério é reescrito. Não usar % simples: não corrige acerto por acaso.
2 · MáquinaScoring por LLM com quote obrigatóriaCritério sem quote possível não é machine-scorable: reescreve. As conversas do gate viram o embrião do gold set.
3 · SinalElite vs mediano nas mesmas conversas, estratificadoA Elite pontua acima, com diferença concentrada em critérios específicos. Se todos tiram 8, a rubrica não discrimina e volta para revisão.

Sem os 3 gates, a rubrica não congela e nenhum app se constrói sobre ela. Conta zero: Hapvida, aguardando transcrições (dono: Paulo).

Capítulo 8 · Operação

Governança e riscos

Quem altera o quê, o que é bloqueante e o mecanismo acoplado a cada risco conhecido.

MudançaRitoQuem aprova
Texto de critério da rubricaReescrita com evidência do gate 1 (divergência) e changelogDono da doutrina
Pesos e repesagemLift demonstrado com amostra mínima, nova rubrica_versao, dual-scoring de 2 semanas. Máximo 1x por trimestre; critério sem lift em 2 ciclos é candidato a sairDono da doutrina
Parâmetros da conta (SLAs, referências, amostra)Proposta do Arquiteto com dado da operaçãoDono comercial do cliente
Prompt ou modelo do motor de scoringValidação contra o gold set antes de entrar em produçãoFDE + dono da doutrina

Implantação com gente: base legal LGPD antes de tudo (aviso ao time, finalidade, retenção); score individual alimenta o 1:1 antes de qualquer ranking ou consequência nos primeiros ciclos; a rubrica é transparente para o time, é o padrão de excelência da casa, com os critérios publicados.

RiscoMecanismo acoplado
Juiz enviesado (humano vs agente)Scoring cego a nome e tipo de executor + gold set mensal como auditoria externa do juiz.
Gaming da rubricaScore pareado com desfecho (critério encenado sem conversão aparece em 2 semanas) + sinais contínuos difíceis de encenar + rotação de critérios de detalhe na amostra auditada.
Comparação injusta entre executoresEstratificação por mix de lead obrigatória + comparações só na mesma rubrica_versao.
Drift do modelo avaliadorMeta-avaliação mensal contra o gold set, com recalibração antes de qualquer leitura de produção.
Rejeição do time avaliadoScore como coaching nos primeiros ciclos, rubrica transparente e quote literal em toda reprovação: a nota sempre mostra a evidência.
Capítulo 9 · Execução

Próximos passos

Implementação em 5 fases com critério de aceite verificável. Dependência externa carrega dono; onde não existe data real, o prazo é PLACEHOLDER.

FaseEscopoCritério de aceite
0 · Gates de calibraçãoRodar os 3 gates com 3 a 5 conversas reais da conta zeroKappa ≥ 0,7 no gate 1; quote possível nos 21 critérios no gate 2; sinal Elite vs mediano no gate 3.
1 · Censo do agentescore_pitch + score_processo + sinais para 100% das conversas do agente, em sombraToda conversa encerrada do agente pontuada na janela; incidente do bloco 0 chegando na Sentinela.
2 · HumanosAmostra estratificada semanal, somente após base legal LGPD registradaAmostra completa por vendedor na semana, com quote e offset em toda reprovação crítica.
3 · CorrelaçãoLift por critério e leitura Elite, estratificadosPrimeira leitura com amostra mínima por célula atingida e efeito mínimo declarado.
4 · Ciclo vivoSaídas A e B semanais + meta-avaliação mensal + repesagem trimestralDuas semanas seguidas com pauta de 1:1 gerada e backlog de agente quantificado em R$.
DependênciaDonoPrazo
Transcrições reais da conta zero (3 a 5 conversas para os gates)PauloPLACEHOLDER
Gold set pontuado (10 a 20 conversas)Dono da doutrinaPLACEHOLDER (nasce do gate 2)
Base legal LGPD para avaliar conversas de humanosPaulo + jurídicoPLACEHOLDER
Referências de esforço E1-E4 da operaçãoArquiteto + dono comercialPLACEHOLDER
Lista aprovada de condições comerciais (bloco 0)Conta + FDE do guardrailPLACEHOLDER

Data só entra quando existe no roadmap real. O resto fica PLACEHOLDER até o dono definir.