Lumina
Primer · Nível 0 · gratuito
EN PT
Primer · antes de começar

Como ler a evidência por trás de um lançamento de IA

Você não precisa saber Python, estatística nem como chamar um modelo de linguagem. Comece por um problema conhecido: uma resposta de IA parece convincente, mas ainda é preciso decidir se ela é segura e útil o bastante para ser lançada. Esta introdução apresenta, em linguagem simples, as poucas ideias necessárias para examinar essa decisão.

para quem é isto Você já viu um assistente de IA produzir uma resposta, mas talvez nunca tenha programado ou avaliado um sistema de IA. Se expressões como "registro de execução", "RAG", "juiz" ou "gate" são novas, este é o ponto de partida: cada termo aparece somente depois do problema que ele ajuda a resolver.

1 · Defina o fluxo de trabalho antes do juiz

Comece por uma tarefa conhecida: um assistente responde à dúvida de um cliente sobre reembolso. Antes de verificar a resposta, anote o que o assistente pode fazer, qual política deve usar, como reconhecer um resultado útil e quando uma pessoa precisa assumir. Essa descrição curta é o contrato do fluxo de trabalho. Ela evita confundir uma resposta bem escrita com uma tarefa concluída.

o que você será capaz de fazer Delimitar um fluxo de trabalho de IA como contrato inspecionável antes de escrever a rubrica, o juiz ou o gate.

Trabalho: ____________________

Responsável pela ação: ____________________

Contexto: ____________________

Ação permitida: ____________________

Resultado observável: ____________________

Falha / exceção: ____________________

Responsável humano: ____________________

Evidência preservada: ____________________

exemplo preenchido No assistente de reembolso, o trabalho é “responder a uma dúvida sobre reembolso”; o contexto obrigatório é a política atual; a ação permitida é explicar a regra, não devolver dinheiro; sucesso significa uma resposta com fonte que respeite a política; e uma pessoa assume quando a regra não cobre o caso. Preencher esses campos primeiro importa porque o avaliador passa a verificar um resultado real, em vez de julgar apenas se o texto parece prestativo.
CONTRATO DO FLUXO DE TRABALHO trabalho + papel contexto + política decisão + ação saída falha / exceção responsável humano resultado +evidência resultados observados recalibram a próxima versão
uma verificação aprovada não é o resultado A verificação prova que uma saída atendeu a uma política versionada. Só o resultado observado depois da entrega mostra se o fluxo de trabalho funcionou. Preserve ambos: evidência da verificação para controle e evidência do resultado para aprendizado.
qual campo do contrato impede que “texto bem escrito” vire o critério de sucesso?
Resultado observável. Ele nomeia o efeito fora da resposta do modelo. O juiz pode testar um indicador antes da entrega; o resultado real é observado depois da ação e alimenta a próxima calibração.

2 · Uma chamada LLM e seu registro de execução

Uma chamada LLM é uma função: você envia um prompt (as mensagens de entrada), e o modelo retorna o texto de saída. Essa é a forma mais simples da operação. Um registro de execução é a versão registrada dessa chamada — a entrada, a saída e os dados necessários para investigar problemas e medi-la: quanto tempo levou (latência), quantos tokens usou, quais chamadas de ferramenta aconteceram, qual contexto foi recuperado. Toda avaliação deste curso usa esses registros. Sem registro de execução, não há avaliação.

# a chamada de LLM mais simples e seu registro de execução
out = llm.chat(messages=[{"role": "user", "content": "Summarize the meeting"}])

trace = {
    "input":  "Summarize the meeting",
    "output": out.text,
    "latency_ms": out.latency,
    "tokens":    out.usage,
}
# os juízes do curso leem campos como esses — por isso os registros vêm primeiro

3 · RAG em duas linhas

Imagine que o assistente precise consultar a política atual de reembolso antes de responder. O software recupera primeiro o trecho relevante e o envia junto com a pergunta. Esse padrão recebe o nome de RAG (Retrieval-Augmented Generation). Ele oferece uma fonte ao modelo, mas não garante que ela seja pertinente nem que a resposta a siga. Essa diferença importa no lançamento: uma resposta fluente deve falhar quando cita a política errada ou contradiz o trecho recuperado. Os próximos módulos mostram como verificar esses dois pontos de falha.

o diagrama para guardar na cabeça Primeiro o sistema produz uma resposta. Depois, uma verificação repetível a compara com a evidência registrada. Uma falha obrigatória bloqueia a versão; uma falha que pode ser corrigida permite outra tentativa. As próximas seções chamam essas partes de juiz, gate e nova tentativa. Por enquanto, guarde a ordem: produzir, examinar, decidir e agir.
CHAMADA LLM → REGISTRO prompt → resposta execução registrada entrada · saída · latência · tokens · contexto gerar julgar gate → repetir o harness repete o ciclo

4 · Extensão técnica opcional: o Python dos laboratórios

Você pode concluir o percurso central de raciocínio sem Python. Se escolher executar os laboratórios opcionais, o curso usa um subconjunto pequeno e consistente:

Se essas linhas forem novas para você, continue pelos exercícios sem código. Volte a esta extensão somente se quiser implementar o método.

5 · Juiz, gate, harness e avaliação — as palavras que o curso usa

Quatro termos recorrem e não são intercambiáveis:

Esse é todo o vocabulário. O restante do curso se apoia nessas cinco ideias — contrato de fluxo de trabalho, chamada e registro de execução, RAG, o subconjunto de Python e juiz/gate/avaliação — sem repetir a explicação.

comece com um conjunto rotulado compacto Uma coisa a mais, porque surpreende as pessoas: este curso nunca pede que você rotule manualmente milhares de exemplos. A partir do Módulo 0.4 você usará casos com resposta conhecida e conjuntos compactos revisados por pessoas para testar um juiz. Um júri pode acrescentar leituras independentes e revelar discordância, mas concordância entre juízes não é automaticamente verdade de referência.
o que é um registro de execução e por que o curso começa por ele?
É o registro da entrada, da saída e das etapas intermediárias de uma execução de LLM ou agente. Você não consegue julgar, aplicar um gate ou avaliar o que não registrou. Por isso, os módulos seguintes pressupõem que você tenha registros para analisar.
"juiz", "gate", "harness" e "avaliação" — defina cada termo em uma linha
Juiz: código que inspeciona uma saída e retorna um veredito + evidência + confiança. Gate: uma decisão de lançar ou não lançar que bloqueia ou promove com base nos juízes. Harness: conjunto repetível que executa os casos, chama os juízes, aplica os gates e registra as evidências. Avaliação: executar verificações sobre um conjunto de dados para medir a qualidade. O curso constrói essas peças nessa ordem.
qual é o papel do juiz no contrato de fluxo de trabalho?
Entre a saída candidata e o gate. Ele verifica a saída contra contexto e política versionados antes de uma ação prosseguir. Exceções devolvem o controle ao responsável humano; resultados observados continuam sendo um sinal separado que recalibra casos e gates posteriores.
pontos-chave