04

IA generativa responsável

Clinical RAG Eval

Antes de conectar um LLM, é preciso saber o que significa passar no teste.

12casos dourados versionados

Benchmark determinístico de recuperação, citação e abstinência para uma linha de base RAG voltada a conhecimento em saúde.

O PROBLEMA

Como medir se um sistema RAG encontra a evidência esperada, cita a fonte correta e se abstém quando a pergunta é pessoal ou fora do corpus?

O QUE FOI CONSTRUÍDO

  1. 01Corpus curado com proveniência
  2. 02Recuperação TF-IDF e resposta extrativa
  3. 03Recall@3, MRR e métricas de citação
  4. 04Casos de segurança e fora de escopo
  5. 05CLI, artefatos, dashboard e threat model

VALOR PROFISSIONAL

  • Avaliação de RAG
  • Segurança e recusa calibrada
  • Proveniência de fontes
  • Base mensurável antes de adicionar LLM

LIMITES QUE PERMANECEM VISÍVEIS

Responsabilidade também é parte do produto.

  • Benchmark pequeno criado pelo próprio autor
  • 100% é regressão interna, não generalização
  • Filtro textual não substitui avaliação clínica

STACK

Pythonscikit-learnStreamlitRAG evaluationpytestDocker