04
IA generativa responsável
Clinical RAG Eval
Antes de conectar um LLM, é preciso saber o que significa passar no teste.
12casos dourados versionados
Benchmark determinístico de recuperação, citação e abstinência para uma linha de base RAG voltada a conhecimento em saúde.
O PROBLEMA
Como medir se um sistema RAG encontra a evidência esperada, cita a fonte correta e se abstém quando a pergunta é pessoal ou fora do corpus?
O QUE FOI CONSTRUÍDO
- 01Corpus curado com proveniência
- 02Recuperação TF-IDF e resposta extrativa
- 03Recall@3, MRR e métricas de citação
- 04Casos de segurança e fora de escopo
- 05CLI, artefatos, dashboard e threat model
VALOR PROFISSIONAL
- Avaliação de RAG
- Segurança e recusa calibrada
- Proveniência de fontes
- Base mensurável antes de adicionar LLM
LIMITES QUE PERMANECEM VISÍVEIS
Responsabilidade também é parte do produto.
- Benchmark pequeno criado pelo próprio autor
- 100% é regressão interna, não generalização
- Filtro textual não substitui avaliação clínica
STACK
Pythonscikit-learnStreamlitRAG evaluationpytestDocker