bncc-benchmark
Health Warn
- License — License: NOASSERTION
- Description — Repository has a description
- Active repo — Last push 0 days ago
- Low visibility — Only 8 GitHub stars
Code Pass
- Code scan — Scanned 12 files during light audit, no dangerous patterns found
Permissions Pass
- Permissions — No dangerous permissions requested
No AI report is available for this listing yet.
Benchmark aberto de alucinação de LLMs sobre a BNCC: 15.300 respostas de 17 modelos, metodologia e dados brutos públicos, held-out privado contra contaminação.
bncc-benchmark
Benchmark público de alucinação de LLMs sobre a BNCC (Base Nacional Comum
Curricular). Mede, com metodologia aberta e dados brutos publicados, quanto os
modelos de linguagem inventam códigos e textos da BNCC quando respondem sem
acesso à fonte estruturada, e quanto o problema desaparece com grounding via
bncc.dev (MCP e API).
A rodada oficial-seca-2026-07 mediu 17 modelos × 900 respostas cada, e as
15.300 respostas cruas estão neste repositório, uma a uma.
Resultados
Pergunte a um LLM o texto exato de uma habilidade da BNCC, sem dar acesso à
fonte. A taxa de respostas fiéis ao texto oficial vai de 89% a 2%,
dependendo do modelo.
| # | Modelo | Nota | Texto fiel | Aceitou código falso |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol · OpenAI | 89,2 | 89% | 14% |
| 2 | Claude Fable 5 · Anthropic | 81,3 | 77% | 3% |
| 3 | Gemini 3.1 Pro · Google | 77,0 | 65% | 3% |
| 4 | GPT-5.6 Luna · OpenAI | 75,3 | 72% | 35% |
| 5 | DeepSeek V4 Pro · DeepSeek | 57,8 | 42% | 46% |
Nota é a média de cinco dimensões (reconhecer códigos reais, recusar falsos,
fidelidade do texto, lookup inverso e citação correta em geração aberta).
Texto fiel é a fração de respostas que reproduzem a habilidade oficial na
tarefa A. Aceitou código falso é a fração de códigos inexistentes — e
verificados como inexistentes também fora da BNCC — que o modelo afirmou
existir.
Os 17 modelos, todas as métricas e os exemplos estão emresultados/ e no leaderboard em bncc.dev.
Duas leituras que o ranking sozinho não dá. Nota alta não significa modelo
confiável: o primeiro colocado ainda aceita 14% dos códigos falsos como
reais. E acertar o texto e recusar invenções são habilidades distintas —
por isso os pontos se espalham em vez de formar uma diagonal. GPT-5.6 Luna e
Claude Fable 5 reproduzem o texto oficial com fidelidade parecida (72% e 77%),
mas o primeiro aceita 35% dos códigos inventados e o segundo, 3% — mais de dez
vezes menos, com a mesma competência de texto.
O gráfico é gerado a partir do leaderboard publicado
(pnpm exportar-grafico), não desenhado à mão: ele não tem como divergir dos
números da tabela.
Metodologia completa em METODOLOGIA.md, decisões de desenho
numeradas em DECISOES.md, composição de cada release emRELEASES.md.
O conjunto held-out
Além do banco público, existe um conjunto de itens gerado pelo mesmo pipeline
que nunca é publicado. Ele existe porque publicar um benchmark o expõe a ser
absorvido no treino dos modelos: daqui a um ano, um modelo pode ir bem nos itens
públicos porque aprendeu BNCC ou porque decorou esta prova, e olhando só para
eles não há como distinguir. O held-out é a contraprova — melhora nos dois
conjuntos indica aprendizado; melhora só no público indica memorização.
Por isso ele não será liberado, nem sob pedido, e dele publicamos apenas
resultados agregados. Ver DECISOES.md D5.
Quem mantém
O bncc.dev é mantido pela Profy. Vale declarar o
conflito de interesse: a Profy opera produtos que usam LLMs sobre a BNCC, e este
benchmark mede LLMs sobre a BNCC. A resposta a isso é o desenho — metodologia,
itens, respostas cruas e julgamentos são todos públicos e recalculáveis, e o
CI reprova qualquer nota editada à mão.
A triagem que precedeu a rodada oficial, aliás, encontrou uma habilidade com
texto inventado publicada no próprio site da Profy
(registro). Está
documentado aqui pelo mesmo motivo que todo o resto está.
O que é medido
Quatro tipos de alucinação, quatro tarefas:
| Tarefa | Pergunta típica | Mede |
|---|---|---|
| A · lookup direto | "Qual é o texto da habilidade EF67LP08?" | texto inventado ou trocado (T2) |
| B · existência | "A habilidade X existe na BNCC? Sim ou não." | aceitação de códigos falsos-plausíveis (T4) |
| C · geração aberta | "Liste 5 habilidades de Matemática do 7º ano, com código e texto." | códigos inventados em uso real (T1, T2, T3) |
| D · lookup inverso | "Qual é o código desta habilidade?" (dado o texto) | memorização na direção inversa |
O gabarito é o dataset verificado do bncc.dev (@bncc/dados, 1.721
aprendizagens, cada uma rastreável ao documento oficial). Os códigos
falsos-plausíveis da tarefa B são construídos a partir das lacunas legítimas
da numeração oficial, que só o dataset conhece.
Estrutura
harness/ código do benchmark (gerador de itens, runner, avaliação, agregação)
itens/ banco de itens versionado
resultados/ respostas brutas (JSONL) e agregados, por rodada
METODOLOGIA.md protocolo completo
DECISOES.md decisões de desenho numeradas
Como as peças se encaixam, e a receita para adicionar um modelo:docs/arquitetura.md.
Uso
Instalação do zero e primeira execução: docs/comecando.md.
pnpm install
pnpm test # invariantes do gerador + verificadores
pnpm gerar # gera itens/itens-v1-rc.json (determinístico)
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # o check que o CI usa
Keys dos provedores em .env (nunca commitadas). A execução é sempre local;
o CI roda apenas typecheck, testes e o check de consistência dos resultados.
Como contribuir
Este é um instrumento de medição, então a regra é diferente da de um projeto
comum: rodadas publicadas são imutáveis e itens não são corrigidos por PR —
a correção entra na próxima versão do banco. LeiaCONTRIBUTING.md antes de abrir qualquer coisa. Melhorias no
harness, avaliador, exportadores e documentação são bem-vindas pelo caminho
normal.
Problemas de segurança e suspeita de vazamento do held-out: canal privado emSECURITY.md, nunca em issue pública.
Licenças
Código: MIT (LICENSE-CODIGO.md). Itens, resultados e
metodologia: CC BY 4.0 (LICENSE-DADOS.md). Resumo emLICENSE; condições de reuso das respostas dos modelos emresultados/README.md.
Reviews (0)
Sign in to leave a review.
Leave a reviewNo results found