Medido, não presumido

Evidência para a
camada de evidências.

Publicamos juntos o resultado concluído, a fronteira da medição e a limitação. O GQueries é avaliado separadamente quanto à recuperação, aos resultados do reader e à entrega fail-closed.

Examinar o benchmark

Resultado de recuperação concluído

A evidência certa,
sem despejar todo o histórico.

Em 979 perguntas MultiWOZ congeladas e válidas quanto ao suporte, usando o mesmo reader Qwen3 14B, ASM-CM + Bridge 8.1 obteve o melhor Recall@5 concluído e a melhor pontuação diagnóstica de resposta nesta comparação compacta.

93.6%Recall@5ASM-CM + Bridge 8.1
66.5%Pontuação diagnóstica de respostaMesmo protocolo de 979 perguntas
1.09KTokens de entrada do reader / perguntaVolume de contexto medido
979/979Perguntas concluídasComparação de recuperação congelada
Frozen support benchmarkMultiWOZ
ReaderQwen3 14B · 979 questions
System
Recall@5
Diagnostic answer score
Reader input / question
ASM-CM + Bridge
93.6%
66.5%
1.09K
Vector RAG
70%
49.7%
2.04K
BM25
75.9%
56.8%
2.20K
Protocol-scoped results. Quality depends on workload, reader and retrieval profile; the Bridge is measured separately as the delivery boundary.

Um orçamento é um controle de segurança

Mais contexto não produz automaticamente uma resposta melhor.

Em um controle LongMemEval-S separado — 500 perguntas, com GPT-4o como reader e juiz — elevar o orçamento de evidências de 2K para 28K aumentou a latência do reader e reduziu a precisão medida das respostas em quatro dos cinco sistemas de recuperação.

O resultado é deliberadamente restrito: ele não prova que mais contexto seja sempre prejudicial. Ele mostra por que a seleção de evidências, os orçamentos de tokens e o gate de entrega precisam ser medidos, não presumidos.

4 / 5sistemas perderam precisão de resposta com o maior orçamento de evidências medido

Como interpretar estes números

Um benchmark é uma fronteira,
não um slogan.

01

Somente artefatos concluídos

As alegações comerciais usam conjuntos de perguntas concluídos. Caminhos incompletos ou diagnósticos permanecem identificados como tais e são excluídos das comparações promovidas.

02

Separe as camadas

Qualidade de recuperação, qualidade do reader, volume de contexto, latência e contenção do Bridge respondem a perguntas diferentes. Não combinamos tudo em uma única métrica de vaidade.

03

Escolha perfis conforme a carga

ASM-CM, recuperação lexical e recuperação vetorial são perfis, não um vencedor universal. O invariante de produção é evidência autorizada e entrega fail-closed.

Ver a suíte de segurança