Medido, não presumido
Evidência para a
camada de evidências.
Publicamos juntos o resultado concluído, a fronteira da medição e a limitação. O GQueries é avaliado separadamente quanto à recuperação, aos resultados do reader e à entrega fail-closed.
Examinar o benchmark ↗Resultado de recuperação concluído
A evidência certa,
sem despejar todo o histórico.
Em 979 perguntas MultiWOZ congeladas e válidas quanto ao suporte, usando o mesmo reader Qwen3 14B, ASM-CM + Bridge 8.1 obteve o melhor Recall@5 concluído e a melhor pontuação diagnóstica de resposta nesta comparação compacta.
1.09K2.04K2.20KUm orçamento é um controle de segurança
Mais contexto não produz automaticamente uma resposta melhor.
Em um controle LongMemEval-S separado — 500 perguntas, com GPT-4o como reader e juiz — elevar o orçamento de evidências de 2K para 28K aumentou a latência do reader e reduziu a precisão medida das respostas em quatro dos cinco sistemas de recuperação.
O resultado é deliberadamente restrito: ele não prova que mais contexto seja sempre prejudicial. Ele mostra por que a seleção de evidências, os orçamentos de tokens e o gate de entrega precisam ser medidos, não presumidos.
Como interpretar estes números
Um benchmark é uma fronteira,
não um slogan.
Somente artefatos concluídos
As alegações comerciais usam conjuntos de perguntas concluídos. Caminhos incompletos ou diagnósticos permanecem identificados como tais e são excluídos das comparações promovidas.
Separe as camadas
Qualidade de recuperação, qualidade do reader, volume de contexto, latência e contenção do Bridge respondem a perguntas diferentes. Não combinamos tudo em uma única métrica de vaidade.
Escolha perfis conforme a carga
ASM-CM, recuperação lexical e recuperação vetorial são perfis, não um vencedor universal. O invariante de produção é evidência autorizada e entrega fail-closed.