Análise editorial original do OrbTrail, ampliada com pesquisa complementar, contexto prático e referências verificadas.
A Salesforce publicou em 2 de setembro de 2026 um conjunto de testes para melhorar respostas de RAG no Data 360. No benchmark WixQA, a combinação de configurações elevou a acurácia de 62,5% para 92,5% sem código personalizado nem treinamento de modelo. Em documentos empresariais complexos do OHRBench, o pipeline chegou a 86,8% de acurácia ponta a ponta. São resultados expressivos e reproduzíveis sobre bases públicas, mas não equivalem a uma promessa de que qualquer central de ajuda, manual técnico ou política interna ganhará os mesmos trinta pontos percentuais.
A pergunta central, portanto, é mais precisa do que 'qual configuração melhora o RAG?': como identificar se o erro nasce no processamento do arquivo, na divisão do conteúdo, na recuperação ou na geração — e provar que a correção se transfere para o corpus da empresa antes de ampliar contexto? A própria medição da Salesforce ajuda a separar as camadas. Depois da otimização completa, 40% dos erros restantes vieram da geração, 26% do processamento, 18% da busca e 16% da divisão. Essa distribuição pertence aos testes descritos e a Salesforce alerta que ela varia conforme o documento.
A leitura da OrbTrail é que a principal novidade não é um número isolado, mas a possibilidade de transformar RAG em sistema diagnosticável. Trocar o modelo porque a resposta está errada pode ser desperdício quando uma tabela foi desmontada na ingestão. Aumentar o top-k pode adicionar ruído quando o trecho correto já estava entre os primeiros resultados. E um prompt mais rígido não recupera um diagrama que nunca entrou no índice. O caminho seguro começa com um conjunto de perguntas verificáveis e muda uma camada por vez, mantendo modelo, corpus e método de pontuação sob controle.
A página precisa sobreviver à ingestão
No OHRBench usado pela Salesforce, o parsing inteligente levou o resultado ponta a ponta de 65% a 84,4%; o recurso é esperado para novembro de 2026.
Procedimento e ressalva ficam juntos
O tamanho do chunk deve preservar a unidade necessária para responder, não apenas obedecer a uma contagem fixa de tokens.
Relevância vence volume
A indexação enriquecida acrescentou 2,4 pontos no teste citado; top-k maior só ajuda quando traz evidência útil, não mais distrações.
Contexto correto ainda pode virar resposta errada
A Salesforce atribuiu 40% dos erros residuais à geração em seus benchmarks; fidelidade e completude precisam de métricas próprias.
O corpus local decide
Perguntas douradas, resposta esperada, evidência correta e análise por etapa formam o gate antes de promover a configuração.
Parsing inteligente corrige a página antes que a busca a interprete
O primeiro subtópico responde onde a informação pode desaparecer antes mesmo da recuperação. O OHRBench reúne 8.561 imagens de documentos de sete domínios e 8.498 pares de pergunta e resposta baseados em elementos multimodais. Seus autores mostram que ruído semântico e ruído de formatação produzidos por OCR se propagam pelo restante do pipeline. Uma tabela com células deslocadas, uma ordem de leitura incorreta ou um gráfico reduzido a texto incompleto não é apenas um problema visual: torna a evidência recuperada diferente da evidência publicada no documento.
Nos testes apresentados pela Salesforce, o parsing inteligente analisa cada página e encaminha conteúdo predominantemente textual ou visual para métodos de extração diferentes. No recorte do OHRBench, a acurácia para gráficos e diagramas passou de 57,9% para 76,3%; a de ordem de leitura em páginas multicoluna ou multipágina, de 11,9% para 67,1%; e o resultado ponta a ponta, de 65% para 84,4%. A empresa diz que o recurso é esperado para novembro de 2026. Logo, ele deve aparecer no planejamento como disponibilidade futura declarada, não como capacidade já garantida em todas as organizações ou regiões.
A decisão prática é classificar o corpus antes de escolher a correção. Separe artigos HTML simples, PDFs textuais, documentos com tabelas, apresentações, manuais com diagramas e arquivos escaneados. Para cada classe, selecione perguntas cuja resposta dependa exatamente da estrutura: a linha e a coluna de uma tabela, a sequência completa de um procedimento ou uma condição em nota lateral. Compare o texto extraído com a página de origem antes de medir a resposta do agente. Se a evidência já estiver corrompida nessa etapa, mudar embedding, prompt ou modelo apenas esconde o defeito.
Um benchmark mede o corpus que recebeu — não o seu
O segundo subtópico pergunta o que os 92,5% realmente provam. O WixQA foi construído com uma fotografia da base pública de ajuda da Wix e contém três conjuntos: 200 consultas reais com respostas multietapas escritas por especialistas, 200 pares derivados de diálogos e validados por especialistas e 6.222 pares sintéticos, um por artigo da base. Esse desenho é muito mais próximo de suporte empresarial do que perguntas enciclopédicas genéricas. Ainda assim, ele reflete vocabulário, estrutura editorial, idioma e políticas de um produto específico; não mede automaticamente contratos jurídicos, manuais de campo ou conhecimento interno em português e espanhol.
A Salesforce relata que, no mesmo benchmark, aumentar chunks de 512 para 2.048 tokens, elevar a profundidade de recuperação de 10 para 30 trechos e usar um prompt ajustado ao domínio levou o resultado de 62,5% a 92,5%. Esses três movimentos foram avaliados juntos na configuração informada. A equipe não deve transformar 2.048 e 30 em padrões universais: um procedimento longo pode se beneficiar de contexto contínuo, enquanto uma base com artigos curtos e repetitivos pode produzir chunks maiores cheios de assuntos concorrentes. O número útil é a diferença obtida sob condições controladas no corpus local.
O alerta independente vem de Lost in the Middle. O estudo mostrou que modelos podem usar pior uma evidência quando ela aparece no meio de contextos longos e que, em seu experimento de perguntas abertas, o ganho de desempenho saturou antes do recall do recuperador. Os modelos e o conjunto usados são de 2023, portanto o resultado não quantifica o comportamento dos modelos atuais do Data 360. Ele sustenta uma precaução arquitetural ainda válida: mais material recuperado cria oportunidade e distração ao mesmo tempo. Teste top-k em uma curva — por exemplo 5, 10, 20 e 30 — e registre recall, fidelidade, latência e consumo, em vez de aprovar o maior valor por definição.
Top-k maior só entra em produção com evidência por camada
O terceiro subtópico responde como transformar a demonstração em gate operacional. Comece com 20 a 50 perguntas e respostas corretas, faixa sugerida pela própria Salesforce para avaliação local. A amostra precisa representar a distribuição de trabalho, não apenas casos fáceis: inclua respostas em uma página, procedimentos multietapas, tabelas, perguntas sem resposta no corpus, versões conflitantes e termos usados por clientes que não aparecem literalmente no documento. Para cada pergunta, guarde a fonte e o trecho que deveria sustentá-la. Sem essa evidência, uma nota final não revela se o sistema acertou pelo motivo certo.
Em seguida, pontue camadas separadas. O framework de pesquisa Ragas distingue se a recuperação encontrou passagens relevantes e focadas, se o modelo usou essas passagens com fidelidade e se a resposta final atende à pergunta. A organização não precisa adotar uma biblioteca específica para aproveitar a decomposição. Pode medir hit ou recall do trecho esperado, precisão do contexto recuperado, fidelidade de cada afirmação, completude da resposta e recusa correta quando a base não contém evidência. Revisão humana permanece necessária nos casos de alto impacto e para calibrar qualquer avaliador automático.
Uma sequência de teste reduz conclusões falsas. Primeiro congele modelo e prompt e compare parsing; depois congele a melhor extração e varie chunking e indexação; só então compare top-k e prompt de geração. Promova uma configuração quando ela melhora o conjunto completo sem piorar de forma inaceitável a classe mais crítica, mantém respostas sem suporte abaixo do limite definido e cabe no orçamento de latência e consumo. Repita o conjunto após cada mudança relevante do corpus. A conclusão da OrbTrail é simples: o estudo da Salesforce mostra que configuração pode recuperar muito desempenho, mas o ativo durável não é a configuração vencedora — é o método que explica por que ela venceu e detecta quando deixa de vencer.




