Comparativo de mercado

Comparativo de mercado

Apresentando nosso modelo de leitura de documentos frente a opções comerciais e LLMs genéricos.

Por que um modelo especializado em seguros é mais assertivo que soluções abrangentes.

Toda seguradora depende da leitura de documentos para decidir risco, regular sinistros, processar pagamentos e efetuar subscrições. 

O problema é que esses documentos quase nunca chegam em condições ideais. Fotos inclinadas, arquivos incompletos, carimbos sobrepostos, reflexos, digitalizações antigas e particularidades dos formatos brasileiros fazem parte da operação diária.

Nos últimos meses fizemos otimizações significativas no nosso modelo de leitura de documentos. Para desafiar o alcance dessa melhoria, colocamos ele contra as quatro IAs mais avançadas do mercado e três produtos comerciais especializados em leitura de documentos.

Precisão geral
Percentual de acerto sobre as 2.769 extrações avaliadas
Modelo BrickDemais soluções
Ver os dados em tabela
SoluçãoGeralTextosSim/NãoDatasNúmeros
Modelo Brick96,1%96%98%95%97%
Claude Fable 588,7%89%91%87%67%
Claude Opus 4.886,5%86%93%81%64%
Extend Parse 2.0 *84,0%82%93%88%67%
Gemini 3.1 Pro83,3%83%92%78%65%
Reducto80,4%81%84%75%64%
AWS Textract *80,4%78%90%87%67%
GPT-5.574,8%74%91%58%60%
O que testamos

Utilizamos documentos reais da operação de seguros, exatamente como eles chegam, sem nenhum tipo de preparo prévio, mantendo os arquivos em seu formato original para avaliar a capacidade dos modelos de interpretar os documentos diretamente.

A base contemplou diferentes formatos de entrada de documento, considerados cenários próximos da operação real, incluindo arquivos com baixa resolução, inclinação, múltiplas digitalizações e variações na estrutura visual.

Ao todo, foram avaliados 2.769 extrações individuais, incluindo informações textuais, datas, valores, números de documentos e respostas de sim ou não.

Oito soluções receberam exatamente o mesmo material e a mesma tarefa:

Agente especializado da Brick: Agente especializado na interpretação de documentos utilizados em operações de seguros.

Claude Fable-5: Modelo multimodal de uso geral desenvolvido pela Anthropic.

Claude Opus-4.8: Modelo multimodal de uso geral desenvolvido pela Anthropic.

Gemini 3.1 Pro: Modelo multimodal de uso geral desenvolvido pelo Google.

GPT-5.5: Modelo multimodal de uso geral desenvolvido pela OpenAI.

Reducto: Solução comercial especializada em extração e processamento documental.

Extend Parse 2.0*: Solução comercial de processamento e análise estruturada de documentos.

AWS Textract*: Serviço de extração de dados e textos desenvolvido pela Amazon Web Services.

O Extend Parse 2.0 e o AWS Textract operam em duas etapas: transcrevem o documento para texto (markdown) e um segundo modelo (Gemini 3 Flash) responde a partir dessa transcrição, sem acesso ao arquivo original. Isso significa que eles não são diretamente comparáveis às soluções que leram o arquivo bruto.


O resultado

Precisão geral

O modelo da Brick acertou 96,1% das informações extraídas, o melhor resultado geral. A diferença para o segundo colocado é de 7,4 pontos, e para o último, de 21,3 pontos.

Nenhuma das outras sete soluções ficou à frente da Brick em nenhum recorte do teste: nem por tipo de documento, nem por tipo de arquivo, nem por qualidade da imagem.

Precisão por categoria documental
Percentual de acerto em cada tipo de documento
Escolha a categoria · soluções ordenadas do maior para o menor
SoluçãoCertidõesCompr. resid.FinanceirosCNHsRGsOutros
Brick96%90%98%100%99%98%
Claude Fable 593%87%83%92%97%83%
Claude Opus 4.889%81%83%93%97%81%
Extend Parse 2.0*88%78%81%91%96%77%
Gemini 3.1 Pro86%79%79%90%95%79%
Reducto89%73%74%92%86%72%
AWS Textract*88%70%77%91%91%73%
GPT-5.573%68%78%83%82%75%
Brick
96%
Claude Fable 5
93%
Claude Opus 4.8
89%
Reducto
89%
Extend Parse 2.0*
88%
AWS Textract*
88%
Gemini 3.1 Pro
86%
GPT-5.5
73%
Onde a diferença fica mais evidente

O modelo da Brick 97% de precisão em campos numéricos. As soluções externas ficaram entre 60% e 67% justamente nos campos que carregam valores, quantidades, códigos de selo e números de CRM, as informações que a operação mais utiliza.

Precisão em campos numéricos
Valores, quantidades, códigos de selo e números de CRM
Modelo BrickDemais soluções
A faixa sombreada marca o intervalo em que ficaram todas as soluções externas, de 60% a 67%.
Estabilidade fora do cenário perfeito

Quanto mais o documento se aproxima de uma condição ideal, menor é a distância entre os modelos. 

Nos PDFs digitais nativos todas as soluções têm bom desempenho, de 94% a 100%. Mas, à medida que os arquivos se aproximam da realidade das operações (digitalizações antigas, imagens de celular, documentos inclinados e capturas de baixa qualidade), a diferença aumenta. 

Enquanto os modelos externos perdem precisão, o desempenho da Brick permanece estável. Nessa situação o modelo da Brick recua 4 pontos percentuais, enquanto as demais perdem de 12 a 22..

Do PDF digital ao arquivo do mundo real
A inclinação da linha é a queda de precisão. Quanto mais íngreme, menos robusta é a solução
Modelo BrickDemais soluções
Modelo Brick
100%
Claude Fable 5
99%
Claude Opus 4.8
99%
Extend Parse 2.0 *
97%
Gemini 3.1 Pro
97%
AWS Textract *
97%
Reducto
96%
GPT-5.5
94%
Passe o cursor sobre uma linha para ver a solução.
Desempenho de acordo com o documento

A Brick lidera em todas as categorias, tendo distância menor em documentos padronizados, como RG e CNH, onde o layout é sempre o mesmo. Em documentos financeiros e na categoria “outros”, onde os arquivos não seguem um modelo padronizado, o modelo da Brick tem desempenho superior, 98% contra no máximo 83% das demais. 

Precisão por tipo de documento
Percentual de acerto em cada tipo de documento
Escolha a coluna · soluções ordenadas do maior para o menor
SoluçãoCertidõesCompr. resid.FinanceirosCNHsRGsOutros
Brick96%90%98%100%99%98%
Claude Fable 593%87%83%92%97%83%
Claude Opus 4.889%81%83%93%97%81%
Extend Parse 2.0*88%78%81%91%96%77%
Gemini 3.1 Pro86%79%79%90%95%79%
Reducto89%73%74%92%86%72%
AWS Textract*88%70%77%91%91%73%
GPT-5.573%68%78%83%82%75%
Brick
96%
Claude Fable 5
93%
Claude Opus 4.8
89%
Reducto
89%
Extend Parse 2.0*
88%
AWS Textract*
88%
Gemini 3.1 Pro
86%
GPT-5.5
73%
O efeito sobre a operação

O que mede o valor de uma solução é se um conjunto de documentos atravessa a esteira sozinho, ou precisa de intervenção humana. Um documento de sinistro ou reembolso costuma exigir vários campos corretos ao mesmo tempo, e um único valor errado devolve o caso inteiro à fila. E é aí que a diferença de alguns pontos percentuais vira uma diferença de operação inteira.

Efeito da precisão sobre a revisão manual
exemplo considerando cinco campos críticos por documento
0%
dos documentos passam sozinhos com a Brick
180 de cada 1.000 vão para revisão manual
0%
com a melhor
IA genérica
450 de cada 1.000 vão para revisão manual
0%
com o melhor produto comercial
580 de cada 1.000 vão para revisão manual

Considerando um documento com cinco campos críticos, por exemplo, 96,1% de precisão corresponde a cerca de 82% de aprovação direta. A melhor solução externa chega a 55%. Ou seja, a cada mil documentos, 180 casos vão para revisão manual com a Brick, e 450 com a melhor das alternativas.

O alcance desses resultados

Este estudo foi desenvolvido para reproduzir condições próximas da operação real, mas possui limitações que devem ser consideradas na interpretação dos resultados.

Todas as soluções foram avaliadas utilizando os mesmos documentos, os mesmos campos e os mesmos critérios de validação. Não foram realizados ajustes específicos para cada modelo, buscando comparar o desempenho em uma configuração equivalente.

Os 96,1% da Brick são uma estimativa conservadora. A precisão documentada foi alcançada sob um critério cauteloso: os casos considerados incorretos nas soluções externas passaram por revisão humana, e, em 320 casos, deu razão à solução avaliada. Enquanto os resultados da Brick permaneceram sem esse ajuste. Mesmo assim, nenhuma das alternativas avaliadas superou nosso modelo. 

Algumas categorias de documentos continham um número menor de casos avaliados. Nesses grupos, pequenas variações no número de acertos ou erros podem produzir mudanças mais significativas no resultado percentual e, por isso, devem ser interpretadas com maior cautela.

O estudo representa uma análise do estado atual da tecnologia. Conforme novos modelos sejam lançados e novas bases documentais sejam incorporadas, avaliações futuras poderão complementar estes resultados.