Comparativo de mercado
Apresentando nosso modelo de leitura de documentos frente a opções comerciais e LLMs genéricos.
Por que um modelo especializado em seguros é mais assertivo que soluções abrangentes.
Toda seguradora depende da leitura de documentos para decidir risco, regular sinistros, processar pagamentos e efetuar subscrições.
O problema é que esses documentos quase nunca chegam em condições ideais. Fotos inclinadas, arquivos incompletos, carimbos sobrepostos, reflexos, digitalizações antigas e particularidades dos formatos brasileiros fazem parte da operação diária.
Nos últimos meses fizemos otimizações significativas no nosso modelo de leitura de documentos. Para desafiar o alcance dessa melhoria, colocamos ele contra as quatro IAs mais avançadas do mercado e três produtos comerciais especializados em leitura de documentos.
Ver os dados em tabela
| Solução | Geral | Textos | Sim/Não | Datas | Números |
|---|---|---|---|---|---|
| Modelo Brick | 96,1% | 96% | 98% | 95% | 97% |
| Claude Fable 5 | 88,7% | 89% | 91% | 87% | 67% |
| Claude Opus 4.8 | 86,5% | 86% | 93% | 81% | 64% |
| Extend Parse 2.0 * | 84,0% | 82% | 93% | 88% | 67% |
| Gemini 3.1 Pro | 83,3% | 83% | 92% | 78% | 65% |
| Reducto | 80,4% | 81% | 84% | 75% | 64% |
| AWS Textract * | 80,4% | 78% | 90% | 87% | 67% |
| GPT-5.5 | 74,8% | 74% | 91% | 58% | 60% |
O que testamos
Utilizamos documentos reais da operação de seguros, exatamente como eles chegam, sem nenhum tipo de preparo prévio, mantendo os arquivos em seu formato original para avaliar a capacidade dos modelos de interpretar os documentos diretamente.
A base contemplou diferentes formatos de entrada de documento, considerados cenários próximos da operação real, incluindo arquivos com baixa resolução, inclinação, múltiplas digitalizações e variações na estrutura visual.
Ao todo, foram avaliados 2.769 extrações individuais, incluindo informações textuais, datas, valores, números de documentos e respostas de sim ou não.
Oito soluções receberam exatamente o mesmo material e a mesma tarefa:
Agente especializado da Brick: Agente especializado na interpretação de documentos utilizados em operações de seguros.
Claude Fable-5: Modelo multimodal de uso geral desenvolvido pela Anthropic.
Claude Opus-4.8: Modelo multimodal de uso geral desenvolvido pela Anthropic.
Gemini 3.1 Pro: Modelo multimodal de uso geral desenvolvido pelo Google.
GPT-5.5: Modelo multimodal de uso geral desenvolvido pela OpenAI.
Reducto: Solução comercial especializada em extração e processamento documental.
Extend Parse 2.0*: Solução comercial de processamento e análise estruturada de documentos.
AWS Textract*: Serviço de extração de dados e textos desenvolvido pela Amazon Web Services.
* O Extend Parse 2.0 e o AWS Textract operam em duas etapas: transcrevem o documento para texto (markdown) e um segundo modelo (Gemini 3 Flash) responde a partir dessa transcrição, sem acesso ao arquivo original. Isso significa que eles não são diretamente comparáveis às soluções que leram o arquivo bruto.
O resultado
Precisão geral
O modelo da Brick acertou 96,1% das informações extraídas, o melhor resultado geral. A diferença para o segundo colocado é de 7,4 pontos, e para o último, de 21,3 pontos.
Nenhuma das outras sete soluções ficou à frente da Brick em nenhum recorte do teste: nem por tipo de documento, nem por tipo de arquivo, nem por qualidade da imagem.
| Solução | Geral | Textos | Sim/Não | Datas | Números |
|---|---|---|---|---|---|
| Modelo Brick | 96,1% | 96% | 98% | 95% | 97% |
| Claude Fable 5 | 88,7% | 89% | 91% | 87% | 67% |
| Claude Opus 4.8 | 86,5% | 86% | 93% | 81% | 64% |
| Extend Parse 2.0* | 84,0% | 82% | 93% | 88% | 67% |
| Gemini 3.1 Pro | 83,3% | 83% | 92% | 78% | 65% |
| Reducto | 80,4% | 81% | 84% | 75% | 64% |
| AWS Textract* | 80,4% | 78% | 90% | 87% | 67% |
| GPT-5.5 | 74,8% | 74% | 91% | 58% | 60% |
Onde a diferença fica mais evidente
O modelo da Brick 97% de precisão em campos numéricos. As soluções externas ficaram entre 60% e 67% justamente nos campos que carregam valores, quantidades, códigos de selo e números de CRM, as informações que a operação mais utiliza.
Estabilidade fora do cenário perfeito
Quanto mais o documento se aproxima de uma condição ideal, menor é a distância entre os modelos.
Nos PDFs digitais nativos todas as soluções têm bom desempenho, de 94% a 100%. Mas, à medida que os arquivos se aproximam da realidade das operações (digitalizações antigas, imagens de celular, documentos inclinados e capturas de baixa qualidade), a diferença aumenta.
Enquanto os modelos externos perdem precisão, o desempenho da Brick permanece estável. Nessa situação o modelo da Brick recua 4 pontos percentuais, enquanto as demais perdem de 12 a 22..
Desempenho por tipo de documento
A Brick lidera em todas as categorias, tendo distância menor em documentos padronizados, como RG e CNH, onde o layout é sempre o mesmo. Em documentos financeiros e na categoria “outros”, onde os arquivos não seguem um modelo padronizado, o modelo da Brick tem desempenho superior, 98% contra no máximo 83% das demais.
| Solução | Certidões | Compr. resid. | Financeiros | CNHs | RGs | Outros |
|---|---|---|---|---|---|---|
| Brick | 96% | 90% | 98% | 100% | 99% | 98% |
| Claude Fable 5 | 93% | 87% | 83% | 92% | 97% | 83% |
| Claude Opus 4.8 | 89% | 81% | 83% | 93% | 97% | 81% |
| Extend Parse 2.0* | 88% | 78% | 81% | 91% | 96% | 77% |
| Gemini 3.1 Pro | 86% | 79% | 79% | 90% | 95% | 79% |
| Reducto | 89% | 73% | 74% | 92% | 86% | 72% |
| AWS Textract* | 88% | 70% | 77% | 91% | 91% | 73% |
| GPT-5.5 | 73% | 68% | 78% | 83% | 82% | 75% |
O efeito sobre a operação
O que mede o valor de uma solução é se um conjunto de documentos atravessa a esteira sozinho, ou precisa de intervenção humana. Um documento de sinistro ou reembolso costuma exigir vários campos corretos ao mesmo tempo, e um único valor errado devolve o caso inteiro à fila. E é aí que a diferença de alguns pontos percentuais vira uma diferença de operação inteira.
IA genérica
campos críticos por documento
Considerando um documento com cinco campos críticos, por exemplo, 96,1% de precisão corresponde a cerca de 82% de aprovação direta. A melhor solução externa chega a 55%. Ou seja, a cada mil documentos, 180 casos vão para revisão manual com a Brick, e 450 com a melhor das alternativas.
O alcance desses resultados
Este estudo foi desenvolvido para reproduzir condições próximas da operação real, mas possui limitações que devem ser consideradas na interpretação dos resultados.
Todas as soluções foram avaliadas utilizando os mesmos documentos, os mesmos campos e os mesmos critérios de validação. Não foram realizados ajustes específicos para cada modelo, buscando comparar o desempenho em uma configuração equivalente.
Os 96,1% da Brick são uma estimativa conservadora. A precisão documentada foi alcançada sob um critério cauteloso: os casos considerados incorretos nas soluções externas passaram por revisão humana, e, em 320 casos, deu razão à solução avaliada. Enquanto os resultados da Brick permaneceram sem esse ajuste. Mesmo assim, nenhuma das alternativas avaliadas superou nosso modelo.
Algumas categorias de documentos continham um número menor de casos avaliados. Nesses grupos, pequenas variações no número de acertos ou erros podem produzir mudanças mais significativas no resultado percentual e, por isso, devem ser interpretadas com maior cautela.
O estudo representa uma análise do estado atual da tecnologia. Conforme novos modelos sejam lançados e novas bases documentais sejam incorporadas, avaliações futuras poderão complementar estes resultados.
O que queremos colocar à prova agora
Entender melhor os erros em números e datas: Vamos classificar onde as soluções externas mais falham ( como formatação, separadores de milhar, números manuscritos ou escaneados e diferenças regionais) e testar se prompts específicos ou tratamentos após a extração conseguem reduzir essa distância.
Aplicar à Brick a mesma revisão humana: Uma próxima etapa é submeter os resultados do nosso modelo ao mesmo processo de revisão aplicado às soluções externas. Assim, todas as seis abordagens terão sido verificadas sob os mesmos critérios e poderemos medir a diferença final com ainda mais precisão.
Separar leitura de interpretação: Queremos comparar o desempenho dos modelos quando recebem o arquivo original e quando recebem o conteúdo já convertido em texto estruturado. Isso ajudará a mostrar quanto da diferença está na capacidade de ler o documento e quanto está na capacidade de interpretar as informações encontradas.
Explorar estratégias diferentes para cada tipo de documento: O Claude Fable 5, por exemplo, apresentou resultados competitivos em certidões e RGs. Testar um sistema que escolha a estratégia mais adequada para cada categoria pode revelar novas oportunidades de ganho.
Testar outras configurações do Reducto: Neste estudo, o Reducto foi utilizado com suas configurações padrão. Pretendemos repetir a avaliação com outros modos de OCR e processamento para entender se seu desempenho em documentos escaneados e imagens, 71% de precisão nesta última categoria, pode melhorar.