baidu/Unlimited-OCR
OCR da Baidu que lê um documento inteiro, 40+ páginas, numa passada só do modelo, sem picotar página por página nem costurar o resultado depois. Está viralizando porque pegou o DeepSeek-OCR, febre do fim de 2025, e o levou um passo além com números públicos: 21,5 mil estrelas em seis semanas.
O que é, em uma frase honesta
É um modelo de visão e linguagem da Baidu, pequeno (3 bilhões de parâmetros no total, só 0,5 bilhão ativos por vez), que transforma documentos escaneados ou PDFs em texto estruturado de uma vez só, em vez de processar página por página. A novidade técnica tem nome: Reference Sliding Window Attention. Em linguagem de gente: o modelo funciona como uma pessoa copiando um texto, olha a fonte inteira o tempo todo, mas só relê as últimas linhas do que acabou de escrever, em vez de reler tudo desde o começo.
Isso mantém o custo de memória constante e permite transcrever dezenas de páginas numa única passada. O próprio README assume a herança: o objetivo declarado é 'empurrar o DeepSeek-OCR um passo além', usando o mesmo codificador visual daquele projeto.
Para que serve na prática
Digitalizar acervos de documentos longos: contratos de dezenas de páginas, laudos, apólices, processos, relatórios financeiros, livros escaneados. O que sai é texto estruturado com layout marcado, tabelas, fórmulas e posição de cada bloco na página. Os números publicados no paper: 93,23% no OmniDocBench (benchmark padrão de parsing de documentos), 6 pontos acima do DeepSeek-OCR, com taxa de erro de texto caindo de 0,073 para 0,038, na prática, metade dos erros.
Aguenta 40+ páginas numa janela de 32 mil tokens e roda nos motores de inferência usuais (transformers, vLLM, SGLang), com demo no Hugging Face e deploy na nuvem da Baidu. Como o modelo é pequeno, o custo por página tende a ser baixo comparado a mandar cada página para um modelo grande de visão.
Quando faz sentido pra você que lidera
Se a sua operação tem pilha de documento longo (jurídico, seguros, crédito, saúde), o gargalo dos OCRs atuais é picotar em páginas e costurar depois, cada emenda é um ponto de erro e de custo de engenharia. Um modelo que engole o documento inteiro simplifica esse encanamento. Pontos a favor: licença MIT (uso comercial livre), modelo pequeno que roda em infraestrutura própria, bom para dado sensível que não pode sair de casa.
Pontos de atenção: é um projeto de seis semanas de vida, sem histórico de manutenção longa; é da Baidu, o que pode pesar em compliance de alguns setores; e 'estado da arte em benchmark' não dispensa teste com os SEUS documentos, benchmark é prova de laboratório, não a sua fila de produção.
Por que está no mapa
21.493 estrelas e 2.151 forks desde a criação em 18 de junho de 2026, ritmo de fenômeno, quase tudo em 45 dias. O empurrão veio de surfar a onda que o DeepSeek-OCR abriu no fim de 2025 e se posicionar publicamente como o sucessor, com paper no arXiv (22/jun), demo no Hugging Face (24/jun), suporte a vLLM (28/jun) e a ferramentas de treino (21/jul) em sequência rápida. Nota para o acervo: já temos o PaddleOCR, também da Baidu.
São coisas diferentes, o PaddleOCR é a caixa de ferramentas clássica, um encanamento de vários modelos pequenos (detecta, depois reconhece, página a página); o Unlimited-OCR é um modelo único de nova geração que lê o documento inteiro de uma vez. A própria equipe usou o PaddleOCR para rotular os dados de treino do novo.
Valeu pelo feedback. Isso ajuda a afiar a biblioteca.