泡泡资讯网

连杨立昆都转发了,这个OCR为什么又火了?

最近,厂厂的主页又被Unlimited OCR这个老朋友刷屏了。自打上个月,它刚开源的时候,就连续登顶了 GitHub、HuggingFace 多个榜单。没想到最近,它又冲回 HuggingFace 全球模型总趋势榜前三。

如果说发布初期登顶 GitHub、HuggingFace 多个榜单,是一次集中爆发,那么最近发生的事,更能说明它强劲的后劲。Unlimited OCR近期再次冲上 HuggingFace 全球模型总趋势榜前三,同时获得图灵奖获得者、AI 科学家杨立昆(Yann LeCun)的转发推荐。截至目前,项目GitHub Star已突破 1.65 万,HuggingFace下载量达到224万。对于开源项目来说,比起一时冲榜,更难的是持续获得全球开发者社区的关注。

很多人会觉得,OCR不就是把图片里的文字识别出来吗?但事实上对于行业来说,真正难的从来不是识别一页,而是处理一整份长文档。比如一本书、一篇几十页的论文,或是一份上百页的 PDF。

过去,大多数 OCR 都采用的是“逐页解析”:先识别每一页,再把结果拼接起来。这种方式虽然能完成识别,但面对长文档时,跨页表格、阅读顺序、上下文关联等信息很容易丢失,也难以保证整份文档的连贯性。而Unlimited OCR 瞄准的,恰恰正是这个行业痛点。它提出了 R-SWA机制,让模型能够一次连续解析数十页文档,同时将解码阶段的KV Cache控制在恒定规模,不会随着输出越来越长而不断增加计算和显存开销。简单来说,这个机制既能“一口气读完整份文档”,又不会因为文档越来越长而拖慢推理速度。

技术社区其实很少因为“热度”长期关注一个项目。真正能留下来的,往往还是技术本身『打动人心』。Unlimited OCR 再次刷屏后,海外开发者社区的讨论重点,也逐渐从"它火了"转向了"它为什么火"。相比识别速度,大家更关注的是它在长文档解析上的能力:一次连续处理整份文档、保留跨页上下文,以及更高效的推理方式。也正因如此,不少开发者认为,它为长 PDF、论文、书籍等场景提供了一种新的解决思路。

对于开源项目来说,真正的价值,最终还是会回到开发者社区。厂厂也会持续关注 Unlimited OCR 的后续进展。

无限OCR UnlimitedOCR 百度 文心大模型 文心OCR 开源 GitHub HuggingFace