OCR It – pull text out of un-copyable documents for your LLM
把扫描书、PPT、防复制PDF一键OCR成文本,喂给LLM零配置,开箱即用。
Article URL: https://github.com/thiagotigaz/ocr-it Comments URL: https://news.ycombinator.com/item?id=49415852 Points: 111 # Comments: 26
把扫描书、PPT、防复制PDF一键OCR成文本,喂给LLM零配置,开箱即用。
Article URL: https://github.com/thiagotigaz/ocr-it Comments URL: https://news.ycombinator.com/item?id=49415852 Points: 111 # Comments: 26
智能体历史记录膨胀是部署大痛点,AgentOCR用光学自压缩给记忆瘦身,值得一看。
arXiv:2601.04786v3 Announce Type: replace-cross Abstract: Recent advances in large language models (LLMs) enable agentic systems trained with reinforc…
Mac上任意文字一抓即懂,AI翻译与理解同步完成,办公阅读效率瞬间拉满。
Capture, translate, and understand any text on your Mac Discussion | Link
专为AI打造的文档转换利器,将PDF、图片等任意文档转成统一Markdown,智能分离文本与图像,大幅降低处理成本。
Firecrawl 最近开源了 PDF Inspector 和 AnyDoc 两个项目,解决 AI Agent / RAG 场景里的一个基础问题:如何把各种文档快速、准确地转换成 AI 能理解的 Markdown。@Appinn Firecrawl 是一个面向 AI 应用的网页抓取与数据转换平台,主
跨越数字与拍摄场景的OCR解析新框架,攻克透视畸变和复杂排版难题,自动化文档处理更精准。
arXiv:2608.12898v1 Announce Type: new Abstract: Document parsing aims to transform unstructured documents into structured and machine-readable represe…
开源OCR模型PaddleOCR-VL-1.6价格低至每千页1美元,前1000页免费,基准测试领先。
This was not supposed to become a product. When PaddleOCR-VL-1.6 dropped, independent benchmarks put it at the top of document parsing models. I had t…
0.8B端到端模型首次超越流水线方法,阿里开源OvisOCR2以96.58分登顶文档解析榜单,技术路线迎来重要突破。
IT之家 7 月 24 日消息,今日,阿里云开源发布文档解析模型 OvisOCR2。该模型以 96.58 的综合得分刷新 OmniDocBench v1.6 榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,官方称“这是文档解析领域迎来技术路线的重要突破”。 端到端模型首次超越流水线方法 I…
利用GPT-5等前沿大模型驱动自动机器学习,实现跨语言手写OCR的闭环神经架构搜索,突破传统方法瓶颈。
arXiv:2607.15509v1 Announce Type: cross Abstract: We present a fully automated closed-loop AutoML framework that uses GPT-5, GPT-4o, and Claude Sonnet…
ICDAR 2026举办LLM辅助历史文档OCR后校正比赛,前沿赛道与经典难题结合,值得关注。
arXiv:2607.08143v1 Announce Type: new Abstract: We present the results of HIPE-OCRepair-2026, an ICDAR competition on LLM-assisted OCR post-correction…
一键从传真/PDF/图片中提取结构化数据,自动输出JSON,无需编码
Fax is still part of a lot of real business workflows. Healthcare, insurance, logistics, legal, finance, and back-office teams still receive forms, in…
专为开发团队打造的截图录屏利器,集标注、OCR、贴图于一体,让反馈与文档更高效。
各位少数派的朋友好,距离上一次在少数派介绍1Capture已经过去一年。过去这段时间里,我们开发的这款Mac截图与录屏工具继续做了多轮更新,也根据用户反馈补齐了一些更适合团队协作和产品展示的功能。市场 ... 查看全文
复杂版面阅读顺序推断新突破,聚焦中世纪手稿多栏交错文本,提升OCR数字化准确率。
arXiv:2607.01018v1 Announce Type: cross Abstract: Reading order inference remains a critical bottleneck in the digitization of complex historical manu…
白描九周年推出鸿蒙版与PDF共创,手机变身随身文档工作台,扫描转换翻译一站搞定。
2017年6月21日,白描App按下了发布键。那时的它还很简单,甚至有些单薄:拍下一张图片,识别里面的文字,再复制出来。它最初想解决的,也只是一个非常具体、非常日常的小烦恼:帮女朋友把读书笔记从照片里 ... 查看全文
AI agent能看但看不透银行App?只因无障碍化差异——好用的全自动,残障的隐形。
Day 12. WhatsApp is fully automatable. Banking apps are invisible. The reason is accessibility. For 11 days, I've been building an AI agent that can s…
百度OCR模型登顶四大榜单,中国移动成立Token办公室,科技与政策动态速览。
大公司: 蜜雪冰城吉尔吉斯斯坦三店同开,已进入海外16个国家 36氪获悉,近日,蜜雪冰城三家门店在吉尔吉斯斯坦首都比什凯克营业,正式进入吉尔吉斯斯坦市场。吉尔吉斯斯坦是蜜雪冰城在中亚的第二站。2025年4月,蜜雪冰城哈萨克斯坦首店落地阿拉木图。在这之后,又相继进入美国、巴西、墨西哥等新市场,持续推进…
百度开源新OCR技术突破“一次性”处理整本书,前DeepSeek研究员打造,显存占用几乎不增长。
百度开源端到端OCR模型,总参30亿仅激活5亿,有效解决文档解析越生成越慢问题
IT之家 6 月 25 日消息,百度于 6 月 22 日开源推出 Unlimited OCR 模型,总参数量 30 亿,推理时仅激活 5 亿参数 ,目标解决在解析长文档时,端到端 OCR 模型越生成越慢的问题。 IT之家注:端到端 OCR 模型是统一神经网络架构系统,融合检测图像中的文本和字符识别,…
百度开源超长文本解析OCR新方案,一次识别搞定大段文字,毫无分段限制。
Article URL: https://github.com/baidu/Unlimited-OCR Comments URL: https://news.ycombinator.com/item?id=48643426 Points: 383 # Comments: 91
端到端OCR模型借助大语言模型解码,解锁更强识别能力,DeepSeek OCR引领新突破
arXiv:2606.23050v1 Announce Type: cross Abstract: Recently, end-to-end OCR models, exemplified by DeepSeek OCR, have once again thrust OCR into the sp…