作者:赵广立 来源:中国科学报 发布时间:2026/8/1 11:24:28
选择字号:
图灵奖得主转发推荐,中国“开源双子星”闪耀硅谷

 

中国AI 开源模型创新成果集中涌现,持续引发全球开发者关注。7月27日,月之暗面正式开源 Kimi K3 完整模型权重,随即登上国际开源AI模型社区Hugging Face总趋势榜第一,紧随其后的是百度开源模型 Unlimited OCR,两者包揽了Hugging Face榜单前二,被称为中国模型“开源双子星”。

Kimi K3 发布后,几十分钟内迅速登顶 Hugging Face 趋势榜,刷新平台的增长纪录。Unlimited OCR 5天内GitHub 星标榜突破 1 万,登顶 GitHub日趋势总榜和Python 榜、HuggingFace 全球模型总趋势榜和多模态模型趋势榜,实现“四榜第一”,被图灵奖得主、AI科学家杨立昆(Yann LeCun)转发推荐。

Yann LeCun转发推荐。截图自X平台

截至目前,Unlimited OCR 在GitHub 星标数量已突破 1.97万,HuggingFace 下载量达到 265 万。Unlimited OCR受到开发者持续关注,并非只是性能领先,更重要的是推动了长文档解析技术向前迈出关键一步。

过去,OCR 模型面对书籍、论文、报告等长文档时,通常需要采用“逐页解析+结果拼接”的工程方案,随着输出内容不断增长,解码阶段的 KV Cache 持续膨胀,推理速度和显存成本也随之增加。针对这一行业痛点,百度提出“参考滑动窗口注意力”(R-SWA)机制,借鉴人类阅读和抄录长文档时的工作方式——始终保持对原始文档内容的关注,同时仅保留最近一段生成内容作为“工作记忆”,而不是无限累积全部历史信息。基于这一设计,模型能够在一次前向推理中连续完成数十页文档解析,实现从第一页到最后一页的连贯输出,同时将解码阶段的键值缓存( KV Cache )控制在恒定规模,使计算成本和显存占用不随输出长度持续增长。这一突破不仅在于让OCR 解析更快、更准,更重要的是为大模型长程推理和记忆管理提供了新的思路。相较于依赖不断扩展上下文窗口提升能力,这一创新探索了以更高效的注意力机制实现长期任务处理的新路径。

近年来,中国人工智能企业围绕推理、多模态、长文本、文档智能等关键方向持续实现原创突破,逐步形成多点开花、协同创新的发展格局。从DeepSeek、Kimi,再到百度Unlimited OCR,中国AI输出的不仅是具有国际竞争力的模型,更是不断贡献原创技术、开源生态和创新范式。

Unlimited OCR开源地址:

GitHub:https://github.com/baidu/Unlimited-OCR

HuggingFace:https://huggingface.co/baidu/Unlimited-OCR

 
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。
 
 打印  发E-mail给: 
    
 
相关新闻 相关论文

图片新闻
青藏高原地球系统模型1.0版在京发布 新研究破解致命出血热病毒复制之谜
青藏高原首个综合性汞数据集发布 科学家首次观测到“系外月球”
>>更多
 
一周新闻排行
 
编辑部推荐博文