AI与科技第 90 期 ·

加拉帕戈斯的反击:韩软登顶GitHub第一的那天

35年积累的文档诀窍,第一次兑换成了全球通用货币……订阅者朋友,我是Oswarld。您是通过谷歌Discover发现我的新闻信推送来到这里的吗?订阅后即可最快收到有趣又有料的新闻信。🙇 开篇

加拉帕戈斯的反击:韩软登顶GitHub第一的那天

订阅者朋友,我是Oswarld。您是通过谷歌Discover发现我的新闻信推送来到这里的吗?订阅后即可最快收到有趣又有料的新闻信。🙇

开篇

订阅者朋友,您好。3月20日,PDF数据提取工具“OpenDataLoader PDF v2.0”登上了GitHub全站趋势榜第一名。仅21日一天,星标数就增加了1,800个,总星标数超过了7,000个。起初我并不知道这个OpenDataLoader是谁做的。后来看到有使用条款和韩语页面,心想“是韩国开发者做的吗?”,结果发现竟然是韩软做的,我大吃一惊。没错,就是那个韩软。

我完全可以把这条一句话新闻一带而过。“看来韩国公司做了个不错的开源项目。”但我把这件事看作韩国IT产业一个有意义的转折点。

因为长久以来,韩软一直被视为韩国IT“加拉帕戈斯”的代表企业。HWP格式、依赖政府和公共机构、海外营收微乎其微。韩软Office实际上30多年来几乎只在国内销售。在全球办公软件市场中,MS Office占据95%以上份额的同时,韩软Office能守住约30%的国内份额,就已经是韩软的全部游戏规则了。

而这次,韩软的技术第一次在全球开发者社区中直接接受了检验。而且是在“因为是韩国企业所以被照顾”这种加分项完全不存在的情况下,纯粹凭基准测试数字和星标数。在GitHub上登记的约4亿个项目中登上趋势榜第一名,几乎等同于穿过针眼。

今天我想聊聊这是怎么发生的,以及这个模式对其他韩国企业和我们个人有什么启示。

📊 基准测试说明了什么

先看数字。在OpenDataLoader方面公开的自有基准测试中,阅读顺序、表格、标题提取项目的文档平均得分如下。

  • OpenDataLoader(混合模式):0.907 ← 第1名
  • Docling:0.882
  • Nutrient:0.880
  • Marker:0.861
  • Unstructured(hi_res):0.841

必须诚实指出这是自有基准测试。不过韩软已经把测试数据和复现代码全部公开在GitHub上。如果想验证结果,任何人都可以自己跑一遍。

这里真正令人震惊的不是分数本身,而是速度。OpenDataLoader每页处理只需0.015秒。而精度相近的Marker每页则需要约53.9秒。相差约1,000倍,而且Marker必须依赖GPU,OpenDataLoader仅靠CPU就能运行。

这为什么重要?**假设企业实际业务中要处理100万页PDF,Marker需要约624天完成的工作,OpenDataLoader大约4小时就能搞定。**站在搭建AI训练数据流水线的立场上看,这不是“快一点点”,而是“第一次变得可行”。这也为没有高性能GPU基础设施的中小企业和独立开发者打开了一扇门。

**常说企业实际拥有的业务数据中80~90%是PDF、文档这类非结构化格式,而要把这些数据喂给AI,一直卡在数据清洗这一步。**PDF是为了在屏幕上好看地呈现内容而优化的格式,而不是为了方便提取数据而设计的格式。一个表格从哪里开始、到哪里结束,多栏排版中应该按什么顺序阅读,嵌在图片里的文字要怎么提取出来——能够精准且快速解决这些问题的工具,正是RAG1​时代的核心基础设施。

秘诀在于“混合引擎”。简单文本用基于规则(Rule-base)的方式即时处理,只有复杂表格或多栏排版才调用AI。这与其他在每一页都跑重型AI模型的工具,设计思路完全不同。

🏛️ 韩软35年积累下来的真正资产

这里就产生了一个疑问:为什么偏偏是韩软?

开源PDF解析器市场早已强手林立,比如Docling(依托IBM Research)、Marker、Unstructured(出身YC)等。然而,这次是一家韩国的35年老牌文字处理软件公司,在基准测试中超越了全球大型科技公司和硅谷创业公司做出的工具。

在这一点上,我认为应该重新审视韩软35年来积累的东西到底是什么。那就是韩软独有的“文档本体论2​”。哪些文字是标题、哪些是正文,表格的行列该如何拆解,多栏结构中的阅读顺序该如何还原——关于这些问题,韩软拥有长达35年的模式积累。韩软技术应用开发室室长Park Dong-hyun(音译)也在采访中表示:“基于处理公共机构和众多企业文档数据的经验,我们积累了独一无二的技术能力。”

有意思的是,韩软是在2025年7月与全球PDF技术专业企业Duallab签订谅解备忘录(MOU)后共同开发的。可以说这是韩软的文档处理诀窍与Duallab的PDF专业能力相结合的成果。这一点必须要指出:这并非韩软独立完成的技术。

即便如此,核心并没有变。韩软所拥有的关于“如何拆解文档”的一套自有整理体系,成为了全球合作的基础。Duallab之所以选择韩软作为合作伙伴,正是看中了这35年的分量。

从趋势来看,韩软近1年来在全球化方面的步伐明显加快。2025年12月与腾讯云建立战略联盟,2026年2月首次从日本Cyberlinks获得人脸识别解决方案的海外订单,4月参加日本IT Week。再加上这次GitHub趋势榜第一名。这里有一个明显的模式:不是拿着韩软Office成品出海,而是把其底层的技术资产按领域拆分出来,以全球合作与开源的形式对外释放。

🌏 逃出加拉帕戈斯的新公式

韩软并非一直没有尝试全球化。早在2016年,韩软就曾宣布以韩软Office Neo进军中南美、中国、印度、中东、俄罗斯5个地区。结果大家都知道。在MS Office在全球占据95%以上份额的市场里,拿着一个成品办公软件去插旗,几乎是不可能的事。

而这次的OpenDataLoader,方式完全不同。韩软没有拿出自己的成品(Office),而是把自己的核心能力(文档拆解诀窍)抽离出来,重新包装成全球开发者最需要的形态(开源PDF解析器)。而且还把许可证换成了最自由的Apache 2.03​,特意从原来的MPL 2.0改过来。

从GTM的角度看,这是一次非常重要的转变。从“出口成品”的模式,转向了“将核心能力作为标准基础设施免费分发→在其之上通过商用服务实现盈利”的模式。这与NVIDIA把CUDA免费开放、成为GPU计算标准,Stripe把支付API做得对开发者友好、进而掌控支付基础设施,是同一种模式。

实际上,韩软已经布好了下一步棋。数据提取(OpenDataLoader)→接入RAG(HancomPedia)→办公辅助(Hancom Assistant),形成一条“AI编排器”产品线。免费开放的OpenDataLoader一旦在全球铺开,其上运行的商用附加组件和HancomPedia就会创造收益。第二季度还将增加MCP4​支持和商用附加组件。

不过,这还不能保证一定成功。GitHub趋势榜第一名和真正拿下全球市场份额是两码事。Docling有IBM Research强大的背书,LlamaIndex也有自己的解析器。第一回合打得不错是事实,但游戏才刚刚开始。

Oswarld视角

在观察GTM战略的过程中,**韩国B2B软件公司全球化失败的模式几乎都很相似:“把在韩国国内卖得好的成品翻译成英文拿出去。”**韩软Office也好,之前无数次尝试也好,都是这个模式。

这次韩软的举动之所以有意义,正是因为它打破了这个公式。没有拿出自己公司最大、最重的资产(Office成品),而是把打造出这个资产的底层核心能力抽离出来,转化成全球开发者当下急需的形态。

时机也拿捏得恰到好处。2026年正是AI智能体正式开始调用外部工具来完成工作的时代。当智能体读取PDF、提取表格、通过RAG生成答案时,谁占据了这第一环——PDF解析器的位置,将左右未来几年企业工作流的标准。韩软特意把许可证从MPL换成Apache 2.0以降低进入门槛,正是为了抢占这个位置。在标准确定之前先进入,进而成为标准本身,这就是GTM的经典套路。

我认为这个模式对韩国其他加拉帕戈斯企业极具启示意义。Naver的搜索诀窍、Kakao的消息基础设施、Toss的金融UX、Coupang的最后一公里物流。这些东西如果以成品服务的形式出海,同样不容易。但如果把底层的核心能力抽离出来,重新包装成全球开发者可以使用的标准基础设施,情况就可能截然不同。

而这一点同样适用于个人。在AI时代,我们所拥有的最大武器不是一般性知识。因为LLM早已知道互联网上所有的一般性知识。真正有价值的,是只存在于我们脑海中的特殊性知识,也就是自己独有的整理体系。就像韩软35年只专注于文档这一件事所打磨出的那种精密度一样。

不过有一个前提条件:必须能够把那种特殊性知识转化成别人也能使用的形式拿出来。如果只留在脑子里,那就不是资产,只是经验而已。

✍️ 结语

今天的内容用三句话总结如下。

  • 韩软OpenDataLoader登顶GitHub第一名,是韩国加拉帕戈斯企业第一次直接接受全球开发者检验的案例。没有任何加分照顾,纯凭基准测试分数和星标数。
  • 这之所以可能,得益于35年积累的文档处理“本体论”,而这一次,是把这些能力以核心能力单位而非成品的形式抽离出来,做成开源发布。从GTM角度看,这是一种新公式。
  • 这个模式适用于其他韩国企业,也适用于长期专注于一件事的个人。在自己拥有独有整理体系的人身上,如今是一个具有压倒性优势的时代。

订阅者朋友,**过去10年、20年,您把时间最多花在了什么事情上?无论是什么,那里面很可能都沉睡着属于您自己的本体论。**接下来的问题是,该如何把它以别人能够使用的形式取出来。就像韩软的35年被兑换成GitHub第一名那样。

参考资料与延伸阅读

核心来源

背景知识

  • Best PDF Parsers for AI and RAG Workflows in 2026”,Firecrawl Blog。:比较了Docling、Marker、Unstructured等竞争工具的优势与局限的一篇文章。有助于判断OpenDataLoader在市场中所处的位置。
  • Auer et al.,“Docling Technical Report”,arXiv:2408.09869,2024。:可以通过官方文档确认最强劲的竞争工具Docling的设计理念。与OpenDataLoader对比,可以看出两者方法上的差异。
  • 韩软OpenDataLoader GitHub仓库。:可以直接下载使用的官方仓库。在README的基准测试部分,也能确认与其他工具的对比数据。

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. RAG(Retrieval-Augmented Generation,检索增强生成):AI在回答时,不仅仅使用自己脑子里(训练所得)的知识,而是先检索外部文档,再参考其内容进行回答的方式。可以想成考试时是开卷考试。因此,能多精确地提取外部文档(尤其是PDF),被认为决定了RAG回答质量的90%。

  2. 本体论(Ontology):是把某个领域的概念和关系用自己独有的方式整理出来的知识结构。就像图书馆有一套自己的书籍分类整理体系一样,韩软针对“文档”这个领域,35年来一直用自己的方式整理着“哪些是标题、哪些是正文,表格该如何拆解”这类问题。

  3. Apache 2.0许可证(Apache License 2.0):在开源许可证中属于最自由的一类。几乎无限制地允许商业使用、修改、再分发,也没有义务重新公开修改后的代码。企业引入时法律负担最小,是全球大型科技公司和创业公司最青睐的许可证之一。

  4. MCP(Model Context Protocol):是AI智能体调用外部工具或数据时使用的标准通信协议。可以想成笔记本电脑上有USB接口,任何设备都能插上使用一样,MCP就是为AI打造的“通用接口”标准。