2026-08-25 15:53:10 西盟科技资讯
作者:白鹏飞
一个判断,值得所有做产业的人想三秒。
8月21日,2026科学智能大会在北京举行,近50位院士和来自政府、高校、科研院所、企业等机构的4000余人参加。之江实验室主任王坚在科学数据平行会议上提出:人工智能的发展经历了数据、模型、算力等要素接续推动的过程,下一阶段将进入新的“数据周期”——未来3至5年,甚至10年,推动AI变革的关键是科学数据。
更重要的是,今天讲“AI+科学”,不能只理解为“用AI帮助科研”。科学问题的挑战、科学数据的独特性,也可能反过来推动AI自身发生质变。
就在这场会议上,“让科学数据成为基础模型的原住民”成为圆桌主题。
“原住民”其实是一个更大的议题:如果科学数据要“住进”AI,那么金融、制造、医疗、能源……这些行业最核心的专业数据,什么时候也能真正“住进”AI?
这可能是未来十年,比“谁的模型更大”更值得关注的竞争。
一、为什么AI还读不懂真正重要的原始数据?
今天的大语言模型擅长处理文本、代码等已经被人类整理过的信息。但科学世界并不是一个“文本世界”。
一条光谱、一组地震波、一段基因序列,真正有价值的信息,往往不在文字说明里,而在原始数据的结构、变化和关系中。
在地学领域,超过70%的地球科学信息并不存在于文字论文中,而是沉淀在光谱、地震波、声波等原始观测数据里。
这意味着,“先把数据变成文字,再让AI理解”的路径,可能从一开始就丢失了最有价值的信息。
大会讨论的科学数据Token化,本质上就是在解决这个问题:不是把数据“翻译”成人类语言再给AI,而是让AI学会理解数据自己的语言。
二、重大科学发现,总发生在“数据重新相遇”的地方
这次会议上,有一个关键词印象深刻:相遇。
之江实验室专家分享了一个很有张力的案例:米兰科维奇旋回的证实,是天文数据与地学数据在时间轴上的“相遇”——早期的天体力学计算,后来被海底沉积岩中的周期性数据进一步验证。
过去,这种相遇依赖科学家的知识边界、跨学科交流和偶然机遇。
今天,AI提供了一种新的可能:把过去依赖人脑完成的数据连接,变成可以规模化、持续化的机器能力。
之江实验室的021科学基础模型,正通过统一编码、统一表征和关联推理,探索把跨学科连接沉淀为模型能力。
真正值得期待的,也许不是“AI能回答更多问题”,而是:AI开始有机会发现过去没人注意到的数据关系。
三、Token化:让不同数据拥有“机器可理解的表达”
天文图像、气象数据、数学公式,本来就不是同一种东西,怎样让它们进入同一个模型体系?
这正是Token化的难点。
上海科学智能研究院分享的“伏羲”气象模型,探索让多类科学数据原生接入模型,通过跨模态联合建模进行语义对齐;新加坡国立大学张磊则提出,数学今天已经“数字化”,却还没有真正“数据化”,需要让数学内容像代码一样可编译、可验证。
之江实验室史大治进一步指出,下一代基础模型的重要增量,不只是更多文本,而是大量尚未被模型处理和充分理解的原始科学数据;围绕这一目标,之江实验室正在建设海纳数据枢纽,探索多类科学数据Token化的方法。
Token化真正要解决的,是让原本彼此不同、彼此隔离的专业数据,获得机器可以理解、比较、关联和推理的表达方式。
四、每个行业,都有自己的“原始数据巴别塔”
把视野从科学领域拉出来,会发现一个更有意思的现象:每个行业,都有自己的“原始数据巴别塔”。
金融有高频行情,制造有设备传感流,医疗有医学影像和组学,能源有运行曲线和地质数据。
知识产权领域,则有专利全文、权利要求、附图、引用网络、法律状态与长期技术演化记录。
专利不是一篇普通的技术文章。
一份专利同时承载技术问题、技术方案、权利要求、附图和结构式等多模态信息,也包含申请、公开、授权、无效等法律状态,以及引用关系和长期的技术演化信息。
从数据形态看,专利更像一种多模态、关系化、带时间演化属性的技术知识数据。
全球90%以上的技术情报首先通过专利公开。如果把这个判断放到AI时代重新看,专利就不只是“数据库里的资料”,而是一层持续记录技术创新、演化与积累的结构化数据。
那么问题也随之发生变化:AI什么时候才能真正“读懂”专利?
五、为什么知识产权数据,值得成为“原住民”样本?
这也是在现场听到“让科学数据成为基础模型的原住民”后,特别想到八月瓜科技的原因。
过去,知识产权数据更像一种信息资源;今天,它正逐渐变成一种技术基础设施。
八月瓜科技长期深耕知识产权数据与AI服务,已形成覆盖全球178个专利受理局、超过2亿条专利数据的数据底座,并持续向智能化数据服务延伸。
但真正值得关注的,不只是数据规模。
专业数据要成为AI的“原住民”,真正的门槛是把复杂的数据变成机器能够理解、关联和调用的知识。
对专利而言,从清洗、去重、分类和语义标引,到图文关联、关系组织和技术知识表达,这件事的本质,不是简单地“做一个更大的数据库”,而是让原本供人阅读、搜索和分析的数据,逐步变成AI可以理解、调用和推理的技术知识基础设施。
从“检索专利”,到“理解技术”,再到“辅助创新决策”,知识产权数据正在经历一次角色变化。
六、竞争正在从“模型”,转向“专业数据原住民”
这次大会释放出的信号,正在从科研议题走向产业基础设施议题。
大会围绕科学数据底座、数据采集、清洗、标注、质量评价和科研流程智能化展开讨论;北京市相关科学智能政策,也把标准化科学数据底座作为重要方向。
这意味着,“数据底座”已经不只是科研机构内部的数据建设问题,而正在成为科学智能乃至AI产业竞争的基础设施问题。未来AI真正难复制的,也许不是某个模型,而是四件事能否同时成立:
高质量数据;
机器可理解的数据表达;
真实业务场景;
持续产生新数据的闭环。
一旦这些能力形成闭环,模型就不再只是“问答工具”,而开始成为一个行业的基础设施。
在科技创新领域,也可能需要经历同样的一次跃迁:让论文成为数据,让专利成为数据,让技术关系成为数据,让产业知识成为AI真正可以调用的知识。
谁能更早让自己的核心数据被AI真正理解,谁就可能更早获得下一轮创新的入口。而知识产权数据,也许正是这场“专业数据原住民化”中,一个值得长期观察的样本。
数据的相遇,往往就是下一个发现的开始。