AI for Science(科学智能)
技术、格局与产业机会
AI4S 正从"辅助计算工具"迈向"自主发现引擎",成为继大语言模型、具身智能之后 AI 落地的第三条主线。本报告梳理其技术原理、发展阶段、用户演进、全球玩家格局,并给出市场与产业机会研判。
Executive Summary
摘要与核心结论
AI for Science(AI4S / 科学智能)是用人工智能改造科学研究"提出假设—设计实验—计算模拟—验证发现"全链条的技术范式。它以 2020 年 AlphaFold2 攻克蛋白质折叠为标志走向主流,并在 2024 年因该成果获诺贝尔化学奖而获得学界与产业的双重背书。
四个核心问题的结论概括如下:
- 发展趋势:技术底座是"数据驱动 + 物理/先验知识约束 + 生成式设计"的融合。当前正处在从"AI 加速单点计算"向"AI 自主闭环发现"过渡的临界点——自动驾驶实验室与"AI 科学家"智能体是最前沿但尚未成熟的方向。
- 目标用户:核心用户仍是科研人员(高校、科研院所、药企/材料企业的 R&D),但正快速外扩到工程仿真、能源、气象、金融等产业研发岗,并通过对话式平台向"非计算背景的实验科学家"乃至教育、公众科学下沉。
- 方案提供方:形成三类玩家——通用 AI 巨头(DeepMind、微软、英伟达、Anthropic)、垂直科学平台(深势科技、Schrödinger、Isomorphic、Recursion)、自主实验室新锐(Lila、Periodic、Edison)。
- 产业机会:最确定的机会在 AI 制药、AI 材料、工程仿真三大高价值场景;平台层("科研安卓系统")、数据基础设施与科学专用算力是被低估的卖水机会。
Question 1 · Trend & Principle
一、发展趋势:原理、所解决的问题与所处阶段
AI4S 将数据驱动模型与物理定律、领域知识、传统仿真和真实实验相结合。核心不是生成一段答案,而是缩小搜索空间、降低计算与实验成本,并让每轮实验反哺下一轮模型。
图 1 | 典型 AI4S 闭环。真正的产业壁垒来自循环速度和数据质量,而不是其中某一个模型。
1.1 基础原理与研究范式
AI for Science 常被称为科学研究的"第四范式"(继实验观测、理论推演、计算模拟之后的"数据密集型科学发现")。其本质是把机器学习引入科学问题,用数据和算力去逼近那些传统上依赖第一性原理但计算代价极高、或根本无解析解的问题。可以按"AI 在科研里扮演什么角色"把方法分成四类:①②帮你算得更快(区别只在要不要遵守物理规律),③帮你造出新东西,④帮你自己动手做实验。
纯粹"从数据里学规律":喂给它大量"输入→结果"的样本,它学会直接预测,替代要跑几小时到几天的第一性原理计算(密度泛函、分子动力学、流体仿真),把耗时压到秒级。特点是快,但只认数据、不保证符合物理,遇到没见过的情况可能不准。代表:机器学习势函数、PhysicsX 工程仿真。
在 ① 的基础上,把守恒定律、对称性等物理规律"写进"模型,让预测不仅拟合数据、还必须符合物理,因此更可信、外推更稳。一句话区别:① 只从数据学,② 数据 + 物理一起学。代表:气象大模型 GraphCast/WeatherNext、核反应堆建模。
①② 是"给结构、算性质";生成式反过来——"给目标性质,造出满足它的新分子/新蛋白/新材料",从"预测已有"走向"创造未有"。代表:AlphaProteo、GNoME、"LLM+Diffusion"材料路线。
以 LLM 为"大脑"的科研智能体,自动串起查文献、提假设、写代码、跑机器人实验,形成"干湿闭环"。前三类是"工具",这一类是"会用工具的研究员"。代表:Edison/Kosmos、Lila、自动驾驶实验室(Self-Driving Lab)。
1.2 解决的问题:科学发现的"成本"与"维度"
AI4S 真正撬动的痛点是科学发现的高成本、长周期与高维搜索空间。传统研发往往依赖专家直觉加大量试错,一个新药十年十亿美元、一款新材料动辄数年。AI4S 在三个层面改变这一格局:
- 速度:把"数年"的研发周期压缩到"数月"。例如深度原理 Mira 材料平台已完成 40 项预测验证,Lila 用 4 个月筛出新型绿氢催化剂。
- 规模:一次性预测/枚举海量候选——AlphaFold 覆盖 2 亿+蛋白质结构,GNoME 发现数十万种稳定晶体材料。
- 可及性:把只有少数专家能做的高精度计算,变成"人人可调用"的 API 与对话式平台,降低科研门槛。
1.3 当前发展阶段:从"辅助计算"到"自主发现"
先看整体演进方向:AI4S 正从"更快的计算工具"(现状)走向"自主的发现引擎"(未来)。下图把这个转变拆成七个维度,再往下按成熟度分成三个阶段展开。
图 2 | AI4S 的演进主线:从"更快的计算工具"(As-Is)走向"自主的发现引擎"(To-Be)。
业界(英伟达、WAIC 2026 等)已将 AI4S 列为与大语言模型、具身智能并列的三大关键方向,潜在市场规模达千亿美元级。就成熟度而言,可分为三个阶段,当前整体处于阶段二、并在少数领域探索阶段三:
Question 2 · Users
二、目标行业与用户
目标用户:从科学家向整个研发与生产体系扩张
当前核心使用者仍是专业科研和研发人员。未来的扩大不是简单"大众化",而是专业能力被封装进软件、API 和智能体,使更多工程师与业务人员可以在受控工作流中使用。
图 3 | AI4S 的扩张方式是专业能力产品化,而不是取消专业门槛。
当前主要用户
- 高校与研究机构科研人员
- 药企生物学家、药物化学家、计算化学家
- 材料、化工、能源研发工程师
- 气象、地球科学和环境研究人员
- 仿真工程师、数据科学家和算法工程师
未来新增用户
- 企业研发管理与技术战略团队
- 制造工艺、质量与现场工程师
- 产品设计、供应链和技术服务人员
- 农业、环境、健康等专业服务机构
- 通过下游应用间接使用的普通用户
目标行业:各领域处于不同成熟阶段
用户从哪些行业来,取决于各行业进入 AI4S 的深度——而这并不一致。按能力成熟度可分为 L1→L4 四级:从最普及的科研辅助(L1),到单点专业模型(L2)、研发工作流(L3),再到仍在探索的自主科学发现(L4)。越靠上,商业化越早、价值越高,但对可靠性与验证的要求也越高。
图 4 | 行业并非整体处于同一阶段。工具层已出现规模使用,但通用自主科研仍缺乏充分的实验确认。
| 目标行业 | 所处阶段 | 现状说明 |
|---|---|---|
| 蛋白质结构预测 | 科研基础设施 | 已进入科研基础设施阶段。AlphaFold 证明 AI 能解决长期存在的重大科学计算问题,并推动结构生物学和药物研究。 |
| 气象预测 | 业务验证 | 进入业务验证与混合应用阶段。数据驱动模型在部分中期预报指标上达到或超过传统数值方法,但物理一致性、极端事件和业务责任仍重要。 |
| AI 制药 | 临床验证 | 进入临床验证阶段。候选药物已进入临床,但尚未证明 AI 能系统性提升最终获批成功率;行业评价正在从"发现速度"转向"临床证据"。 |
| 材料与工业研发 | 试点过渡 | 从论文验证向电池、化工、半导体和工程场景试点过渡。监管周期通常短于药物,具备更快验证商业回报的可能。 |
| 自主实验室 | 早期落地 | 在流程标准化程度高的化学、生物和材料实验中开始落地,但通用仪器适配、异常处理和经济性仍是主要约束。 |
| 数学与理论科学 | 研究探索 | AlphaProof、AlphaGeometry 等在竞赛级问题上取得突破,属最前沿的 L4 探索方向,距离常规科研生产力尚有距离。 |
Question 3 · Providers
三、全球典型方案提供方与其打法
全球 AI4S 供给侧可清晰划分为三种角色,它们的研究方式与商业模式差异很大:
- 通用 AI 巨头(平台/基础设施型):以基础模型能力和算力为杠杆,做横向平台。
- 垂直科学平台(领域深耕型):聚焦制药/材料等单一学科,做"物理+AI"的专用引擎并自建数据。
- 自主实验室新锐(闭环型):把"AI 科学家 + 机器人实验室"打包成自主发现系统。
3.1 海外阵营
| 企业 | 类型/特点 | 研究方式与代表成果 |
|---|---|---|
| Google DeepMind | 巨头 技术引领者 | 基础科学发现 + 多模态模型:AlphaFold(蛋白,诺奖)、AlphaProteo/AlphaGenome、GNoME(材料)、AlphaProof(数学)、WeatherNext(气象)、聚变等全领域布局 |
| Isomorphic Labs | 巨头 DeepMind 拆分 | AI 药物设计引擎 IsoDDE,AlphaFold3 底座;2026 年 5 月完成 21 亿美元 B 轮,与大药企合作 |
| NVIDIA | 巨头 基础设施 | BioNeMo 平台(虚拟筛选、基因组、影像),GPU 加速——让其他玩家的模型跑在其硬件上,"卖水人"角色 |
| Microsoft | 巨头 临床集成 | BioGPT/BiomedCLIP/TamGen 等 + Azure Foundry 部署,主打 EHR、医学影像与临床工作流 |
| Anthropic / OpenAI | 巨头 通用大模型 | Claude for Life Sciences、GPT-Rosalind:文献综述、监管/临床写作,通过连接器接入 Benchling、PubMed 等科研系统 |
| Schrödinger | 垂直 物理计算老兵 | 基于物理的分子模拟 + 机器学习做药物与材料设计,英伟达深度合作伙伴 |
| Chai Discovery | 垂直 大分子基础模型 | AI 药物设计,将结合亲和力提升百倍;成立 2 年估值超 38 亿美元 |
| PhysicsX | 垂直 工业仿真 | 高保真工程仿真压缩至秒级推理,与西门子、英伟达合作 |
| Lila Sciences / Periodic Labs | 自主实验室 | "完全自主实验室 + 科学超级智能":Lila 4 个月筛出绿氢催化剂;Periodic 2026 估值 75 亿美元 |
| Edison Scientific | AI 科学家 | Kosmos 协作式 AI 科学家系统,已声称做出 7 项原创科学发现 |
| SandboxAQ / CuspAI / Xaira | 前沿 | AI+量子融合、"物质世界搜索引擎"、最大虚拟细胞模型等新兴方向 |
3.2 中国阵营
中国已形成从算力、平台到应用的较完整梯队,制药与材料两条赛道最为密集:
| 企业 | 类型/特点 | 研究方式与代表进展 |
|---|---|---|
| 深势科技 (DP Technology) | 平台 "科研安卓系统" | 多尺度建模 + 机器学习仿真平台,赋能全球 1000+ 高校、300 万+科研工作者;2025 年完成 8 亿元 C 轮 |
| 晶泰科技 (XtalPi) | AI 制药 已上市 | "AI 设计+机器人执行+数据反馈"新范式;2024 港交所上市,2025 营收 8.03 亿元 |
| 英矽智能 (Insilico) | AI 制药 | Pharma.AI 端到端平台;2026 年与四家跨国药企合作总额近 70 亿美元 |
| 百图生科 (BioMap) | 生命科学大模型 | xTrimo 生命科学基础大模型(2100 亿参数),服务全球 800+机构 |
| 分子之心 | 蛋白设计 | MoleculeOS + MMDesign,纳米抗体靶点结合成功率超 90% |
| 深度原理 (DeepPrinciple) | AI 材料 | "LLM+Diffusion"双驱路线,Mira 平台完成 40 项预测验证;累计近 10 亿元融资 |
| 剂泰科技 (MetiS) | AI 药物递送 | NanoForge 递送平台,收录 1000 万+脂质;2026 授权合作超 16 亿美元 |
| 鸿之微 / 龙讯旷腾 | 材料仿真软件 | Phase Lab、PWmat 等材料多尺度计算工具,服务高端合金、新能源、量子材料 |
| 思朗科技 | 科学算力 | 自主 MaPU 架构 3D 科学计算机"天穹";2026 年 7 月科创板 IPO 受理 |
3.3 案例聚焦:上海AI实验室(浦江实验室)
作为中国 AI4S 的代表性"国家队",上海AI实验室(浦江实验室)不走单点模型路线,而是以「AGI for Science 珠穆朗玛计划」构建"科学智能创新中枢",秉持"通识为体、专业为用"、开源开放的思路,形成从底座到应用的全栈四层布局。它的独特之处在于把底层能力开放出去,与顶尖高校院所联合共创垂直科学模型,形成"能力赋能 → 场景共创 → 成果反哺"的生态飞轮。
| 层级 / 产品 | 定位 | 特点与研究方式 |
|---|---|---|
| Intern-S2 模型要素 | 科学多模态基座模型 | 397B、Mobius 新架构(知识–推理分离),397B 追平万亿模型、推理效率≈4×,已开源 |
| Agent-A1 智能体要素 | 智能体基座模型 | 35B MoE,长程规划 / 工具调用 / 科研执行,多项基准 SOTA,Apache-2.0 开源 |
| 书生·端砚 核心平台 | 科学发现平台(Intern-Discovery) | "假设→实验验证"全流程闭环;整合 200+ 智能体、2200+ 工具;聚焦生命科学、关键材料、半导体、核聚变、量子、地球气象六大领域 |
| DeepLink · Sciverse · 自主实验 基础设施 | 算力 / 数据 / 实验底座 | 超算+智算融合调度;100PB AI-Ready 数据;具身智能自主实验台,科研周期数年→3–6 月 |
| 生态联创模型 应用层 | 与高校院所共创的垂直模型 | 十项"AI+科学"成果:OriGene 元生(靶点发现)、EarthLink(地球科学,效率×160)、Viracle(病毒预测>95%)、丰登(育种)、ChemBOMAS(催化剂用量降至1/10)等 |
3.4 案例聚焦:深势科技(DP Technology)
与浦江实验室的"国家队"路线相对,深势科技是最具代表性的企业型平台玩家。成立于 2018 年、总部北京,以"多尺度建模 + 机器学习分子模拟"为技术内核,定位"微尺度工业设计基础设施",使命已从"科研提效工具"升级为"打造能帮助人类发现全新科学成果的 AI 科学家"。其整体打法与 AI4S "从提效到自主"的主线高度吻合,可从目标行业、产品组合、关键竞争力三方面看清。
目标行业。深势高度聚焦"研发成本高、微观机理决定性能"的物质科学三大场景——生命科学/药物、能源/电池、材料/化工,再借玻尔平台向高校基础科研与更广产业研发外扩。
产品组合。整体是一个"算力—模型—软件—平台—自主"的四层全栈,恰好对应 AI4S 从提效到自主的路径。
关键竞争力。
- 技术根基:深度势能 / DPA 让 AI 逼近第一性原理精度、同时具备大规模计算速度,破解传统"要么准要么快"的两难。
- 模型底座:覆盖原子→分子→蛋白→核酸→文献的"宇知"科学模型群,沉淀 1.7 亿英文文献 / 2 亿专利 / 8000 万中文文献等海量知识。
- 平台入口与数据飞轮:玻尔把算力、模型、软件、数据、协作整合为"科研操作系统",300 万科学家的入口是最大杠杆。
- 自主实验闭环(成型中):SciMaster + 玻尔·赛博实验室押注"自主发现"下一范式,价值最高但确定性最低。
- 与浦江的差异:浦江依托国家级平台 + 开源生态,深势以商业化软件立足、走平台化路线——两者在"平台入口"这一层直接竞争。
更完整分析见配套文档《深势科技_AI4S调研报告》。
Question 4 · Market & Opportunity
四、结论:潜在市场与产业机会
AI 科学发现市场 2025 年约 48 亿美元,预计 2035 年达 347.8 亿美元,2026–2035 复合增速约 21.9%。若计入更广义的 AI+生命科学、AI 制药与工程仿真,可寻址市场(TAM)为千亿美元量级。结构性看点如下:
4.1 市场结构:钱在哪里
*按应用/产品/技术各自维度的份额;药物发现是最大应用,北美占约 40% 份额,亚太增速最快。
4.2 机会点与优先级
把机会点放到"商业确定性(纵轴)× 能力/资本门槛(横轴)"两个维度里,可以先看清哪些先做、哪些要重投入:左上象限"确定性高、门槛低"最适合优先切入,右下象限"确定性待验证、门槛高"更适合有资源的大玩家长期布局。
图 7 | 概念性机会矩阵。具体象限会随行业、客户基础与团队能力变化。
展开为七个具体机会点:
4.3 机会研判小结
- 短期(1–2 年)最确定:AI 制药与 AI 材料的平台化服务、工程仿真提速、科学算力与数据基础设施。
- 中期(3–5 年)高弹性:自动驾驶实验室与 AI 科学家智能体从 Demo 走向可复现的生产力,谁先跑通"干湿闭环"谁获超额回报。
- 切入建议:非头部玩家宜避开与巨头正面竞争基础模型,转而在特定学科数据、垂直工作流、算力/实验室硬件等"缝隙"建立壁垒;或做连接通用大模型与专业科研系统的中间层。
Caveats
风险与不确定性
- 阶段三被高估的风险:"AI 自主发现原创科学"目前多为企业宣称,独立复现与同行评议尚不充分,评价标准缺失,存在过度炒作成分。
- 数据与可复现性:科研数据孤岛、负样本缺失、实验不可复现,制约模型泛化与可信度。
- 市场规模口径差异大:不同机构对"AI4S"的边界定义不同,48 亿/千亿等数字口径不一,宜作趋势参考而非精确预测。
- 监管与信任:在制药、临床等强监管领域,AI 结果的可解释性与合规是商业化的硬约束。