当宾夕法尼亚大学金融学教授 Jessica Wachter 试图评估 AI 对经济的影响时,她发现传统金融模型几乎"失灵"了。与此同时,OpenAI 正在悄悄做另一件事——向生物数据发起猛攻。两件事看似无关,却共同勾勒出 AI 时代最真实的资本与技术图景。
一、当金融教授算不清 AI 的账

Jessica Wachter 的困惑,代表了当下整个金融学界面对 AI 时的集体焦虑。
问题出在哪?传统的资产定价模型,建立在"未来现金流可预测"的假设之上。但 AI 带来的,是一种结构性断裂——它不是让现有产业效率提升 10%,而是可能直接让某些产业"消失",同时凭空创造出我们今天还叫不出名字的新行业。
这就导致了一个尴尬的局面:
- 看多派认为,AI 是继蒸汽机、电力、互联网之后的第四次通用技术革命,其经济价值将以万亿美元计;
- 看空派则警告,当前 AI 基础设施的资本开支(CapEx)已经脱离了实际收入支撑,是一场典型的"资本错配"。
而 Wachter 的研究指出了一个被忽视的关键点:AI 投资的"不可逆性"。一旦企业斥巨资建起数据中心、采购 GPU 集群,这些沉没成本就锁死了未来的战略选择。如果 AI 商业化落地不及预期,这些资产将迅速贬值——这正是 2000 年互联网泡沫中光纤网络过剩的翻版。
二、万亿赌局的资金流向图
让我们把这场赌局的资金结构可视化一下:
这张图揭示了一个残酷的现实:投入是确定的,产出却是不确定的。科技巨头们用确定的现金流,去赌一个不确定的未来。
三、OpenAI 的"第二战场":生物数据
就在金融界为 AI 投资回报率争论不休时,OpenAI 却在做一件看似"不务正业"的事——大规模收购和整合生物数据。
为什么是生物数据?
因为语言模型的"数据红利"正在枯竭。互联网上的高质量文本,已经被各大模型厂商"刮"了一遍又一遍。Reddit、维基百科、学术论文……这些公开语料的价值正在被榨干。而生物数据,尤其是蛋白质结构、基因序列、临床记录,是一个几乎未被充分开发的"富矿"。
更重要的是,生物数据具有几个独特属性:
1. 高度结构化:氨基酸序列、碱基对,天然适合 token 化处理;
2. 因果性强:不像自然语言充满歧义,生物数据往往遵循明确的物理化学规律;
3. 商业价值直接:药物研发、精准医疗,每一个突破都是百亿美元级市场。
OpenAI 此举,本质上是在为"后语言模型时代"储备燃料。当 GPT 系列在文本任务上逼近天花板时,生物领域可能成为下一个"Scaling Law"的验证场。
四、代码视角:生物数据如何喂给大模型
如果你好奇生物序列是怎么变成模型输入的,下面这段 Python 代码展示了蛋白质序列的 token 化过程:
from transformers import AutoTokenizer, AutoModel
import torch
# 以蛋白质语言模型 ESM-2 为例
model_name = "facebook/esm2_t12_35M_UR50D"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModel.from_pretrained(model_name)
# 一段真实的蛋白质序列(胰岛素A链片段)
protein_seq = "GIVEQCCTSICSLYQLENYCN"
# 将氨基酸序列转为 token
inputs = tokenizer(protein_seq, return_tensors="pt")
print("Token IDs:", inputs["input_ids"])
# 前向传播,获取序列嵌入
with torch.no_grad():
outputs = model(**inputs)
# 取最后一层隐藏状态作为序列表征
embeddings = outputs.last_hidden_state
print("Embedding shape:", embeddings.shape)
# 输出: torch.Size([1, 23, 480])
# 23 = 序列长度 + 特殊token,480 = 隐藏维度
这段代码的关键在于:生物序列和自然语言一样,可以被离散化、嵌入、然后送入 Transformer。这正是 OpenAI 押注生物数据的底层逻辑——技术栈是复用的,只是数据源换了。
五、两件事,一个真相
把"万亿赌局"和"生物数据"放在一起看,你会发现它们指向同一个结论:
AI 的竞争,已经从"模型架构"转向"资源卡位"。- 万亿投资,卡的是算力和能源的位;
- 生物数据收购,卡的是稀缺语料的位。
谁能在这些不可再生(或难以快速复制)的资源上占据先机,谁就能在下一轮竞赛中掌握定价权。这不再是几个博士生在车库里调参就能颠覆的游戏——这是一场资本、能源、数据三位一体的重资产战争。
对普通从业者而言,这意味着两件事:第一,纯算法创新的边际收益在递减;第二,垂直领域的深度数据资产,可能比模型本身更值钱。
Jessica Wachter 的模型算不清 AI 的账,或许不是模型的问题——而是这个时代的经济规律,本身就在被 AI 重写。