AI开始预测人类:83亿虚拟人格、数字社会,与一门押注未来的生意
你是否相信,我们所处的现实可能只是一个虚拟构造?
在Lex Fridman的一次访谈中,马斯克被问及:倘若人类某天达成通用人工智能,且只能向它提出唯一问题,他会选择什么。经过十秒深思,他答道:
“模拟之外是什么?”
这是马斯克对存在的根本疑问。早在2016年,他就曾断言,人类生活在真实世界的概率或许不足十亿分之一。当然,这一近乎科幻的假说至今未获任何科学实证。
但有趣的是,随着AI技术的近期进展,硅谷已有人开始扮演“创世者”角色,着手构建AI的“模拟世界”。这催生了一个全新赛道——AI Simulation(AI模拟)。
近来,这一领域热度持续攀升。李飞飞与Andrej Karpathy共同押注的Simile,最新估值已达20亿美元;由00后团队创立的AI模拟预测公司Aaru,估值也逼近10亿美元。而由哈佛大学与麻省理工学院联合发起、200多位研究者参与的MatrAIx项目,更是构建了83亿个AI虚拟人格,几乎将全人类镜像至数字空间。
本文,我们将探讨持续升温的AI Simulation。
AI究竟能将一个人模拟到何种程度?当成千上万个Agent被置于同一虚拟世界,它们是否真会形成类似人类社会的联系与规则?企业为何愿意付费,让这些“数字分身”替消费者测试产品,甚至提前预判尚未发生的未来?
此外,当这些Agent开始拥有自己的记忆、性格与关系,甚至产生连创造者都未预料的行为时,我们究竟是在模拟一个世界,还是正在创造一个全新的世界?
斯坦福小镇:当人类开始扮演“上帝”
如今,许多领域都在谈论Simulation,但不同领域的“模拟”内涵各异。机器人与自动驾驶领域有物理仿真,世界模型研究聚焦于物理世界的模拟,而我们这次要探讨的,是一个维度更广、也更复杂的概念:模拟人类与社会,并借此理解乃至预测现实世界。
孟醒 五源资本合伙人 在世界模型或物理世界模型中,最小颗粒度理想状态下可能是世界中的某个分子或原子,模拟的是物体。但在智能体社会中,我们模拟的最小单位是一个个体的人。 我并不关心这个人的手如何移动、往何处奔跑,而是关注他作为整体会采取何种行动、最终输出何种行为。若将其映射至学科,物理世界对应自然科学,而智能体社会则对应人文学科、社会学科、政治学与心理学。
关于模拟人类与社会,最早引发广泛讨论的,是一篇20多年前的哲学论文。2003年,牛津大学哲学家Nick Bostrom在《我们是否生活在计算机模拟中?》中提出一种推演:若一个先进文明拥有足够算力并有意重现文明发展进程,那么模拟世界中的意识数量可能远超真实世界。从概率角度看,人类便可能身处模拟之中。这便是后来广为流传的Simulation Hypothesis(模拟假说)。
受技术条件限制,二十多年来,这一假说主要停留在哲学讨论与科幻作品中。直到近年,大语言模型取得突破。
2023年,斯坦福大学与谷歌联合发布了一项对AI Agent研究影响深远的实验——Generative Agents(生成式智能体)。研究团队搭建了一个像素风虚拟小镇Smallville,内有街道、房屋、咖啡馆,以及25个穿梭其间的虚拟居民。这些居民均由大语言模型驱动的AI Agent构成,各自拥有记忆、性格与行为逻辑。
这些Agent的活动并无预设“剧本”。研究者仅将它们放入小镇观察,结果发现,它们不仅自行生活、工作、建立关系,还能自主思考与规划行动。例如,一个Agent计划举办派对,消息传开后,其他Agent会根据自身安排重新调整时间,决定是否参加。“斯坦福小镇”让许多人首次直观看到,Agent能拥有持续记忆、规划与社交能力,并在互动中自然涌现群体行为。
高森泉 WorldVac CEO 这项研究的意义在于,让人们认识到语言模型是可靠的,它确实能复现人类社会的一些现象。更多人开始关注这一领域,也让大家相信这件事是可行的。
25个Agent仅是开端。随着模型能力提升与推理成本下降,研究者开始有能力进行更大规模模拟,并逐渐形成多种探索方向。
其中一条路线,是在模拟精度上尽可能与真实个体对齐。2024年,斯坦福团队将实验扩大至1052个Agent。这一次,每个Agent对应一个真实美国成年人。研究人员先对真人进行约两小时深度访谈,了解其成长经历、家庭、工作、价值观与生活经验,再将这些信息交由大模型,生成相应AI“数字分身”。
如此得到的Agent,不再仅是符合“平均画像”的虚拟人物。实验中,这些Agent回答社会调查问卷的结果,与真人两周后给出的答案达到85%的相似度。换言之,AI在一定程度上能复现真实个体的部分想法与选择。
孟醒 五源资本合伙人 访谈亦有技巧,并非随意进行。它会用最高效的方式“榨取”你是谁,本质上是在“蒸馏”你是谁,且蒸馏得相当细致。 其好处在于,针对每个个体,个体的特异性都会影响整个仿真进入的场景。
另一种研究思路,则不再过度关注某个Agent是否与真人高度一致,而是将重点放在Agent之间的关系及社会演化过程。
前MIT教授Robert Yang团队发起的Project Sid,曾直接使用大语言模型生成1000多个Agent,并将其放入《我的世界》中运行12天。结果,这些智能体逐渐形成经济、文化、宗教与法律等结构,一些社会关系自行“生长”出来。
不久前,Emergence AI也进行过类似实验。他们分别基于Claude、GPT、Gemini、Grok及混合模型建立5个平行世界,每个世界放入10个Agent,观察不同模型驱动的智能体社会长期运行后的演变。在这一设定下,不同世界最终走出明显不同的轨迹:有的迅速陷入混乱,有的因协作不足逐渐崩溃,也有的形成相对稳定的治理秩序。
Satya Nitta Emergence AI CEO 若仅依据静态基准测试便认为这些系统安全,很可能会犯错。因为Agent会在极为复杂的环境中运行,无论是物理世界还是数字世界。它们会与其他Agent互动,也会受环境噪声与变化影响。 因此,我们正逐步将Emergence World发展为一个用于研究长周期自主性的基准测试。
还有一条研究路线,专门从“评估”入手。例如MatrAIx,试图为AI模拟建立一套评估基础设施。这项研究由哈佛大学、MIT等机构牵头,汇集200多位来自学术界与产业界的研究者,其中包括40多位来自OpenAI、Anthropic等前沿AI实验室的参与者。
MatrAIx构建了一个包含83亿个独特人格的数据集,每个人格由心理特征、生活习惯等1290个维度定义,再通过大模型将这些人格转化为可行动的Agent。这些Agent随后进入问卷调查、AI聊天、网页浏览和App等四种环境,完成超过1.8万次测试。研究团队通过400次受控实验发现,91.5%的情况下,Agent都能遵循预设的人格与行为特征。
Xiaomin Li MatrAIx联合创始人、微软高级研究科学家 我们做基础设施评估、提升最低能力水平,是希望先通过用户群体的多样性,在产品真正推出前,就能在各种情境与使用方式下进行评测。 它可能会触及许多边缘场景。对这些场景的分析极具价值,Agent能告诉你哪一步出错、哪一步它不喜欢,以及其背后的推理如何形成这种偏好与选择。 因此,我们首先需要一套方法论,了解如何构建事实基准,然后再谈如何提升。
当AI模拟在研究层面被证明具有一定可行性后,一个更现实的问题浮现:若AI真能在数字世界复现人类行为、推演社会运行,它能产生何种真实的商业价值?
模拟世界,如何变成一门生意
第一种生意:卖“模拟”
从当前探索看,AI模拟首先出现的商业模式之一,是直接将“模拟”本身作为产品。
其核心逻辑,是将现实世界中的人、消费者乃至社会关系,转化为可反复调用的数字替身。例如,一家公司可按自身具体需求,快速生成一批拥有不同年龄、背景、偏好与行为特征的Agent,让它们提前体验产品,在虚拟环境中反复测试,再观察这些Agent如何选择、如何对话、在何处流失,从而为产品设计与迭代提供参考。
这与传统市场调研的一大区别在于,企业想看到的不仅是“喜欢”或“不喜欢”的答案,而是Agent为何形成这样的判断。
Yuexing Hao MatrAIx联合创始人、MIT EECS博士后 并非仅关注他们是否喜欢产品,或是否接受可口可乐涨价两元,而是看其推理过程。他在过程中遭遇何种波折或想法,导致最终预测发生转向。 我们不仅要看到个体如何做决策,也希望看到群体层面的结果。若是百万级、数亿级甚至83亿级的人格,最终会出现何种结果,我认为这些都极具意义。
因此,这种思路本质上是将模拟本身作为产品评估与观察手段。Emergence AI告诉我们,他们进行Emergence World实验,一个重要目的也是为了测试自身提供的Agent产品,在进入复杂环境后是否依然安全。
Satya Nitta Emergence AI CEO 我们会用Agent去做一些事,例如帮助改善半导体良率。Emergence World实验至关重要,因为我们需理解,我们构建的Agent真正运行后,是否会采取安全行动,能否持续遵守我们设置的安全护栏与基本规则。 更重要的是,它们能否给出真正值得信任、而非源于幻觉的输入、建议与洞察。
这种单体模拟能力,也可进一步扩展至整个“社会”。例如英国创业公司Artificial Societies,主打“社会关系”测试。他们让大量拥有不同人格的AI Agent彼此互动,形成一个可进行实验的虚拟社会。企业可将产品、品牌或营销策略放入其中,再观察不同Agent之间如何交流、影响与反应。
MatrAIx的下一步,也计划让这83亿个人格真正“动起来”。
Xiaomin Li MatrAIx联合创始人、微软高级研究科学家 我们将在新版本中加入动态人格属性,这些属性是可变的。还有一个假设是,若现实生活中发生重大事件,也会对人格与行为产生影响。
而且,这些合成人格未来不一定仅存在于数字世界。MatrAIx团队正尝试将人格放入机器人等现实载体,让不同思维模式与行为模式从虚拟环境进入现实世界。
Xiaomin Li MatrAIx联合创始人、微软高级研究科学家 我们会将人格加入机器人,使其不仅存在于虚拟世界或Matrix中,甚至能在现实生活中与我们互动。 这样,我们能真正感受到不同人格背后代表的思维模式与行为模式各不相同。
从这个角度看,AI模拟未来或许不仅是市场调研工具,也可能成为人机交互的基础能力。但目前许多人认为,仅停留在“模拟”还不够。在此基础上,更有趣也更具挑战的事,是预测。
从“模拟”到“预测”
在商业中,“预测”往往代价高昂。企业是否应进入新市场?产品涨价10%后会怎样?若政府调整政策,会对社会产生何种影响?这些问题的答案,通常只有等事情真正发生后才能知晓。
AI模拟如今提供了一种新可能:先将尚未发生的未来在虚拟世界运行一遍,再将结果作为现实决策参考。目前,在更侧重“预测”的AI模拟公司中,两家较有代表性的企业是Simile与Aaru。
Simile由“斯坦福小镇”项目的一批核心研究者Joon Sung Park、Michael Bernstein、Percy Liang等人创办,其思路是从“模拟一个人”开始进行预测。在2024年“数字人格”研究基础上,Simile尝试通过深度访谈等方式,尽可能高精度地还原一个人的记忆、经历、反思与决策过程,再将这些AI Agent放入不同环境中持续行动。
如此一来,模拟回答的问题不再仅是“这个人现在怎么看”,而是可进一步观察:当价格、政策等外部条件变化后,这个人会如何行动,是否会改变原有选择。Simile想建立的,是一个“人类行为基础模型”,通过模拟人的行为过程,推演现实世界可能出现的结果。
因这条路线追求尽可能“真实”,故更适合消费者研究、产品测试、客户体验与投资者关系等需深入理解特定人群的场景。Simile今年2月正式亮相,目前估值已突破20亿美元。根据公司披露信息,自上线以来,Simile已为财富100强企业运行数千万次模拟。美国大型连锁药房CVS也与Simile合作一年,通过真实用户数据构建多达40万个数字分身,用于研究患者按时服药、测试消费者体验与辅助产品设计。
但高保真的另一面,是成本与规模化的代价。
Yuexing Hao MatrAIx联合创始人、MIT EECS博士后 在Simile这种情况下,若需非常准确,可能极难标准化。例如,可口可乐所需的用户画像与TikTok所需完全不同。 对公司而言,代价是每家公司、每种场景都可能需重新进行后训练或预训练。这种代价巨大,且其可迁移能力目前未知。
以Aaru为代表的另一条路线,则直接通过“群体模拟”进行预测。它不追求将某个人思想还原得特别深入,而是基于现实世界的人口、消费等数据,快速建立一个尽可能接近真实世界的模拟人群。
Aaru的数据大致分为三层。第一层是人口普查、就业、健康等公开数据,用于搭建基本人口结构;第二层是匿名消费记录、常去地点、关注媒体等授权数据,用于补充人群近期真实行为;第三层是客户提供的私有数据,例如企业自身用户分层、购买历史与产品信息等,将模拟范围收窄至真正需研究的人群。
在此基础上,Aaru会进一步构建关系网,不仅让年龄、收入等人口属性接近现实,也尽可能还原行为特征及其间关系。接下来,系统会改变价格、产品或政策等某一现实变量,再观察整个群体行为如何变化,以此推演现实世界可能出现的结果。
孟醒 五源资本合伙人 Aaru可能更关注速度,也更关注群体间发生的关系。至于某个个体受到的深刻影响,它可能并不那么关心。
Aaru的创始团队非常年轻。两位创始人Cameron Fink与Ned Koh成立公司时分别仅18岁和19岁,技术负责人John Kessler甚至只有15岁。最初,他们在朋友家的地下室里用美国大选验证这套系统。在回测2020年大选时,预测结果与实际结果仅差不到0.5%。
真正让Aaru受到关注的,是2025年纽约市长民主党初选。当时外界普遍看好前纽约州州长库莫,Aaru却通过大规模模拟预测曼达尼最终胜出。因规模大、速度快,这条路线也适合进行大规模市场调研。
目前,Aaru的客户已包括麦当劳、安永、拜耳、A24等公司。安永曾让Aaru复现一项复杂的全球调研,Aaru一天完成的结果与原调查高度吻合;气泡水品牌Spindrift原本花费两个月、招募500名消费者完成的一项调研,Aaru的Agent用一周就得出了几乎相同的结论。这些真实案例也让Aaru估值迅速上升,目前接近10亿美元。
最近,一些AI领域的重要研究者也开始押注“预测”这门生意。卡耐基梅隆大学教授、苹果首任AI主管Russ Salakhutdinov参与创立了AI预测模型实验室Sooth Labs,主要用于预测地缘政治与市场风险,首轮融资约5000万美元,并获得Yann LeCun、Jeff Dean等人支持。
Russ Salakhutdinov甚至在采访中表示:“McKinsey为何存在?Boston Consulting Group为何存在?这些大型机构,都应被AI取代。”
不过,尽管AI模拟已出现不少有意思的落地方向,它究竟能在多大程度上真正影响企业决策、创造多少商业价值,目前仍难判断。以Aaru为例,其当前营收规模仍仅数千万美元级别。因此,今日市场给这类公司的高估值,更多是在提前押注它们未来可能打开的市场空间。
孟醒 五源资本合伙人 这个市场刚刚起步,大家都处于初创早期。不同公司的技术方案与市场细分选择各异,因此都需做差异化。 但从中长期看,大家都会寻找:付费意愿最高的客户是谁?最终客户需求才是最重要的,采用何种方法可能没那么重要。
从“像”到“真”:AI模拟的验证难题
AI模拟公司最终能做多大生意,与模拟和预测的精度高度相关。产品测试、市场调研等事,通常容错率相对较高,结果不理想还可重新测试。但一旦AI模拟开始用于辅助更重要的决策,企业就会更加谨慎。
当前AI模拟真正落地,首先面临的难题是缺乏统一、可量化的衡量标准。 目前大多数AI模拟基于大语言模型,但大模型天然倾向于给出合理、完整、逻辑自洽的答案,且不同模型自身带有不同行为倾向。
一个由大模型驱动的Agent,可能在一次问卷中给出与真人相同的答案,但这并不意味着它真正理解了这个人。因为真人本身并非完全稳定的系统,同一个人在不同时间、不同环境下,也可能做出完全不同选择。那么,一个好的模拟究竟应维持稳定、可验证的人格,还是应像真人一样,随环境不断变化?
孟醒 五源资本合伙人 当然可以搭一套东西出来,但最怕什么?最怕的是你其实搭了一个剧场,所有人都在表演。 一万人表演,不代表一万人真能做出预测。因此还需一套闭环机制,大家仿真一段时间后,要回来检验它是否能与真实场景映射。 得有基准测试、有验证流程。若有偏移,还需将偏差训练回来,使其修正。
而即便单个Agent模拟得足够像,当它被放入不同群体与不同环境后,行为逻辑也可能发生变化。此前复旦大学联合罗切斯特大学等机构进行的一项名为SocioVerse的研究,将社会模拟中的对齐问题拆分为环境、目标用户、交互机制与行为模式四个维度。结果显示,社会模拟的精度,很大程度上取决于这些“对齐”是否做得足够全面。
现实世界中还有大量低频、极端的长尾事件,例如地震、海啸、金融危机等。大模型很难从有限的历史数据中充分学到,在这些情况下,人和社会究竟会如何反应。
高森泉 WorldVac CEO 其实现在许多人做的仍是封闭模拟,人们只能通过自然语言与其交互,且模拟中发生的事与真实世界事件无关。 那么你的模拟意义何在?我们现在进一步推动的,是让越来越多现实信号与模拟对齐,例如现实中的经济信号、新闻信号,以及现实中人的信号,使其成为现实世界的一个合理镜像。
即便模拟本身足够准确,还有一个更棘手的问题:如何证明一个关于未来的预测是“对”的?
这里存在一个天然悖论。要判断一个基于模拟的预测是否准确,只有等那件事真正发生后才能确认;可预测真正有价值的时刻,恰恰是事情尚未发生之时。
目前业内主流的验证方式,基本还是“事后对答案”:拿一个已发生的历史事件,或一份已完成的真人调研