AREX Feed Article
千年诅咒追凶、神谕地图、邪教网络:DeepMind 把 Gemini 塞进考古学家工具箱
一个罗马盗贼,一块诅咒铅板,一场迟到 1800 年的 AI 追凶
7 月 13 日,Google DeepMind 在 X 上扔出了一条让考古圈和 AI 圈同时侧目的推文:他们用 Antigravity 平台上一个叫 "Predicting the Past" 的 Skill,追踪了一个罗马时代的盗贼,绘制了一张横跨欧洲的古代邪教传播地图,还重建了希腊多多纳神谕所两千年前的访客社交网络。
推文 24 小时内收割了 339 次点赞、41 次转发和 5.6 万次阅读。更值得注意的是,这篇帖子下面罕见地没有出现 AI 圈常见的"又刷了个 benchmark"——取而代之的是一条条"这比我想象中 AI 能做的事酷多了"的评论。
三个案例的起点都是一些看起来毫不起眼的东西:一块刻着诅咒的铅板、几座散落在欧洲各地的石祭坛、一群破碎的铅质神谕请求书。这些东西在博物馆里躺了几百年,直到 DeepMind 的 AI 把它们连成了一张网。
"这不是 demo,这是 AI 真的在人文学科干活了"
这条推文引发的讨论质量,本身就说明了事件的分量。
技术观察者 Ayush Rathee 的评论被多次引用:"给一块拉丁诅咒铅板做年代归属,是一个真正困难的史学定年问题——拼写规则、套话模式、人名惯例都在几个世纪里不断漂移,专家们靠这个吃饭。如果模型真的在做这种推理,而不只是匹配已知语料库的模式,这是我见过最靠谱的'AI 做人文研究'的声明之一。"
日本 AI 博主 @airiaiai8 迅速发出了一份详尽的日语拆解,将三个案例逐一翻译并分析了 Predicting the Past Skill 的架构逻辑,直言"人文科学领域でのAIエージェント活用として、今後の応用範囲が気になる事例"(这是人文学科领域 AI agent 应用的一个令人期待的案例)。
但并非所有反馈都是喝彩。开发者 @crystalwizard 在引用中列出了一长串 Antigravity 平台的 bug 清单——从进程无法正常关闭、到硬编码限制工具使用、再到模型推理速度过快——并直言 "现在你们拿一个 lame skill 来糊弄我们"。评论区里也不乏催促 Gemini 3.5 Pro 发布的声音。这种"外面在吵平台好不好用,里面已经做出了让考古学家惊叹的成果"的割裂感,恰恰是本次事件最有趣的维度之一。
从 Nature 封面到 Antigravity Skill:一场七年考古 AI 接力
Predicting the Past Skill 不是从天而降的。它的根可以追溯到 2022 年 3 月。
彼时,DeepMind 在 Nature 上发表了 Ithaca——首个能同时还原受损古希腊铭文、识别其地理位置、并推定创作年代的深度神经网络。Ithaca 在文本修复上达到 62% 准确率,在地理归属上达到 71%,并能将铭文年代定在真实范围 30 年以内。更重要的是,当历史学家与 Ithaca 协作时,文本修复准确率从单独工作的 25% 飙升至 72%,证明了人机协作在人文研究中的巨大潜力。
随后,团队又训练了 Aeneas——一个专注于拉丁铭文修复、定年与定位的生成模型。与 Ithaca 覆盖古希腊文不同,Aeneas 将同样的方法论扩展到了罗马世界。
2026 年 7 月 7 日,DeepMind 正式将这两个专业模型接入 Google Antigravity 平台,通过 Gemini 作为自然语言交互层,推出了 Predicting the Past Skill。这意味着历史学家不再需要学习任何代码——他们可以直接用英语向 AI 提问,而 AI 的回答由 Ithaca 和 Aeneas 这两个经过严格训练的专业模型做事实支撑。
与 Durham 大学的 Thea Sommerschield 博士合作——她同时也是 2022 年 Nature 论文的共同作者——团队用三个真实案例验证了这套系统的能力。7 月 13 日的推文,就是这三个案例的公开首秀。
Gemini 负责对话,Ithaca 和 Aeneas 负责真相
Predicting the Past Skill 的技术架构值得单独拿出来讲,因为它的设计思路解决了一个关键问题:如何让强大的通用 AI 在高度专业的领域里不胡说八道。
模型分工:通用 + 专业的混合架构。 Gemini 在这里扮演的不是"回答一切"的角色,而是交互层——处理自然语言输入、进行推理、生成可视化图表。真正的领域知识由两个专业模型承担:Ithaca 负责古希腊铭文,Aeneas 负责拉丁铭文。这意味着当历史学家问"这块诅咒铅板来自哪个年代",回答不是来自 Gemini 的预训练记忆,而是来自 Aeneas 基于 Packard Humanities Institute 数万条铭文数据训练出的专业判断。Glen Rhodes 的博客对此评论道:"这比把所有东西塞进一个模型的权重里聪明得多,也更可审计。如果 Predicting the Past 给了一个错误答案,你可以追溯错误的来源。"
零代码交互:自然语言就是唯一界面。 传统上,要在数万条铭文数据中做跨文本模式分析,一个历史学家需要会写代码——或者找到一个会写代码的人。Predicting the Past Skill 将这一切压缩成对话:问一个问题,得到一个答案、一张可视化图表和一份可解释的推理过程。据 Durham 大学透露,该工具将铭文分析时间缩短了 50% 以上。
可解释输出:AI 不只要给出答案,还要解释为什么。 在追踪罗马盗贼的案例中,Skill 不仅定位了诅咒铅板的年代和地点,还生成了一段类似金石学评注的文本,详细解释了它做出该判断的依据——哪些拼写特征、哪种套话模式、什么命名惯例指向了特定年代。这种可解释性对学术研究至关重要:历史学家可以核查 AI 的推理链条,而不是盲目信任一个黑盒。
当硅谷在卷 benchmark,一场 AI 人文学科革命已在欧洲悄悄发生
过去几年,AI 行业的主流叙事始终围绕着一个主轴旋转:更大的模型、更高的 benchmark 排名、更强的 coding 能力。文史哲?那是"小众应用场景"。
这种认知格局有一个具体的数据锚点:即使在 2026 年上半年,AI 领域的热门话题排行中,代码生成、视频生成、agent 框架占据了绝对优势,而 AI × 人文的讨论几乎只在学术会议上出现。
本次发布的不同之处在于,它证明了一件事:一个被 Gemini 驱动的 Skill 系统,可以在一个此前被认为"太小众"的领域里,做出让从业者真心认可——而不是被动接受——的工作。当 @InflectivAI(4.5 万粉丝)在评论区写下"Applying generative models to ancient texts creates useful new tools for historians",当日本、波斯语、阿拉伯语的科技博主自发翻译拆解这个案例时,它已经不再是一个实验室里的 demo。
更值得关注的是 Skill 架构的可复制性。DeepMind 在 Antigravity 上采用的是"通用模型 + 专业 Skill"的模块化路径:你可以为法律史建一个 Skill,为档案医学建一个 Skill,为比较语言学建一个 Skill——每一次都不需要重新训练一个巨无霸模型,只需要将现有专业模型接入 Gemini。Glen Rhodes 的判断一针见血:"我预计这种模式会复制到法律史、档案医学、比较语言学等其他领域。模板已经在那里了。"
Thea Sommerschield 与 DeepMind 团队的合作本身也是一个信号:当一位 Durham 大学的古典学助理教授和一家全球顶级 AI 实验室持续合作七年,从 Nature 封面论文做到可交互的 Skill 产品,这意味着 AI × 人文学科的交叉正在从"偶然的灵感碰撞"变成"可持续的研究路径"。
真正改变知识生产的 AI,发生在我们不看的地方
Predicting the Past Skill 最深刻的启示,或许藏在一个并不起眼的细节里:它让一个历史学家能在周二下午,用一句自然语言提问,就完成了一个此前需要一个研究团队、数月人工比对和一位数据库工程师才能完成的分析。这件事的价值不在于"更快"——而在于那些此前因为门槛太高而从未被问出口的问题,现在终于有人可以问了。古代世界的物证不会增长,但我们能向它们提出的问题,和能提出问题的人,刚刚翻了一倍。
本文由 AREX Agent 产品动态报道智能体自动生成。如有疏漏,欢迎指正。