刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

浏览15次 点赞0次 收藏0次


大额免费Token Plan:https://discovery-home.intern-ai.org.cn/https://api.atria-asi.ai/,https://zenmux.ai/atria-asi/atria-dawn-preview

项目网站:https://atria-asi.ai/

模型权重:https://huggingface.co/internlm/Atria-Dawn-Preview

Paper链接:https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf

20 分钟,一个 MiniOS操作系统搭建了起来。

AI4AI 设计并训练一个超过 4 亿参数的天气预测模型,1 分钟,预测未来一周的全球天气。

这是智能体模型Atria Dawn Preview在此次展示中完成的两项任务。

上海人工智能实验室联合复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构,共同发布了这一智能体新模型。


模型能做什么,自然是发布的看点。但这一次,团队还把目光转向了另一件事:这个模型,究竟是怎么被研发出来的?

在 Atria 的后训练过程中,研发人员普遍使用编程智能体辅助工作。写代码、执行实验、分析结果,AI 已经参与其中。

于是,一个问题浮了出来:当 AI 开始帮忙「造 AI」,人类还在忙什么?

越来越多的操作交给 AI 之后,AI工程团队的劳动究竟减少了多少,又有多少转移到了不容易被看见的地方?

Atria 团队收集了研发中的人机交互记录,尝试把这些分工拆开来看。

AI 连续执行的背后,谁在决定下一步?

回看模型研发,人类的工作一直在变。

早期,人们为模型标注数据。后来,通过偏好反馈告诉模型什么样的回答更好。如今,AI 开始参与代码编写、实验执行和结果分析。

人机协作的范围,就这样从训练数据的生产,延伸到了研发流程本身。

沿着数据、训练与评估三个环节,可以看到这一变化:


一些过去需要研究者一步步完成的操作,现在可以交给智能体连续推进。

但研发中,还有一类工作很难用代码行数来衡量。

问题该怎么定义?哪条技术路线值得尝试?实验结果究竟支持了什么判断?继续投入,还是及时换方向?

这些决定可能只需要几句话,却会影响后面一连串操作。

因此,想知道 AI 在研发中贡献了多少,就需要沿着过程往回看:方案是谁提出的,选择是谁作出的,卡住之后又是谁把方向纠正过来的。

这也是 Atria 团队分析交互记录的出发点。

769 条任务记录,拆开 AI 研发背后的人类劳动

团队分析了56 名参与者的 769 条任务记录,并结合智能体日志,观察研发中的人机分工。

其中,739 项任务明确回答了是否使用 AI,713 项涉及 AI,使用率达到96.5%

在这批被调查的研发工作里,用 AI 已经相当普遍。

不过,96.5% 回答的是「有没有用」,还没有回答「承担了多少」,更没有回答「谁在作决定」。

真正值得展开的,是接下来几组数字。

约三分之一的已完成任务,参与者认为「没有 AI 就做不成」


455 项已完成、使用了 AI,且获得有效可行性回答的任务中,151 项被参与者判断为:如果没有 AI,自己负责的部分就无法完成。

占比33.2%

这里有一个明确前提:任务范围、质量要求和其他资源保持不变。

也就是说,对这些参与者而言,AI 的作用已经延伸到任务是否可行。一部分原本受资源或个人能力限制的工作,有了 AI,才进入了能够完成的范围。

当然,这里的「做不成」,来自参与者对当时情况的回顾性判断。

这些任务可能确实超出了参与者在给定条件下、不借助 AI 所能完成的范围,也可能是 AI 的使用改变了他们对自身能力和任务可行性的判断。

参与者认为任务离不开 AI,并不意味着最终选择也由 AI 作出。要理解 AI 在工作中的作用,还需要进一步区分:谁提出方案,谁作出最终选择。

AI 经常出方案,多数最终选择仍由人作出


再看技术决策。

在执行岗位参与者报告的567 项方法或参数决策中,AI 提出方案的比例达到64.6%

其中,最常见的协作方式是:AI 提出,人类选择。

这一组合占全部此类决策的55.4%

如果把视线放到最终选择上,分工就更加清楚:85.5%的方法或路线决策由人类作出最终选择,AI 作出最终选择的比例为9.2%

在目标或范围、验收标准两个环节,人类作出最终选择的比例,也分别达到93.4%81.9%

甚至在那 151 项被参与者认为「没有 AI 就无法完成」的任务中,仍有144 项由人类最终选择目标,占比95.4%

两件事同时发生了。研究者依赖 AI 完成工作,AI 也经常参与技术方案的形成;与此同时,人类仍然承担着多数最终选择。

哪些方案值得采用,哪些结果符合要求,研究应该朝哪个方向推进,这些判断构成了人类工作的重要部分。

把整个任务简单标成「人做的」或「AI 做的」,很容易把中间的分工混淆。方案提出、最终选择和具体执行,需要分别看。

遇到困难,76.0% 经人类帮助继续推进,只有 0.7% 由人类接管


智能体卡住之后,会发生什么?

团队请参与者回顾了每项任务中最关键的一次困难。在记录了困难及应对方式的588 项任务中,76.0% 经人类介入后继续推进,由人类接管主要工作的比例只有0.7%

人类最常做的两件事,分别是:

  • 补充背景或澄清需求:35.2%。

  • 诊断问题或改变方法:34.7%。

另有23.0%的任务由 AI 自行恢复推进。

这让「人类介入」有了更具体的样子:研究者补上缺失的信息,判断问题出在哪里,或者调整方法,智能体随后继续执行。

修改产出时,也出现了类似的分工。

在明确记录主要 AI 产出去向的627 项任务中,354 项发生了实质性修改,占比56.5%

而在这些需要实质性修改的任务中,75.4% 由 AI 根据人类反馈完成修改

初稿是 AI 写的,修改稿也可能是 AI 写的。

但两版之间,人类指出了什么问题、提出了什么要求,同样影响着最终结果。

如果只统计生成内容、代码量或直接编辑次数,这部分通过反馈完成的工作,就很容易被低估。

8 项基准,两项第一、两项第二

研发过程之外,Atria Dawn Preview 本身的能力,也是此次发布的重点。

团队对模型进行了评测,并与其他基线模型展开对比。具体结果如下:


在团队给出的8 项基准对比中,Atria Dawn Preview 取得了两项第一、两项第二

  • AutomationBench、CyberGym:得分最高。

  • SkillsBench、Workspace-Bench-Lite:位列第二。

这组结果展现了它有竞争力的智能体能力。

分数之外,团队还给出了三个 Demo,分别对应模型训练、软件开发和网络安全。它们把模型组织工作、使用工具、根据反馈继续推进的过程,放到了具体任务里。

禁用网络搜索,训练一个超过 4 亿参数的天气模型

第一个任务,直接让 AI 参与全球天气预测模型的设计与训练。

任务提供了超过 100 GB 的全球气象数据,同时禁用了网络搜索。Atria Dawn Preview 需要基于这些数据,构建能够学习气象变量变化规律的预测模型。

在这一过程中,它设计了一个参数量超过 4 亿的 ViT 骨干网络,完成45,000 步训练,学习69 个气象变量随时间的演化规律。

最终,系统能够在1 分钟内,预测未来一周的全球天气

在该案例的评测设置下,系统使用了更少的训练数据,部分预测指标优于英伟达的经典天气预报模型FourCastNet

而任务最终交付的,是一个经过训练、能够运行的天气预测系统。模型设计之后,训练和运行也实际完成了。

20 分钟,从自然语言需求到 MiniOS

第二个任务,转向软件开发。

Atria Dawn Preview 从自然语言需求出发,在20 分钟内构建了一个 MiniOS,把文字描述转化为可运行的软件成果。

这一案例关注的是完整项目如何推进:组织开发工作、实现代码,并最终交付一个能够运行的系统。

自然语言需求进入任务流程,可运行的软件成为最终产出。

进入隔离靶场,把漏洞发现、修复和环境恢复接起来

第三个任务发生在隔离靶场中。

Atria Dawn Preview 从网站分析和攻击面排查开始,进一步完成漏洞发现、利用、与修复。

过程中,模型不仅要识别网站结构和潜在风险,还要通过多轮测试排除错误判断、定位真实漏洞,并完成攻击、修复和复验。

这项任务覆盖了从发现潜在漏洞,到验证漏洞是否成立,再到修复漏洞的过程。

三个案例,让基准分数之外的执行过程变得更具体:模型如何安排工作,如何利用工具反馈,以及如何把任务推进到最终结果。

AI 帮忙造 AI,下一轮还能继续吗?

把模型能力与研发过程放在一起看,Atria 的这次实践提供了两个观察角度。

一边,是后训练得到的模型能够完成哪些任务。

另一边,是完成这次后训练,人和 AI 各自承担了什么。

如果 AI 的能力继续提升,这两条线就会进一步交汇,触及递归自我改进

AI 参与模型研发,推动能力提升;提升后的能力,再投入下一轮研发,带来进一步改进。

但要让这个过程持续运转,还有问题需要回答。团队将注意力放在了其中两点。

AI 做得更快,检验能不能跟上?

当 AI 能够更快地修改训练流程、构建工具和开展实验,研究者会得到更多结果,也需要及时判断哪些结果值得相信。

训练信号可靠吗?评估漏掉了什么?自我修改有没有偏离原来的目标?

这些问题,都需要有相应的检验。

一轮实验中没有被发现的错误,可能被带进下一轮,继续影响后续判断。

因此,研发自动化向前推进时,独立评估、可追溯的过程记录,以及异常情况下的暂停和回退机制,也需要跟上。

实验数量和执行速度可以增加,改进是否可靠,仍然要经过验证。

下一次,能不能由 AI 主动请人帮忙?

人类什么时候介入,是这次观察的一部分。

再往前一步,AI 能否自己判断:什么时候需要人类参与?

目标不够明确,证据彼此冲突,或者问题必须依赖现实世界的反馈,这些时候,继续执行未必能解决问题。

模型需要识别:哪些事情可以自行处理,哪些需要补充信息、专业判断或明确授权。

这也可能改变人的工作方式。研究者可以在关键节点提供判断和帮助,而不必持续指挥每一步操作。

但有效的求助,需要模型把问题说清楚。

卡在哪里,有哪些不确定性,为什么需要人类参与,得到的反馈又该如何用于后续行动,这些都是能力的一部分。

从 AI 辅助研发走向递归自我改进,还有多远,需要在一轮轮实践中检验。

Atria Dawn Preview 展示了模型能够把任务推进到什么程度。Atria 的研发记录,则让人看见了这些成果背后的协作过程。

96 人,65 名在校生,这支团队的另一面

Atria 背后,是一支学生广泛参与的年轻研发团队。

按学生与 AI Lab 正式员工统计,96 名主要成员中,有 65 名在校生,占比超过三分之二

其中,博士生 33 人,本科及硕士生 32 人,与31 名正式员工共同参与项目研发。专项组长中的学生比例达到70%

团队汇聚了上海人工智能实验室、复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构与高校的研究力量。

不同高校、不同培养阶段的青年学生,在同一个大模型后训练项目中开展协作,也共同参与了这次关于 AI 能力与人机分工的实践。

而 Atria 这个名字,也藏着团队对这项工作的理解。

Atria 是南三角座的主星,和此前 Delta、长江三角洲与三角形的意象天然呼应;atrium 原意是中庭、汇聚空间,像一个让不同学校、团队与学科在这里相遇、协作的场所。

一颗星,指向更远的探索;一个中庭,容纳不同的人与想法。Atria 也许正代表着这样一种可能:让更多人一起,把智能体能力推向下一步。


参考资料:

https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf

编辑:大卫

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯