韩国 AI 模型 Solar Pro 4 首次亮相 Agent Arena:排名 44,与 MiniMax M2.7 同级

浏览10次 点赞0次 收藏0次

8 月 13 日消息,韩国人工智能实验室 Upstage 今天(8 月 13 日)发布博文,宣布推出 Solar Pro 4 模型,定位为面向复杂 AI 智能体任务的商用大模型。

Solar Pro 4 模型上下文窗口为 512K,最高输出长度为 128K token,支持用户在单次会话中加载多份合同、报告和数据文件,官方博文中暂未披露参数量相关信息。

定价方面,援引博文介绍,附上相关信息如下:

  • 每 100 万 Tokens 输入价格为 0.3 美元(注:现汇率约合 2 元人民币)

  • 缓存读取(Cache Read)每 100 万 Tokens 输入价格为 0.06 美元(现汇率约合 0.41 元人民币)

  • 每 100 万 Tokens 输出价格为 1.2 美元(现汇率约合 8.1 元人民币)

智能体任务方面,Solar Pro 4 的主要提升集中在更接近真实工作的评测上,包括长文档、终端任务和多轮工具调用。官方列出的 3 项核心结果为:Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。

Upstage 以虚构咖啡品牌 Solarbean Coffee 的门店选址分析作为演示任务。输入材料包括 1 份门店开设政策文档和 6 份市场数据文件。

Solar Pro 4 在 3 条提示词内完成 10 个候选站点的政策筛选,并按顺序生成 3 类交付物:Excel 工作簿、审查报告和幻灯片。

查询公开资料,发现该模型已现身多家 AI 模型评测平台。@ArtificialAnlys (Artificial Analysis) 是一家领先的国际独立 AI 基准测试与分析机构,专门针对大语言模型(LLM)、视频生成、AI 音乐等多领域进行无偏见的性能与托管成本评估。

@arena (Arena.ai) 是当前全球 AI 行业最权威的“人类偏好”大模型即时对战与评测平台。它源自著名的 LMSYS Chatbot Arena 团队,采用类似国际象棋的 Elo 积分系统,通过纯粹的人类开发者双盲盲测(Blind A/B Testing)来对全球 AI 模型进行高强度的淘汰赛排名。

该机构指出,@upstageai 的 Solar Pro 4 是首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 排行榜的韩国实验室。

在  Agent Arena 榜单中,Solar Pro 4 模型排名第 44 位,与 MiniMax M2.7 和 Nemotron 3 Ultra 等模型处于同一水平。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯