量子位
整合编辑:太平洋科技
发布于:2026-07-19 20:15
2026年,Agnes AI在全球AI Coding赛道发布免费模型Agnes-2.5-Flash,具备顶级代码生成与修复能力,支持跨文件项目改造,性能直逼Claude Opus 4.7。此免费产品结合刚上线的Agnes Code桌面端,助力开发者低成本高效编程,打破海外工具门槛,推动AI普惠。
|
2026年下半场,AI Coding赛道最大的焦虑变了。 不是模型不够强,是根本用!不!上! 海外头部Coding工具的使用门槛正在集体抬高,「Claude被封天才程序员陨落」的话题更是一度冲上热搜。 不管是已经「中招」的,还是正在未雨绸缪寻找替代方案的,谁都想问上一句: 这世上到底还有没有一个长期稳定可用、Coding能力在线、价格还不贵的模型啊?!(马景涛老师咆哮版)
△图源微博热搜或许是念念不忘,必有回响。 Agnes AI,一家明星AI实验室,在这个节骨眼干了这样一件事: 发布Coding能力位列全球第一梯队的新一代文本模型,Agnes-2.5-Flash。 把Claude Opus 4.7和Agnes-2.5-Flash生成的《AI生态进化模拟器》放一起,不说答案你能猜对哪个是哪家的吗? 同一提示词,实测两个模型生成的模拟器均能正常运行,肉眼已经看不出明显差距。 重点来了,Claude每月最低20刀,但Agnes-2.5-Flash呢? 不限期免费。官方原话是这样说的:
翻译翻译,普通消费者,免费用;日常与API打交道的开发者,免费调。 别激动,还没完。 知道你平时用的都是Codex、Claude Code这类桌面工具,于是Agnes AI还同步上线了Agnes Code桌面端。 那还等啥?就冲着「免费」这块金字招牌,我先替大家探探虚实。
三道关卡,考考Agnes-2.5-Flash Coding能力 Agnes-2.5-Flash,官方定位开发者日常使用的主力模型。 目前已在Agnes Code桌面端实施灰度上线,API预计本周内全面开放。 作为Agnes AI新一代高性能文本模型,这次它围绕Coding、Agent和日常开发场景进行了全面优化。 相比上一代Agnes-2.0-Flash,Agnes AI是这样介绍Agnes-2.5-Flash的:
划重点,Coding能力大升级。至于到底升级了多少?那就还是让两位选手做同一道题试试。 同一个Prompt:用纯Canvas画一座赛博朋克雨夜城市。建筑、霓虹灯、雨、全息广告牌,要求写得清清楚楚。 左边是2.0,右边是2.5,结果不用多说了吧? 2.0把赛博朋克城市画成了一片极光,初看还以为是曲谱(doge)。 而2.5这边,城市天际线立起来了,雨丝倾斜落下,右上角全息广告牌也挂上了。 不能说完美,但Prompt里的核心要素基本全部交付。 所以,哪个理解力更强、更能干活,想必你我心中已经有数了。 当然这还只是和以前的自己比,那Agnes-2.5-Flash现在到底有多强呢? 榜单测评已经把答案甩在了我们面前:
话不多说,咱这就原地开考。 第一关:故意手埋Bug,它能发现吗?Coding能力强不强,修Bug最能说明问题。 所以这第一关,我找了GitHub上的经典开源项目Clumsy Bird,下载下来确认游戏正常后,手动埋了一个Bug: 打开负责小鸟运动逻辑的代码文件,把gravity重力参数从0.2改成了0。
注意,这个Bug是我手动制造的,在项目的公开Issue和PR中暂时没有发现类似记录,基本可以排除模型从训练数据里「背答案」的可能。 改完后效果非常之诡异。 点击后小鸟正常起飞,但之后完全不下来了,一直飘在空中。游戏不崩溃,但没法正常玩。
然后我把整个项目导入Agnes Code,只描述症状,不说改了什么,让Agnes-2.5-Flash帮我定位Bug并修复。 结果仅用时3分钟,它就交出了一份问题报告。 快速浏览了一下报告,没毛病,于是让它接着改。 没想到12秒过后,它居然就……改完了(刚拿起手机想玩一会的我,只能措手不及愣在那)。 打开游戏验收,小鸟重新老老实实往下掉了,撞管子会死,分数正常涨,一切恢复正常。
一个手动制造的、全网没有现成答案的Bug,3分钟定位原因,12秒完成修复。 第一关,过。 第二关:从零做一个完整应用,能跑通吗?修Bug只是日常。更多时候,开发者需要模型从零开始,独立跑通一整个任务: 理解需求、规划步骤、选方案、动手干活、检查结果。 巧了这不是,前面做模型对比的时候,我得分别跑完两个模型再录屏剪在一起,属实麻烦。能不能直接做一个对比工具? 于是我给Agnes-2.5-Flash出了这道题:做一个AI前端竞技场。 用户输入一个Prompt,把三个AI模型各自生成的代码分别粘进三个面板,平台自动运行并排展示效果,再从视觉效果、创意表现、代码完整性、指令遵循度、运行稳定性五个维度自动打分,最后出雷达图对比、总分排行榜和一句话点评。全部用一个HTML文件实现,双击就能打开。 对模型来说,这并不是简单写一个页面。 它需要同时处理多个模块:代码编辑器负责输入,iframe沙箱负责隔离运行,评分引擎负责自动评测,图表组件负责结果展示,还要接入一套自然语言分析逻辑生成点评。 那Agnes-2.5-Flash表现如何呢? 说实话,我就起身去厨房倒杯水的功夫,它就已经交卷了。这种复杂度的任务也没让我等太久,体感上确实快。 感受完速度后,我用一道经典老题来验收:用代码画一个爱心。 三个模型的代码分别粘进去,上传、运行、渲染、评分,一气呵成。 从Prompt输入到三面板并排展示、再到自动评分出图,整个流程跑通了。
而且这不只是一个demo,后面我真的拿它来做了Agnes-2.5-Flash和其他顶流模型的横向对比。 用Agnes做的工具来评Agnes做的代码,这个套娃本身就是对第二关能力最好的注脚。 第三关:跨文件改造,能接住吗?前两关考的都是模型单体能力:给一个任务,模型交一份作业。 但真实开发里,情况远比这复杂。 模型要读多个文件的上下文,理解文件之间的依赖关系,跨文件联动修改还不能改崩。一个文件改了接口,另一个文件的调用没跟着改,项目直接炸了。这种场景在真实开发中太常见了。 而这恰好是Agnes AI的优势所在。Agnes Harness不只是一个模型,而是一套把模型能力、工具调用和项目理解串在一起的Agent系统。在内部实测中,它已经展现出持续领先的态势。 第一关用的Clumsy Bird项目还在手边,这次直接拿来用。 打开文件夹一看,这个项目可不是一个HTML文件就能搞定的:js/目录下多个模块负责游戏逻辑,data/目录存放资源文件,外加index.html、style.css和一堆配置文件,大大小小十几个文件。
在Agnes Code桌面端里打开整个项目文件夹,然后丢了一个大活:
活很复杂,所以这次跑的时间也比较久(大概十几分钟),但好在最终结果不错。
三关跑完,Agnes-2.5-Flash的Coding能力画像比较清晰了:能从陌生代码里精准定位一个隐藏Bug,能从零做出一个功能完整的网页应用,能在十几个相互依赖的文件之间协调完成一次大规模改造。 Coding方向进入第一梯队,不算虚。 然后别忘了,这个成绩是一个免费模型跑出来的。
Agnes-2.5-Pro,还有高手? 免费模型都这水平了,那他们预告的旗舰模型Agnes-2.5-Pro得强成啥样? 说实话,有点好奇了。 和Flash充当开发者日常主力不同,Pro面向的是专业开发场景。 作为Agnes AI当前最高水平的旗舰文本模型,它瞄准的恰好是Flash作为免费模型相对吃力的地方: 大型代码仓库的架构级理解、跨几十个文件的系统级修改、需要反复推理好几轮才能收敛的复杂调试。 就拿最常见的网页开发来说,Pro产出的网站已经是酱婶儿的了: 四个动态视频铺满全屏,高级感直接拉满。 再上一档,3D游戏。 连技术栈都没指定,提示词就一段游戏氛围描述,Pro直接翻译成能跑的3D游戏,Fall Guys那味儿一下就出来了。 极致一点的,粒子引力模拟器。 300个粒子实时物理运算、5种色彩模式、鼠标滚轮控引力源大小、左右键增删引力源,所有交互和物理,塞进一个21.7KB的HTML文件里。 从以上官方demo来看,Pro在复杂任务上的推理深度和完成度确实比Flash拉高了一个档位。 能力上,它对标的也是Claude Opus 4.8这一级。 当然,这个段位的选手,免费就不太现实了,毕竟跑一个复杂Agent任务烧掉多少Token,用过的都懂。 目前Agnes-2.5-Pro还没有正式上线,但据官方透露已经在路上了,应该很快就会和大家见面。 Flash免费打底,Pro付费拔高。 Agnes AI的Coding产品线,也是有从日常开发到复杂工程任务的完整梯度了。
桌面版也来了 不过光有模型还不够,模型再强也得有个趁手的工具来用。 Agnes Code桌面端,为此而生。 这个工具其实前面实测时已经露过脸了,但当时注意力都在模型表现上,产品本身还没好好聊。 打开Agnes Code,第一感觉是界面挺清爽的。 布局、字体、各种小图标都很精致,主题还能随心切换深/浅两种模式,j人表示极度舒适。 功能上,和Codex、Claude Code相同的部分我就不多说了,完整功能我让AI帮我生成了一个总结表: |
IT百科
网友评论
甄选好物


