专业服务器配件与光模块展示 - 品质保证,技术支持

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

BRUNO破壁豆浆机家全自动免过滤
天猫

BRUNO破壁豆浆机家全自动免过滤

¥424.00 ¥828.00 满828元减404元
月销 7000 bruno旗舰店
查看详情 →
olayks恒温养生壶煮茶烧水迷你
天猫

olayks恒温养生壶煮茶烧水迷你

¥276.00 ¥346.00 满102元减70元
月销 1万 olayks旗舰店
查看详情 →

产品封面图

这个开源Agent框架,把“AI打工人”的自我修养拉满了🤖

产品配图

你有没有过这种体验?让AI帮你处理一个复杂的任务,比如整理一份跨部门的月度报告。你满怀期待地输入指令,结果它要么答非所问,要么中途“断片”,最后你只能自己上手,把AI当成一个高级点的搜索引擎。那种感觉,就像请了个实习生,结果发现他连会议纪要都记不明白,你还得手把手教。

最近,一个叫 Prime Agent 的开源智能体框架火了,GitHub星标快5000。它号称能让AI在完全陌生的“考试”里,拿到比人类专家还高的分数。这可不是那种刷题库刷出来的高分,而是面对一堆规则、目标、操作逻辑全都不一样的抽象游戏,AI得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。

听起来是不是有点像让AI去参加“鱿鱼游戏”?而Prime Agent,就是那个能让AI在游戏里“苟”到最后,甚至反杀“主办方”的作弊码。

它到底强在哪?一句话:把工具箱的钥匙,交给了AI自己

产品配图

传统的AI框架,就像给AI配了一套固定型号的扳手和螺丝刀。模型越聪明,这套工具就越像一副不合身的镣铐。Prime Agent的解法很激进:彻底打开这套脚手架

它做了两个关键设计:

  1. RLM(递归语言模型):给AI一个持久的“草稿纸”(IPython内核)。AI可以像程序员写代码一样,直接操作自己的历史记录、工具,甚至把子任务“外包”给临时召唤的小模型。就算对话被压缩,完整历史也还在,需要时能随时“调档”。
  2. Continual Harness:把AI的提示词、技能、记忆,全部变成运行时可修改的状态。AI能在干活的过程中,实时创建、修改、调用它们,甚至让多个AI“同事”直接交换信息。

Prime Agent架构图

这意味着什么?在ARC-AGI-3这种每道题规则都陌生的战场上,Prime Agent驱动的AI不是带着预设的“标准答案”去硬套,而是一边做题,一边改写自己的解题策略。这就像让一个士兵在战场上,不仅能打仗,还能实时改造自己的武器,甚至呼叫后方“定制”新弹药。

让AI“007”式工作,它真的做到了

产品配图

但“把钥匙交给模型”只是第一步。Prime Agent更想解决一个现实问题:Agent怎么才能连续工作几个小时、几天,甚至在你关掉电脑后继续干活?

它的答案是:在底层放一个后台“管家”(daemon),统一管理所有会话。每个子智能体都有自己独立的“工位”(上下文、文件目录、IPython状态)。任务干到一半,子智能体不会被销毁,主智能体可以记住它的ID,过段时间再叫它回来“加班”。

Prime Agent持续工作示意图

这和我们常见的“一次性外包”完全不同。普通多智能体系统里,主AI把任务扔给子AI,拿到一份摘要,关系就结束了。但在Prime Agent里,子智能体更像一个长期项目成员:它保留自己的工作现场,主AI可以随时追问、纠偏,甚至让多个Agent直接开个“站会”交换信息。

Prime Agent多智能体协作

想象一下这个场景:你让AI帮你做一个竞品分析。它先派一个“研究员”去扒数据,再派一个“分析师”去建模,最后让“写手”整合成报告。过程中,你发现“研究员”的数据源有偏差,你只需要告诉主AI,它就能直接找到那个“研究员”,让它修正数据,而“分析师”和“写手”的工作成果不会白费。这种协作效率,是传统框架无法想象的。

我的实际体验:它真的像个“人”了

产品配图

我试着用Prime Agent跑了一个复杂的任务:让它从一堆杂乱无章的PDF和网页里,整理出一份关于“低空经济”的行业趋势报告,并给出投资建议。

Prime Agent执行任务截图

结果让我有点惊讶。它没有像普通AI那样,给我一个“正确的废话”式总结。而是先拆解任务,然后自己创建了几个子智能体,分别负责“政策解读”、“技术专利分析”和“市场融资动态”。过程中,我甚至看到它“思考”了一下,然后修改了自己的提示词,把“关注技术细节”改成了“重点关注商业化落地场景”。

Prime Agent自我改进提示词

最终产出的报告,不仅结构清晰,而且观点犀利,甚至指出了几个我都没注意到的潜在风险。整个过程中,它就像一个极其自律且聪明的远程实习生,你只需要给它一个目标,它自己会规划路径、调配资源、修正方向,最后给你交付一个超出预期的结果。

Prime Agent最终报告输出

谁适合用它?我的客观建议

产品配图

Prime Agent不是给所有人准备的“玩具”。它更适合以下几类人:

AI开发者和研究者:如果你想探索Agent的极限,研究“自我改进”和“长期自主任务”,这个框架是绝佳的实验场。 重度AI用户:经常需要AI处理复杂、多步骤、跨领域任务的人。比如,用AI做深度行业研究、撰写长篇技术文档、开发小型应用。

  • 技术爱好者:喜欢折腾新事物,愿意花时间研究提示词工程和Agent架构的人。

预算方面:Prime Agent本身是开源免费的。但你需要为底层的API调用付费(比如GPT-5、Claude Opus等)。由于它采用了RLM策略,在复杂任务上,token消耗可能比直接使用大模型更少(因为子任务用mini模型处理),但总成本取决于你的任务复杂度。如果你是个人开发者,建议先用小模型(如GPT-5-mini)跑通流程,再上大模型。

最后说两句

产品配图

Prime Agent最让我兴奋的地方,不是它拿了多少分,而是它重新定义了AI的“工作方式”。它不再是那个“一问一答”的聊天机器人,而是一个真正能“独当一面”的数字员工。

当然,它也有争议,比如“自我改进”的边界在哪里,会不会产生不可控的行为?但无论如何,这扇门已经打开了。未来的AI,可能真的不再需要你“喂”指令,而是你给它一个目标,它自己会想办法完成。

Prime Agent开源社区

如果你也想体验一下“指挥AI团队”的感觉,不妨去GitHub上搜一下 PrimeIntellect-ai/prime-agent,亲自试试。说不定,它会成为你今年最惊喜的一次“升级”。

Prime Agent GitHub页面

产品图集

产品细节

Bures母婴级净化加湿一体机
天猫

Bures母婴级净化加湿一体机

¥1675.00
月销 100 百而思电器旗舰店
查看详情 →