发现商业评论 旗下
洞察商业 启迪未来

智源AREX智能体:以验证驱动自主研究,开启智能进化新路径

   时间:2026-08-11 13:43 来源:快讯作者:苏婉清

在人工智能领域,当大模型逐步掌握对话、推理、编程和工具调用等能力后,自主研究被视为下一个重要突破口。这一发展方向的意义在于,AI将不再受限于人类知识边界,而是形成一种全新的智能生产模式——“投入多少能源,就转化多少智力”。衡量智能体自主研究能力的重要维度之一,正是其能否在复杂约束条件下持续接近正确答案。

与普通问答只需定位单一事实不同,自主研究需要处理一组相互关联、彼此制约的条件。智能体不仅要从海量信息中筛选候选答案,还需整合分散甚至冲突的证据,并确保最终答案满足所有关键约束。任何一项未验证的条件都会使答案失效。其核心挑战在于,智能体能否清晰判断当前答案的完整性、缺失部分,以及下一步的研究方向。

智源研究院发布的AREX模型正是针对这一难题提出的解决方案。它抓住了自主研究中的关键突破口——“发现—验证不对称性”:完整答案难以一次性生成,但通过逐项验证候选解的关键约束,可以快速定位不足并指导后续探索。验证不仅用于判断答案正确性,更重要的是帮助智能体理解“已知什么、缺失什么、下一步研究什么”,从而提升研究效率。

这一思路的前瞻性在Jeff Dean创立的Discovery Loop公司得到印证。该公司强调,未来AI不仅需要更强的推理能力,还需通过持续实验、反馈和修正形成自主发现能力。AREX通过“求解—验证”双循环框架,体现了这一趋势:内层循环负责研究,外层循环负责改进,二者协同推动智能体在复杂任务中持续进化。

AREX的目标是训练一种能长期运行、自我验证、持续修正的研究型智能体。与传统模型一次性给出答案不同,AREX通过“研究→验证→再研究”的循环,逐步接近完整解。面对复杂任务时,智能体会先给出阶段性答案,随后逐项检查约束条件,保留已验证证据,定位未解决主张,并发起更有针对性的后续研究。当新证据到来时,智能体会更新答案并重新验证,直至输出最终结论。

这一过程可递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的“自我改进”并非指模型在线更新参数,而是指智能体对研究状态和当前答案的持续修正。AREX更像一个会反复检查进度、修正路径、沉淀有效证据的研究助手,而非简单的“搜索后回答”工具。

AREX的整体方法可概括为双循环递归求解框架:内层循环(Research Loop)负责完成一轮相对完整的研究,包括搜索信息、调用工具、收集证据、比较候选并构造暂定答案;外层循环(Self-Improvement Loop)则负责判断当前答案的进展,依据任务约束逐项审计,并形成置信判断。若所有条件均获支持,智能体结束研究;若仍有条件未解决,验证结果将转化为下一轮内层循环的研究目标。

自主上下文更新(ACU)是AREX的关键机制。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。实验显示,AREX在BrowseComp基准上达到82.5分,比关闭ACU和外层循环的版本高出22.9个百分点。这表明长程研究状态维护能显著提升性能。

在长程研究中,AREX通过主动调用上下文更新工具,将交互历史整理为“研究进度表”,帮助模型明确当前进展、已成立内容、已排除假设和下一步方向。这种机制避免了全盘保留冗余信息或简单截断丢失关键线索的问题,使智能体能够持续继承有效信息并形成更稳健的解。

为训练这种能力,AREX设计了一套可验证的自主研究任务生成方法:从确定答案出发,构造一组必须由真实证据支撑的约束条件,再改写为开放式问题。强教师模型在同样工具环境中执行任务,留下全过程的研究轨迹。只有从不确定候选逐步走向可验证答案的轨迹才会被保留,确保训练数据能真正教会模型如何发现线索、交叉验证、推翻错误候选并调整方向。

训练顺序同样关键。AREX采取分阶段策略:模型先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,强化学习阶段会重点优化关键步骤(如找到关键证据、否定错误候选、切换搜索方向)的研究策略,而非将所有步骤同等对待。

在六个基准测试中,AREX以10B激活参数达到自主研究前沿水平。在信息深度测试(BrowseComp、xbench-2510)中,AREX-Base分别取得82.5和接近MiroThinker-H1的成绩,表明其能稳定维护研究状态并逐级深入挖掘。在信息广度测试(WideSearch-en)中,AREX-Base以82.0 Item-F1领先所有对比模型,证明其能管理大范围搜索任务并持续跟踪已覆盖范围和剩余空白。

在深度与广度结合测试(DeepSearchQA)中,AREX-Base取得89.9 F1分,超过GPT-5.4等模型,说明其学到了一套可迁移的研究方法论:检索、比较、验证、修正、聚合。在端到端能力测试(GAIA、HLE with tools)中,AREX-Base分别取得85.4、71.0和52.4分,表明其能将搜索与规划、推理、工具调用结合,完成完整智能体工作流。

与同量级模型相比,AREX-Base的总参数量为122B,但每次推理仅激活10B参数。相比Qwen3.5-122B,AREX-Base在所有报告指标上均领先;相比Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。例如,AREX-Turbo仅4B参数,但在多项指标上超过Qwen3.5-35B等模型。

基于AREX LLMs,智源研究院进一步推出AREX Research Platform,将自主研究能力封装为面向科研与产业用户的日常工具。该平台针对资讯、论文、播客三种信息形态提供独立入口,均由AREX智能体驱动。用户可指定关注方向(如Coding Agent、芯片行业进展),生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。

每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(如“该方向是否有后续讨论”“所选benchmark是否权威”)启动检索、对比、分析与综合,输出完整的知识脉络。这一设计将内容发现与自主研究直接衔接,降低了信息获取成本。

当前版本的AREX Research Platform覆盖科研工作流中的“信息获取”与“认知构建”阶段。后续,智源研究院计划将能力延伸至研究执行阶段,由提供参考信息发展为支持方案产出,最终实现用户定义研究问题、AREX自主完成探索与优化并交付可验证结果的目标。该平台已开放BETA版测试,用户可访问arex-research.com体验。

 
 
更多>同类内容
全站最新
热门内容