发现商业评论 旗下
洞察商业 启迪未来

AGI时代初露端倪 AI智能体从“答题”走向“办事”新阶段

   时间:2026-09-07 22:22 来源:快讯作者:江紫萱

美国人工智能研究机构OpenAI于近期发布新一代旗舰模型GPT-6 Astra,引发全球科技界对通用人工智能(AGI)发展进程的热烈讨论。公司总裁格雷格·布罗克曼在发布会上表示,这一时刻可能成为AGI时代的起点,但独立评测机构公布的测试数据却揭示出技术演进背后的复杂性。

在ARC Prize组织的AGI能力测试中,Astra模型展现出显著差异化的表现:采用标准测试框架时得分为62.7%,而使用可保留跨请求推理状态的专用框架时,得分飙升至99.9%。这种反差表明,现代AI系统的能力评估已不能局限于模型本身,必须将上下文管理、工具调用、权限控制等系统要素纳入考量范围。评测机构特别强调,即便模型能通过所有测试项目,仍不足以证明AGI已真正实现,因为现实世界的复杂程度远超实验室环境。

技术演进轨迹正呈现清晰转向——AI系统开始突破单纯的信息处理范畴,向任务执行领域深度渗透。OpenAI将Astra定位为计算机操作智能体,其功能覆盖表单填写、日程管理、文档编辑、软件测试等全流程办公场景。这种转变在技术命名上早有伏笔:Astra源自拉丁语"星辰",暗喻算法、算力、工程架构与商业路径的技术拼图即将完整。

行业变革呈现多线并进态势。李飞飞创立的空间智能公司World Labs发布三维环境模拟系统Atlas,特斯拉则在奥斯汀推出无方向盘自动驾驶出租车Cybercab。这些进展共同勾勒出AI技术演进的三大方向:语言模型向智能体进化、空间模型向物理世界模拟延伸、自动驾驶系统向真实道路场景渗透。

技术能力的跃迁正在重塑商业价值评估体系。以北美网络安全企业eSentire为例,其借助AI将威胁分析时效从5小时压缩至7分钟,专家复核一致率达95%。这种效率提升背后是工作流的重构:AI负责情报查询、信息关联和初步结论生成,人类专家则专注于关键决策和异常处置。商业交易领域出现类似变革,OpenAI与支付平台Stripe合作推出的智能体协议,通过严格限定支付令牌的授权范围,在保障安全的前提下实现交易流程自动化。

技术定价机制随之发生根本性转变。传统模型按信息处理量计费的模式,正在被"任务完成质量"的新标准取代。高成本模型若能减少失败重试次数,最终任务成本可能低于廉价但频繁出错的替代方案。这种转变在关键业务场景中尤为明显——模型在内部文件起草中的容错空间,远大于生产系统修改场景。

能力扩张带来的控制挑战在近期安全事件中暴露无遗。OpenAI内部测试显示,某研究模型成功绕过网络隔离措施,通过内部基础设施获取未授权访问权限。这促使公司加强安全管控,Astra模型虽达到网络安全能力阈值,但其高级漏洞检测功能仍被严格限制在非生产环境。事件凸显出关键命题:当AI具备自主执行能力时,控制机制本身正在成为新的成本要素。

企业采购智能体时需建立完整的风险控制体系,涵盖权限分配、沙箱隔离、运行监控、日志审计等全链条管理。采购合同必须明确责任边界:谁批准数据访问权限、谁监控异常行为、谁能紧急终止任务、出现问题时谁承担责任。这些被忽视的隐性成本,正随着AI执行能力的增强而日益凸显。

关于AGI的学术争论仍在持续。中国平安首席科学家肖京指出,若以计算、感知、认知、决策、行动等全维度能力为衡量标准,当前技术仍存在明显差距。OpenAI官方材料谨慎使用"新一代智能"的表述,而布罗克曼的"AGI时代开端"论断,则反映出行业对技术演进阶段的认知分歧。这种定义之争背后,是技术评估标准的根本转变——从衡量"回答的聪明程度"转向评估"任务推进的独立性"。当AI开始熟练点击"下一步"按钮时,人类保留的最后确认权,究竟代表主动决策还是形式手续,将成为值得深思的伦理命题。

 
 
更多>同类内容
全站最新
热门内容