发现商业评论 旗下
洞察商业 启迪未来

港大外汇实验揭AI大模型交易真相:通义千问盈利领跑,DeepSeek亏损垫底

   时间:2026-07-21 21:23 来源:快讯作者:赵磊

香港大学经管学院人工智能评测实验室(AIEL)近期完成了一项引人瞩目的实验:将十款主流人工智能大语言模型接入真实外汇市场,让它们以独立决策者的身份进行自主交易。这项为期六周的实验,不仅验证了AI在金融市场的实战能力,更揭示了交易频率与杠杆使用对收益的复杂影响。

实验中,十款来自中美科技企业的代表性模型被赋予相同条件:初始资金10万美元、统一交易工具与杠杆设置,以及实时市场数据。这些模型包括OpenAI的GPT、Google的Gemini、阿里巴巴的通义千问(Qwen)、Anthropic的Claude等业界标杆。它们每小时接收最新市场信息,自主决定是否检索公开数据、分析行情或调整仓位,全程无需人工干预。研究团队特别强调,实验设计规避了训练数据与评测数据重叠的风险,确保结果客观性。

实验结果呈现显著分化。阿里巴巴通义千问以9.85%的累计回报率位居榜首,Moonshot AI的Kimi K2.5紧随其后,取得8.84%的收益。相比之下,DeepSeek V3.2亏损达15.1%,成为表现最差的模型,MiniMax 2.5和Claude也分别亏损10.25%和近6%。这种差距在主流货币对交易中尤为明显,例如欧元兑美元、英镑兑美元等品种的波动直接影响了模型收益。

实验揭示了两个关键现象:首先,交易活跃度与收益不成正比。DeepSeek V3.2、Claude Opus4.6等模型在六周内完成逾千笔交易,却因频繁操作导致亏损加剧;而表现优异的Qwen和Kimi交易次数控制在500至800笔之间,展现出更精准的时机把握能力。其次,高杠杆策略存在显著风险。Gemini3.1 Pro Preview和DeepSeek V3.2虽通过高杠杆放大收益潜力,但最终因回撤幅度过大拖累整体表现。Kimi K2.5则通过审慎的风险管理,在市况适宜时适度增加持仓,最终实现稳健收益。

实验负责人蒋镇辉教授指出,金融交易对AI的能力要求远超传统评测场景。与解答数学题或生成代码等静态任务不同,真实市场环境充满噪音与不确定性,模型需同时具备信息处理、风险控制、仓位管理和持续决策等多重能力。这种复杂性导致部分在推理评测中表现突出的模型,在实际交易中未能延续优势,凸显了金融场景的特殊性。

目前,全球金融机构对AI的应用仍集中于研究分析与决策支持层面,但实验结果预示着未来可能的变化。随着模型能力持续提升,AI在投资流程中的参与度正逐步加深,从生成报告到构建组合,再到执行交易决策,其角色边界不断拓展。蒋镇辉认为,当越来越多资金由算法管理时,市场运行机制本身可能发生根本性改变,这种趋势值得行业持续关注。

 
 
更多>同类内容
全站最新
热门内容