①美东时间周三美股三大指数走低,存储芯片股逆势走强;
②高盛称,存储行业下行周期最糟糕阶段或已结束,资金可能正在重新进场;
③美光9月30日将公布2026财年四季度业绩,将会是验证行业看多逻辑的关键考验。
财联社9月10日讯,近日,界面财联社旗下大模型科技公司财跃星辰(FinStep)联合上海交通大学安泰经济与管理学院花成副教授团队,开源发布金融推理大模型Alpha-R1。
该模型仅以8B参数为基座,凭借独创的"语义门控"推理技术与两阶段强化学习训练框架,在金融推理任务的样本外评测中大幅领先通用大模型与传统方法;同时,它能实时读懂当前市场环境,从成百上千条候选配置思路中动态挑出当下真正有效的少数几条,并用普通人看得懂的语言解释"为什么此刻该这样配置",为智能资产配置研究提供了全新范式。
一句话概括:Alpha-R1让大模型像资深研究员一样"读懂"市场——面对成百上千条候选配置思路,它只放行经济逻辑与当下行情相吻合的少数几条,并用"人话"解释为什么选它。
双重痛点:大模型"不懂经济逻辑",静态配置"永远慢半拍"
金融推理任务的难处在于环境会变。对模型而言,通用大模型虽能读懂新闻,却不会把新闻与具体决策关联起来——如同背熟药典却不会看病的医生;对资产配置实践而言,配置思路会"过期":去年管用的思路,今年市场风格一切换就可能失灵,而调整往往靠经验"拍脑袋"。传统统计方法只认历史相关性,看不懂每条思路背后的经济逻辑,自然说不清它为什么有效、何时会失效。
Alpha-R1要解决的正是"看懂"与"用上"之间的断层:先读懂市场,再匹配思路——就像医生对症下药,而不是闭眼抓药。
核心机制:语义门控,为当下环境匹配"对症"的配置思路

图1 Alpha-R1总体工作流程
Alpha-R1的核心是一项名为"语义门控"(Semantic Gating)的推理技术:每次决策前,模型综合行情数据与决策时点前的财经新闻,实时构建一份"当前市场状态描述";随后把每条候选配置思路附带的"经济逻辑说明书"与市场状态逐条做语义匹配,只放行逻辑与当下环境吻合的思路,其余一律拦截,并据此对股票池进行侧重配置。价值、动量、质量等不同配置思路各有适配环境,Alpha-R1做的就是判断"此刻是哪种环境、该启用哪类思路",而不是对所有思路平均用力。
训练框架:两阶段"海选加面试",用真金白银的成绩单当老师
Alpha-R1采用两阶段训练框架:先由数值方法"海选"出候选池,再由模型做语义"面试"复筛;随后通过GRPO强化学习持续训练,奖励信号直接取自全真模拟环境下的真实收益——相当于用真金白银的成绩单当老师,练会为止。消融实验显示,去掉强化学习训练后,标普500任务的模拟年化收益从47.87%跌至12.85%(历史模拟结果,不构成投资建议)——读懂市场的能力不是天生的,而是练出来的。
样本外评测:8B小模型全面领先
研究团队以2025年全年12个月、训练中完全未见过的行情进行全真模拟实测(以下均为历史模拟结果,仅供学术研究参考,不构成投资建议):

风险调整后收益,即"每承担一份风险换来的回报"。
同条件下,最强通用大模型DeepSeek-R1在标普500与沪深300任务上仅取得21.94%与14.66%的模拟年化收益;传统统计与机器学习方法(PCA、XGBoost、LightGBM、PPO、DDPG、TD3、SAC等)均被大幅甩开。值得一提的是,罗素2000与中证1000是训练中从未见过的全新股票池,模型展现出强劲的跨环境泛化能力。

图2 各方法历史全真模拟净值表现对比
实战切片:恐慌抛售日,它是怎么想的
论文附录完整记录了2025年4月9日美股恐慌抛售日的决策过程:Alpha-R1先将市场状态识别为"恐慌抛售、短期波动放大",随后优先启用短期价格偏离类配置思路,下调适配平稳行情的长周期类思路,并给出完整理由——在方向性压力与交易失衡之下,短期偏离类线索对价格发现更具参考意义,而长周期思路的逻辑前提与当下并不吻合。每一次调整都附带人类可复核的解释,降低了金融模型"只给答案、不讲原因"的黑箱风险。
严谨性:不是碰运气,更不是背答案
研究团队以block-bootstrap统计检验(1万次重采样)验证结果稳健性,并设计BM25关键词匹配证伪实验,证明模型的判断并非死记新闻关键词。论文同时诚实声明:Alpha-R1是学术研究产出,而非实盘投资服务。
开源与资源
目前,Alpha-R1的论文、代码与模型已完整开源,训练框架、评测设置与可解释案例同步公开,供学术界与产业界复现验证。
双方声音
上海交通大学安泰经济与管理学院花成副教授表示:"资产配置首先是一个理解经济环境、辨析策略适用边界的问题,而不仅是对历史数据做相关性拟合。市场状态会变化,策略背后的经济逻辑也有其成立条件;Alpha-R1尝试让模型把这些条件显式纳入决策,在不同环境下动态选择更匹配的配置线索,并给出人类可以复核的理由。将模型、代码和评测过程开放出来,有助于把金融大模型的讨论从单一收益结果推进到经济解释、稳健性和可复现性的系统研究。"
财跃星辰CTO白祚博士表示:"金融推理的关键不在于让模型生成更多内容,而在于建立一套能够筛选、验证和迭代决策链路的训练机制。Alpha-R1以8B参数模型为基础,将语义门控与GRPO强化学习结合起来,把市场状态识别、候选逻辑筛选和模拟收益反馈纳入同一个闭环,在控制模型规模的同时提升推理效率与部署可行性。我们选择开源代码、模型和评测框架,是希望让更多研究者和工程团队复现这套方法,并共同检验它在不同数据和场景下的泛化能力。"
财跃星辰是专注于金融领域的大模型科技公司,由国内领先的财经媒体和金融信息服务商界面财联社和头部通用大模型公司阶跃星辰联合创办。"语义门控加强化学习"的训练范式有望推广至更多需要"看环境、讲道理"的专业领域,相关能力正逐步应用于智能投研、风险监测等场景,为金融智能化提供可复用的技术底座。