模型能够完成本地部署,并不意味着它在真实业务场景中能够游刃有余。在具体的业务流程中,AI不仅需要具备基础的对话能力,还必须精准理解复杂的规则、遵守安全边界,并正确调用外部工具以输出符合规范的结果。为了攻克这一痛点,蚂蚁ASystem团队联合开源社区共同维护的本地化大模型后训练工具包AReno,近日携手百灵大模型推出了一条轻量级的后训练实践路径,成功在单机环境中打通了Agentic RL(强化学习)闭环。

为了确保整个技术方案具备高度的可复现性,本次合作选取了规则清晰、反馈直接的井字棋作为最小验证任务。实验基于DGX Spark硬件环境,对拥有7.9B总参数但激活参数仅为1.3B的Ling-3.0-tiny模型展开了后训练。在训练初期,模型虽然能够理解基本规则,但在交互过程中仍会出现非法动作;而通过将任务规则转化为精确的Reward反馈机制,并借助GSPO算法进行400个步骤的训练后,模型的奖励均值明显提升,输出长度也随之收敛。复测结果充分证明,模型在工具调用与动作选择上的稳定性与合理性得到了质的飞跃。

告别单机模型“虚胖”:百灵团队联合AReno打通本地智能体强化学习闭环

这一探索的核心价值在于验证了一条透明、可复现的任务适配方法论:从精准发现错误、定义可验证反馈,到完成本地训练并回到同一环境进行复测。该模式不仅适用于棋类实验,更可以流畅迁移至工具调用修复、结构化字段抽取、领域指令遵循以及业务流程智能体等多元化的真实生产场景中。

目前,Ling-3.0-tiny已提供BF16、FP8和INT4等多种开源版本,开发者可通过Hugging Face或魔搭社区获取并使用,同时也可以访问AReno开源仓库参与后续的代码共建与技术讨论。