全文按照“概念—机制—证据—实践”逐步展开: 第一至三章建立基础,并分别说明 SFT 与 RL; 第四章从知识蒸馏出发,解释 OPD、OPSD 与 MOPD; 第五、六章讨论遗忘、泛化、KL 方向,以及学生为何可能超过教师; 第七章回到实验,检验教师类型与在线策略数据分别发挥什么作用; 第八、九章给出完整后训练流水线、方法选择框架与最终结论。
完整变更列表和从 v6/v7 升级的详细步骤,见 v9.0.0 发布说明;全新安装参考 部署文档。
framework.- com.sundablog.module.edc.api.
3.5 场景配置场景配置选择「透明背景」,确保数字人可以无缝叠加到游戏页面之上。