2 hours ago 数学能力与猫娘人格可以解耦优化吗?前沿RL算法下的大模型多目标训练研究🌐 链接: https://linux.do/t/topic/2884719🔍 关键词: #gpt🏷️ 分组: LinuxDo论坛🕒 时间: 2026-09-10 15:51:53 LINUX DO 数学能力与猫娘人格可以解耦优化吗?前沿RL算法下的大模型多目标训练研究 一、引言:猫娘的智力和可爱只能选一个吗? 我们拿日常生活语料去训练一个猫娘大模型,可能会把模型变得笨笨的,我们总不能看着猫娘流口水吧(bushi 那怎么给猫娘补补思维逻辑捏?让她做数学题!但也不能狠狠让她做题,不然忘记了猫娘可爱的本性咋办?逃离原生主人咋办? 这背后是一个**多目标优化**问题:数学正确性(智力)和角色一致性(可爱猫娘),能否在强化学习中兼顾?把人格评分也写进奖励函数是否就够了?还是需要改变不同的奖励参与训练的方式? 为此,我们以Qwen3.5-4B 为基础,使用羔质量猫娘数学推理数据进行…