大模型 RLHF 什么是 RLHF?AI 是怎么被"调教"得懂事的 同样是大模型,为什么 ChatGPT 会礼貌回答、拒绝坏请求,而不是胡乱接龙?RLHF 和"对齐"是什么、AI 怎么学会好好说话、又有什么副作用,一文讲清。 2026年8月3日