去 AI 味
让 AI 写出的中文读起来像某个人写的。分两件事:去掉通用套话,和写得像你。
当前判断(截至 2026-09-16)
- 业界把它做在四层:提示层(禁用清单)、采样层(解码回溯,吞吐代价 69%–96%,多数商用 API 不给 logit bias)、权重层(后训练 / RL 规则 / 风格向量)、验收层(人类语料测误报)。拿 API 的人只能做提示层、后处理和验收层。
- 通用套话归模型:厂商已在后训练里压谄媚、把禁开头赞美写进 RL 规则。禁用清单跟版本过期,两个月一换。
- 「像你」归你自己的材料:五篇样稿做 few-shot,在博客和论坛体上仿不像(作者归属 26%–44%,人写原文 79.8%–95.5%)。个性化微调与风格向量可行,但训练数据就是你的样稿与改稿。
- 可落地的四个零件:判断账本、正则机检(带实测白名单)、人检与封顶两轮改写、纠正回流。机检只定位,判断权在人;事实丢失由账本管,正则看不见。
- 中文侧有画像和检测语料,没有去味方法的公开评测。中文 AI 味的主症状是过度书面(双音节化、连词多、语气词少),但已知数据出自 GPT-3.5 时代的网络问答语料,只能当方向不能当阈值。
来自哪些文章
- [[ai-plain-language-engineering]]