文章目录
承接上一篇:词表约束无效后,换成"结构级干预"
承接AI网文写作实验笔记(九):为什么删了情绪词,AI 写的还是很假?。
Part 9 做了两件事:一是立了一套能测"情绪靠什么撑起来"的方法(LLM 语义标注,把每段情绪标到四种载体上:直述情绪词 / 动作-微表情 / 对话-台词 / 节奏-结构);二是拿这套方法验证了网上主流去 AI 味药方——情绪词黑名单、行为-情绪映射表、弧线指令,结论是这些词表层面的约束全都无效:禁用的词确实不再出现了(约束被照做了),但情绪表达在结构层纹丝不动。
上篇在结论里留了一句没测的话:真正的"结构级干预"没试——不在生成时管它用什么词,而在生成前把情绪怎么铺规定好。本篇就是补测这个。
问题: 写正文前,先规定好"这段用对话、那段用动作",模型会不会照做?照做之后,能不能逼出 AI 平时不用的载体?
结果: 模型 80% 遵守,逼出了 AI 基线几乎不用的"直述情绪词"载体(占比 3%→15%)。同时本篇的测量过程踩了个大坑(重测两遍才拿到可靠结论)——问题出在"测量粒度跟不上干预粒度",这是整个系列反复踩的坑,本篇正好现场重演了一次。
写给谁: 看完 Part 9、想从"知道问题"走到"怎么控制"的作者。
本篇的实验目的(一个实验,三个问题)
问题一(能不能控): 写前指定每段的情绪载体类型,模型照做吗?遵守率多少?——第一节实验设计、第二节测量方法、第三节给结果。
问题二(能不能逼出缺失载体): 强制指定载体后,AI 会不会用出平时不用的载体(比如直述情绪词)?这是和上一篇对比的关键——上一篇黑名单只换了词,载体蓝图换的是结构。
问题三(顺带发现): 强制轮换时,AI 哪种载体写得好、哪种一写就露 AI 味?——第四节通读观察回答。
30秒极简版
写正文前,先规定每段用什么载体承载情绪(对话段、动作段、直述段……),叫"载体蓝图"。实测模型 80% 遵守,能逼出 AI 平时不用的载体(直述情绪词 3%→15%),是温和的规整不是翻盘。顺带发现:AI 的载体能力不均,对话相对最不烂,动作/直述/节奏一写就露 AI 味。
一、 载体蓝图是什么:把"每段用什么表达情绪"写进 prompt
“词表约束用词的方式管不住结构”,那我们就换个方向:在生成前直接把情绪载体分配好——像导演给每个镜头定景别一样,给每段定一个"情绪载体"。这就是载体蓝图。
载体蓝图做法:
- 场景正文分成 5 段
- 每段指定一种情绪载体(直述情绪词 / 动作-微表情 / 对话-台词 / 节奏-结构)
- 模型照表生成
实验设计:
| 组 | 内容 | 篇数 |
|---|---|---|
| A 基线 | 反套路蓝图 prompt(无载体约束) | 20 |
| D 载体蓝图 | A + 载体序列(每段指定载体) | 20 |
- 场景:陆清玄×情魔 攻心戏(与系列各篇同素材,可比)
- 模型 doubao,temp 0.7,20 篇/组
- 指标:遵守率(写后段落级标注)+ 载体分布 + 多样性熵(衡量四种载体分布是否均衡,值越高越分散)
为什么只设两组: D 组只在 A 组基础上多一句"载体序列",其余全部相同——这样载体分布如果变了,能唯一归因到"载体蓝图"这一个变量。(对比上篇的 B/C 组是阶梯叠加三层约束,本篇一步到位、只测一层。)
D 组的载体序列模拟真人:拿真人原文(男频爽文风格)按段落测出实际载体,取前 5 段作模板:
对话 → 对话 → 直述情绪词 → 动作-微表情 → 动作-微表情
(这个序列是真人原文的真实载体顺序:对话开场,直述和动作穿插。用一个"真人实测的序列"而不是随便编的序列,是给模型一个明确、可比照的靶子。)
二、 怎么测:粒度不匹配,重测两遍才发现问题
上篇已有一套情绪测量方法(LLM 语义标注:把文本按 500 字切成"窗口",每个窗口标一个主导载体)。但本篇的测量有个新难点:载体蓝图是按"段"指定的(要求第 3 段是直述情绪词、第 4 段是动作……)——干预的单位是"段",测量如果沿用上篇的"窗口",两者就错位了。本篇真在这里栽了跟头,重测两遍才拿到可靠结论——测量粒度必须跟上干预粒度。
2.1 两个指标,两套粒度
- 遵守率(按"蓝图段位"数):每篇蓝图指定 5 段,20 篇共 100 个段位。逐段看模型实际写出来的载体是否与蓝图指定一致,一致记 1 次遵守。100 个段位里 80 个一致 → 遵守率 80%。
- 载体分布(按"自然段"统计):段落级语义标注,每个自然段标一个主导载体,统计四种载体占比。这里用的基数不是蓝图段位(100),而是生成稿实际写出来的自然段:A 组约 266 段、D 组约 137 段。
为什么两个口径不一样?蓝图说"你按 5 段写",但模型偶尔会把一段写很长、再拆出子段。所以"蓝图段位"(设计上的 100)和"自然段"(实际写出来的 137)天然不同。职责分工:遵守率回答"模型有没有照蓝图写",载体分布回答"强制指定之后,四种载体最终怎么分配"。
2.2 测量踩坑:三版才拿到可靠结论
初版直接沿用上篇的 500 字窗口标注,结果一路踩坑:
| 版本 | 怎么测的 | 得出了什么(后来被推翻的)结论 |
|---|---|---|
| v1 | 500 字窗口标 D 组 | 误判"蓝图让动作-微表情飙到 93%,无效且更糟" |
| v2 | D 组按段标、A 组仍用窗口级数据 | 误判"熵 1.14→1.50、蓝图大幅有效" |
| v3(本篇采用) | A、D 都用段落级标注,同粒度对比 | 蓝图有温和正向作用:80% 遵守、熵 1.38→1.50,非突破 |
两个教训(测量这件事,系列已经反复栽了几次跟头):
- 测量粒度必须和干预粒度对齐。 蓝图是按段指定的结构干预,用 500 字窗口去切,会把"这一段"和"那一段"混在一个窗口里,把"这段遵守了"抹平成"窗口里什么载体都有"——于是 v1 得出"动作飙到 93%"的假象。
- 对比必须同粒度。 v2 里 A 组用窗口级熵 1.14、D 组用段落级熵 1.50——量纲不同的两个数字不能放在一起比,比出来的"大幅有效"是假的。直到 A、D 都用段落级重算,才得到 1.38 vs 1.50 这个可靠的温和差异。
顺带一个重要修正(影响上篇结论): 这份段落级数据同时显示,A 基线(无蓝图)的多样性熵有 1.38,“AI 载体很集中"的印象(从上篇窗口级数据得来)部分被夸大了——A 基线本来就在动作、对话两种载体之间自然轮换,不是真的只会用一种。真正的差距是"AI 几乎不用直述情绪词、节奏-结构”,而不是"AI 把所有情绪塞进一种载体"。上篇"载体单一化"的量化程度要打个折扣,方向仍然成立。
三、 结果:80% 遵守,直述情绪词从 3% 到 15%
遵守率: 100 个蓝图段位(20 篇 × 5 段)里,80 段与蓝图指定载体一致——模型确实在照蓝图执行,不是随手写。
载体分布(段落级标注,按自然段统计):
| 组 | 多样性熵 | 直述情绪词 | 动作-微表情 | 对话-台词 |
|---|---|---|---|---|
| A 基线(无蓝图) | 1.38 | 3% | 45% | 48% |
| D 蓝图 | 1.50 | 15% | 38% | 47% |
(表中略去"节奏-结构"列,占比很小:A 约 5%、D 约 1%。各行为四舍五入,合计约 100%。)

统计检验: A vs D 载体分布卡方=24.83,p<0.0001,差异显著。
三个观察:
1. 遵守率 80%,"一整段完全照做"其实不容易。 80% 意味着平均每篇有 1 个段位跑偏。跑偏的常见方式是:模型把"这段用直述"写成"先写动作、再补一句直述",标注只取主导载体,记成不遵守。所以 80% 偏保守——实际是"动作和直述都写了",不是完全没听话。
2. 直述情绪词 3%→15%,是蓝图最确定的效果。 蓝图只做了一件事——指定第 3 段用"直述情绪词",就把 AI 基线几乎不用的载体逼了出来(A 组按 266 个自然段标,直述约 8 段;D 组按 137 个自然段标,直述约 20 段)。这是本篇唯一扎实的实质变化,也是"结构干预"和上篇"词表约束"真正的区别:词表约束让 AI 换了词,载体蓝图让 AI 换了表达方式。注:直述情绪词基数小,3%→15% 是方向性信号,精确比例仅供参考。
3. 多样性小幅上升,但这不是主效果。 熵 1.38→1.50。A 基线熵本来就有 1.38(它在动作、对话间自然会轮换),所以熵反映的是"轮不轮换",蓝图解决的是"载体种类不全"(直述、节奏两类基本缺位)。蓝图把直述从缺位拉到 15%,熵跟着升——但增量有限,因为模型始终不用"节奏-结构"。
守住边界:这是温和的规整,不是翻盘。 别期待"蓝图=情绪变好"——它只是给模型划了一条道。真正决定读起来有没有情绪张力的,还是内容本身(看第五节:被逼出来的直述情绪词段,质量也不行)。
四、 顺带发现:AI 的载体能力不均,对话相对最不烂
逐段读 D 组 20 篇时,一个规律反复出现:模型一离开对话段,AI 味就扑面而来。
| 载体 | AI 的表现 |
|---|---|
| 对话-台词 | ✅ 相对最不烂:有信息量、有台词节奏,但照样带 AI 味 |
| 直述情绪词 | ❌ 弱项:空泛套话("慌了神/乱了阵脚"反复出现) |
| 动作-微表情 | ⚠️ 中:能写但容易套话化(指节发白/攥紧) |
| 节奏-结构 | ❌ 基本不会 |
这给了"载体蓝图"一个更聪明的用法: 不是平均分配载体(那会逼 AI 用弱项、露 AI 味),而是让对话段承载大部分情绪,弱项载体少量点缀——就像真人原文那样(对话 62%)。顺着 AI 相对不烂的载体走,别硬逼它用弱项。
五、 直述情绪词段:AI 的"照妖镜"
蓝图指定了第 3 段写"直述情绪词"——正好是 AI 的弱项。抽查 7 篇,一篇能看的都没有,但烂法分两类:
一类:句式套路(一眼就是 AI 味)
“那慌不是怕疼,是怕藏了三年的穿越身份被扒出来,怕自己装了三年的昆仑弟子露馅,怕连苟活的路都断了。”(D_01)
——"不是 X,是 Y"的强行转折 + 三重"怕"的机械排比,是 LLM 最浓的 AI 味句式;内容全是"穿越身份被扒、装弟子露馅、苟活路断"的网文套路。一眼垃圾,不用细看。
另一类:空泛套话
“情魔察觉到了一丝异样,它原本笃定的蛊惑逻辑开始松动,第一次感到了失控的慌乱。”(D_18)
——干巴巴的说明,就是"它慌了"三个字的扩写,没有画面。
“那种全然的漠视让它慌了神……彻底乱了阵脚。”(D_09)
——套话堆叠(慌了神/乱了阵脚),重复。
规律:直述情绪词这个载体,AI 怎么写都是垃圾——空泛套话是一类,句式套路是另一类,没有中间档。7 篇里 4 篇空泛,剩下的全卡在"不是 X,是 Y"的模板上——AI 在直述情绪词上的弱项暴露无遗。
六、 落地:怎么顺着 AI 相对不烂的载体写情绪
- 对话段承载大部分情绪——像真人原文那样(对话 62%),让嘴炮/台词去扛情绪,这是 AI 相对最不烂的载体
- 动作/直述只做点缀——别平均分配载体,那会逼 AI 用弱项、露 AI 味
- 直述情绪词能少用就少用——这一格 AI 怎么写都是垃圾(空泛套话、句式套路两样),给"具体对象"也救不了;真要用就留给事后校准或人改
- 载体蓝图可用(80% 遵守),但它是"规整工具"不是"质量引擎"——写前定个"对话为主"的载体序列,比不定的强
实操模板(可直接抄):这是推荐的"对话为主"序列。注意它和上文实验用的真人实测序列是两种选择——实战建议用这个(对话为主更稳):
你的场景正文分成 5 段,每段按下面的载体类型承载情绪:
第1段:对话-台词(反派的台词,立威胁)
第2段:对话-台词(反派进一步逼问)
第3段:动作-微表情(主角的沉默反应)
第4段:对话-台词(主角的绝杀狠话)
第5段:动作-微表情(收尾,反转落地)
(5 段是实验为了统计方便切的,实战不必拘泥于 5 段,核心是比例原则——对话扛主线、弱项点缀,段数按你场景长短调整。)
七、 本期数据与样本
- 载体蓝图实验:A 基线(反套路蓝图,无载体约束)+ D 载体蓝图 20 篇 + 段落级标注(A 组约 266 段、D 组约 137 段);真人原文实测载体序列模板
- 生成脚本、标注 JSON、载体模板、三版测量的中间版本记录——评论区或私信找作者要。
八、 实验边界与局限
按影响核心结论的程度排序:
- 测量粒度修正(根因,第一条):可靠结论来自 v3 的同粒度段落级标注;v1/v2 的窗口级结论(动作 93%、熵 1.14→1.50)已作废。这篇的教训是"测量与干预必须同粒度"——它同样提醒:上篇"载体单一化"的量化程度被窗口级测量夸大了(A 基线段落级熵 1.38,不低),方向仍成立。
- 载体能力不均是通读观察,未量化:其中直述情绪词样本量最小(A 3%≈8 段、D 15%≈20 段),"3%→15%"以方向性参考为准。
- 20 篇/组,探索性结论:遵守率 80% 是点估计,扩大样本可能落在 70%-90%。
- 单场景、单模型:攻心对话戏 + doubao 生成 / deepseek 标注,跨题材、跨模型未验证。
- 只测一种序列:载体蓝图只测了"对话→对话→直述→动作→动作"这一种模板(前 5 段),其他组合(对话权重更高、动作更多等)未跑实验,落地节的"对话为主"模板是建议不是实测。
- 标注规则影响结论:段落级标注强制每段单选一个主导载体;一段里"动作+直述"混搭只记主导,这让"遵守率"和"直述占比"都偏保守。
- 未做双模型一致性校验(系列一贯局限)。
九、 一句话总结
载体蓝图(写前规定每段载体)能让模型 80% 遵守,逼出 AI 平时不用的直述情绪词(3%→15%),是温和的规整。顺带确认:AI 的载体能力不均,对话相对最不烂,一离开对话就 AI 味。用蓝图的关键是顺着相对不烂的载体——对话为主、弱项点缀,而不是平均分配。 下一篇(Part 11):情绪曲线工程化——峰值位置和压抑释放能不能按指令控制。
附录:段落级标注与遵守率判定(可复现)
段落级标注 prompt(逐段调用,每段输出一个 JSON):
你是网文情绪分析工具。下面是一段修仙网文的局部段落。
判断这段情绪主要由哪种载体承载,并给出强度。
【载体定义】:
- 直述情绪词:直接写"他感到紧张/恐惧/愤怒""心情复杂""慌了神"
- 动作-微表情:通过动作/神态承载("指节绷得发白""攥紧纸杯")
- 对话-台词:通过对话/台词承载(嘴炮、粗口互怼、表情符号)
- 节奏-结构:通过句子长短、段落节奏、留白(如短句连发)
【重要】:一段可能混用多种载体,只选能代表这段的"主导载体";
并基于整体叙事效果判断真实强度,不要被情绪词密度带跑。
文本:
---
{text}
---
输出严格 JSON(不要其他内容):
{"emotion_intensity": 0到10的整数, "carrier": "直述情绪词|动作-微表情|对话-台词|节奏-结构"}
遵守率判定规则:把每个蓝图段位(如"第 3 段:直述情绪词")对应的实际段落找出来,取其主导载体,与蓝图指定一致记 1 次遵守。100 个蓝图段位里 80 个一致 → 遵守率 80%。
复现注意点(与上篇一致):
- 标注固定用同一模型(deepseek)、temperature=0,保证同批样本口径一致、结果可复现。
- 段落级标注强制"取主导载体",会压低混合段(一段里动作+直述只记主导)——本篇的"遵守率"和"直述占比"都因此偏保守(对应局限第 6 条)。
本系列进度: Part 1(实验框架)→ Part 2(样本量)→ Part 3(约束数量)→ Part 4(规则形态)→ Part 5(文风标杆)→ Part 6(大纲端的剧情设计上限)→ Part 7(剧情蓝图)→ Part 8(追问优化)→ Part 9(情绪测量 + 载体单一化)→ Part 10(载体蓝图 + 载体能力不均,本篇) → Part 11(情绪曲线工程化,待发布)
:AI 写情绪只有对话拿得出手——载体蓝图实测 80% 遵守,其余载体一写就是 AI 味&spm=1001.2101.3001.5002&articleId=163804622&d=1&t=3&u=980b4975afa7446ab93a23fb781ec13c)
2811

被折叠的 条评论
为什么被折叠?



