两小时的播客、一下午的会议录音,转成文字稿轻松两三万字。整个贴进 AI 对话框,常见结局有两种:直接提示超长被截断;或者看起来总结出来了,但第 70 分钟那个最关键的决定完全没出现在结果里。
这不是模型不行,是喂法不对。搞清楚一个概念、一个现象、一套流程,就够用了。
token:模型眼里的计量单位
模型不按「字」处理文本,按 token——分词器切出来的最小单位。换算感觉:
- 英文约 1 token ≈ 4 个字母(0.75 个单词)
- 中文因模型而异,粗略按 1 个汉字 ≈ 1 token 出头估算;为什么中文普遍比英文「贵」,见中文在 LLM 里为什么更贵
代入现实:口语语速每分钟 200–250 字,两小时节目 ≈ 2.5–3 万字 ≈ 3 万–4.5 万 token。这个数字决定了三件事:塞不塞得进上下文窗口、API 计费多少、以及要分几块。不同模型的分词差异不小,精确值用 LLM Token 计数实测,别按字数猜。
塞得下 ≠ 处理得好
现在的模型动辄几十万 token 上下文,两小时文字稿理论上塞得下。但「塞得下」和「处理得好」之间有三道坎:
中间遗忘。 大量测试反复验证:模型对长输入的开头和结尾利用得最好,中段信息的召回明显下滑。一次性塞入的会议记录,最重要的结论若出现在第 70 分钟,恰好落在最容易被略过的位置。
输出稀释。 给模型 3 万 token 要一份总结,它的输出就几百到一两千字,平摊到每个话题只剩两三句。分成 6 块分别总结,同样的内容拿到 6 倍的输出预算,细节保留量完全不是一个量级。
费用结构。 按 token 计费的场景下,长对话每追问一轮都要重新支付整个上下文的费用——这笔账在长上下文成本工程里算得很细。
反过来说,几千 token 的短文、或者「从中找某个具体信息」的检索型任务,不用分块,直接整段给最简单。分块是给「长材料 + 全面整理」这个组合准备的。
分块的第一原则:跟着内容边界走
最常见的错误做法是每 2000 字硬切一刀。断口落在句子中间时,前一块以半句话结尾、后一块没头没脑地开始,两块在断口附近的总结都会失真。
切分位置的优先级:
- 话题边界——讲者换话题处。文字稿里的线索是段落间较长的时间间隔(这正是转文字稿时按停顿分段的价值)
- 段落边界
- 句子边界
- 句中——万不得已
操作方式是「上限 + 就近收块」:设定单块 token 上限(2000–4000 是各模型都舒服的区间),按段落聚合,逼近上限时在最近的段落边界收块。既不破坏语义,又不超预算。
至于块与块之间要不要重叠:做检索(RAG)时通常留 10–15% 重叠,防止答案恰好横跨两块;顺序总结不需要重叠——用「前一块的三行小结」衔接更省 token,效果还更好,这就引出提示词的写法。
逐块提示词 + 最后合并:map-reduce 两段式
裸贴一句「总结一下」,每块会被当成独立文章处理,合并时风格混乱、「他」「这个方案」之类的指代全断。逐块提示词要交代四件事:
这是一期关于「××」的播客文字稿,共 6 块,这是第 3 块。
前一块的小结:(三行要点)
请提炼本块要点,每条 1–2 句,条目后标注依据的时间戳 [mm:ss];
区分发言人;不要开场白和结语,不要补充文字稿之外的信息。
- 全局背景 + 块位置:模型知道自己在处理局部,不会给每块都写「本文介绍了…」
- 前块小结衔接:代替大段重叠文本,跨块指代接得上
- 统一的输出格式:合并阶段不用返工
- 负面清单:禁客套、禁自行发挥
全部块跑完后进入第二段:把各块小结按顺序连起来,加一句「这是同一份文字稿各部分的小结,请合并成一份连贯的总结」,一次交给模型。这就是长文档处理的标准形态 map-reduce:逐块提炼(map),统一归并(reduce)。
时间戳:最便宜的防幻觉手段
提示词里那句「标注时间戳」值得单独说。要求每条要点锚定到 [42:10] 这样的段落时间戳,有三重效果:
- 模型凭空发挥的空间被压缩——编造的论点没有时间戳可标
- 任何存疑的要点,跳回原音频几十秒即可核实,不用重听全程
- 合并阶段按时间戳排序,多块小结不会时序错乱
配套两条纪律:数字、金额、日期让模型原样引用而非转述(转述是数字幻觉高发区);拿到总结先抽查两三条边缘要点——重要结论通常没错,错的都藏在细节里。
落到工具上
整条流水线在本站可以走通:字幕转文字稿先做去重、断句、段落时间戳,再用它的按 token 分块功能——在段落边界收块,每块自动带上可编辑的提示词模板,逐块复制给任意 AI 使用,全程本地处理。文字稿的整理原理见字幕转文字稿的三步结构还原,token 的计数细节见 LLM Token 计数。