做法是先把客服原话拆成“问题结构”和“身份信息”两层,只保留前者进入选题,后者在进入选题池之前就替换或删除。具体判断标准不是“这句话有没有用”,而是“换一个客户、换一天,这句话还成立吗”。成立的部分留下,不成立的部分去掉。下面用一个假设情境把决策过程走完。
假设某在线课程平台的客服记录里出现三句原话:
A 含手机号、具体日期、家庭成员情况和情绪表达;B 只描述“付款成功但未解锁、换浏览器无效”;C 是转述他人猜测,没有可核对的自身现象。若把 A 直接写成选题,等于把可识别信息带进公开内容;若把 C 写成选题,则是在传播一个未经确认的机制猜测。只有 B 同时满足“可复现的现象”和“无个体身份”。
隐私剥离的动作是替换,不是打码。手机号、订单号、邮箱、住址、身份证片段、可定位到个人的时间与地点组合,都应替换为类别词,例如“某用户”“一次付款订单”“移动端登录”。这一步的结果是:原话仍然读得通,但无法反向定位到具体的人。
信息分层的动作是判断每句话属于哪一类:
选题只取现象层和条件层。情绪层可以用来判断优先级——多人反复表达同一情绪,说明这个问题值得先写——但不进入标题和正文。身份层在进入选题池之前就删掉。这个动作的直接结果是:选题池里的每一条都能被另一个读者对号入座,而不是只对原话主人有意义。
剥离隐私之后,原话里往往还剩一堆无关细节,比如“我孩子下周考试”“我朋友说等了半天”“我当时在出差”。判断这些细节要不要留,用一个问题:把它换掉,问题还成立吗?
“孩子下周考试”换掉之后,“付款后未解锁”依然成立,所以它是无关细节。“换浏览器无效”换掉之后,现象描述会变弱,因为它是区分原因的条件,所以要留。“朋友说等半天”换掉之后,剩下的是一个转述,没有自身现象,所以整句都不适合作为选题起点。
这一步的结果是:留下的细节都能帮助读者判断“我遇到的是不是同一个问题”,而不是在讲一个只属于某个人的故事。
以 B 为例,可以写成“付款成功但课程显示未解锁,换浏览器仍出现,可能和哪些环节有关”。这个选题里没有手机号、没有日期、没有情绪,但保留了可核对的现象和已排除的条件。读者看到后能自己判断是否匹配。
如果同一现象在多个客服记录里反复出现,且每次都伴随“换浏览器无效”,那么“换浏览器无效”就从一个个体条件升级为可写进选题的共性条件。反过来,如果只有一条记录提到某个细节,它更适合留在内部排查记录里,而不是进入公开选题。这个区分动作的结果是:选题的覆盖面由重复出现的结构决定,而不是由单条原话的戏剧性决定。
有时剥离隐私后会发现,原本以为的热门问题在选题池里几乎消失。这不一定说明筛选做错了,也可能是:原话里的“热度”其实来自情绪表达而非问题本身;或者同一现象被不同客服记成了不同说法;又或者记录里大量内容是转述而非亲历。要区分这几种解释,可以回看原始记录里“自身现象”和“转述猜测”的比例。如果转述占多数,那么选题池变小是正常结果,下一步应该是补充可核对的一手描述,而不是把转述重新放回去。
把以上动作连起来就是:先替换身份信息,再按现象、条件、情绪、身份分层,只留前两层;用可替换性删掉无关细节;最后用重复出现的结构决定选题覆盖面。每一步的结果都会改变下一步能用的素材范围,而不是一次性完成的清洗。