可以去掉,但前提是先保留“问题结构”再删除“身份与情绪外壳”。也就是说,先把原话拆成触发条件、用户目标、失败动作、期望结果四类信息,再删掉姓名、订单号、联系方式、具体地址、可识别时间、情绪宣泄和与问题无关的抱怨。这样得到的选题仍然可验证,又不会把某个人的隐私带进内容生产。若原话本身只出现一次、且没有第二例可对照,就不宜直接升级为长尾词库里的稳定选题,只能标记为待观察。
客服原话里最危险的不是脏话,而是可拼出身份的碎片。姓名、手机号、订单尾号、小区名、公司名、岗位、具体日期、聊天截图里的头像和昵称,都应删除或替换为占位描述。无关细节包括:用户当时情绪多激动、客服回复快不快、谁先挂断、与主题无关的支付方式偏好。判断标准很简单:删掉这条信息后,读者是否仍能理解“在什么条件下,遇到了什么问题,想达到什么结果”。如果能,它就属于可删项。
但有一类细节不能删:触发问题的条件。比如“用某版本导入表格后,金额列变成日期”中的版本、文件类型、操作顺序,是选题成立的关键。若把这些也当隐私删掉,剩下的只是一句“导入有问题”,无法形成可写的长尾词库条目。
完成这四步后,下一步不是马上写文章,而是把条目拿去和已有长尾词库比对:若已有同结构条目,就补充条件差异;若没有,再决定是否新增。这个动作会直接影响后续排期,因为未验证的个体问题一旦被当成普遍需求,容易写出只有一个人关心的内容。
假设客服原话是:“我昨天用尾号1234的账号导入了从某小区物业拿到的表格,金额列全变成日期了,你们赶紧修,不然我下午没法交差。”可保留的结构是:用户导入表格后,金额列被识别成日期,影响后续提交。可删除的是:尾号1234、某小区物业、昨天、下午、交差压力和催促语气。
处理后得到的选题方向是“导入表格后金额列变成日期怎么办”,而不是“某小区物业导入失败”。如果后续又出现两三条同结构原话,只是文件类型或列名不同,就可以在长尾词库里拆出条件分支;如果始终只有这一条,就只作为待观察记录,不占用正式选题位。
当问题本身依赖身份或场景才能成立时,删掉隐私和细节会把选题删空。例如“只有某类企业账号在特定权限下才看不到某个按钮”,若把账号类型和权限条件都去掉,剩下的“看不到按钮”无法指导任何人。此时正确做法不是保留真实身份,而是把身份抽象成可公开描述的条件类别,并明确这是假设分类,不是对某个真实客户的指认。
另一个失效边界是:原话里的“无关细节”其实可能是问题原因。用户抱怨“客服回复慢”,表面与操作问题无关,但如果多条原话都指向同一环节,它可能暴露的是流程断点。此时应先记录为流程观察,而不是直接删掉。是否升级为长尾词库选题,取决于它能否被写成对读者有用的条件与动作,而不是取决于它听起来像不像隐私。
清洗完成后,让不接触原始对话的人只看条目,判断能否复述出“谁在什么条件下遇到什么障碍”。如果复述不出来,说明删多了;如果复述时能猜出具体客户,说明删少了。复核通过后,再把条目按“已多次验证”“仅单例待观察”“依赖特定权限”三类归档。这个归档结果决定下一步是直接写选题、继续收集同类原话,还是先补条件说明。只有走到这一步,长尾词库才不只是原话摘抄,而是可复查、可取舍的选题来源。