内容审核最难的第一步不是选择模型,而是把“内容要合规”变成团队能够执行的分类表。如果每个人只凭经验判断,类似内容可能得到不同结果,模型也没有稳定的标注标准。 ### 分类名称要描述具体风险 “内容不好”无法指导审核。分类应尽量明确,例如事实无法核验、标题夸大、联系方式营销、隐私泄露、未授权素材、危险操作建议、冒充身份和不当承诺。 一个内容可以同时命中多个类别。系统不要为了统计方便,强迫审核者只选一个原因。 ### 每类都要写边界和反例 分类说明至少包含定义、典型命中、正常反例和容易混淆的情况。例如,出现品牌名不一定是营销;但反复引导购买、提供联系方式并承诺效果,就需要进入营销风险判断。 反例非常重要。只收集违规样本,会让规则和模型把所有相似词都当成风险,造成大量误伤。 ### 严重程度与处置分开 同一类别可以有不同严重度。一个无来源的小数字可能需要修改,伪造重大资质则可能直接拒绝并升级。分类回答“是什么问题”,严重度回答“影响多大”,处置回答“接下来做什么”。 常见处置包括通过、修改后通过、退回补充来源、限制展示、拒绝发布、升级专业审核。不要让模型分数直接等于删除动作。 ### 给审核者足够上下文 审核界面应展示完整内容、命中段落、来源、模型理由和历史版本。如果只显示一句被截取的话,审核者很难判断它是在科普、引用还是鼓励不当行为。 ### 用真实业务样本验证 分类表完成后,从企业历史内容中抽取正常、边界和高风险样本,由多名审核者独立判断,再比较分歧。分歧大的类别通常不是人员不认真,而是定义还不够清楚。 上线后持续记录误判、漏判、修改和申诉改判。规则更新要有版本号和生效时间,不能悄悄修改后继续使用旧测试结论。 一套可执行的分类表,最终应让新人知道怎样判断,让模型知道需要识别什么,也让申诉人员能够解释为什么采取某项处置。更完整的分层审核和申诉流程,可通过本文扩展链接查看。 本文在提纲整理和初稿撰写中使用了AI辅助,发布前已人工复核事实与表达。