2021年,Reddit移动端应用“Relay”出现了一个技术漏洞,致使该平台的内部反垃圾信息元数据短暂地向身为版主的作者公开。通常情况下,Reddit会隐藏帖子被删除的具体原因,仅显示“自动”或“垃圾信息”等通用标签。这次短暂的泄露为人们提供了一个罕见的机会,得以深入了解Reddit的后端系统——特别是“spamurai”和较旧的基于Python的过滤器——是如何标记并删除内容的。 作者发现,Reddit运用了多种复杂的启发式方法,包括使用Perspective API(进行情感分析)、全域名封禁、正则表达式匹配以及URL重定向检测(如检测嵌入的Google Analytics ID)。数据还显示,Reddit的内部系统会追踪用户指纹、账号注册时长和ISP数据,以识别潜在的垃圾信息发送者。 作者多年来一直保留着这份研究,以防止恶意行为者利用这些漏洞。然而,他们决定在2026年将其发布,理由是现代大语言模型(LLM)的进步迫使各大平台彻底改革其垃圾信息检测机制,从而使这些旧技术在很大程度上已不再适用。这些发现为Reddit审核基础设施的演变提供了一个独特的历史视角,展示了其从早期的CRM114过滤器向现代人工智能驱动系统的过渡。