8 月 13 日,X 把"For You"时间线的排序代码以 Apache 2.0 许可证放上 GitHub,并同步上线一个名为"Under the Hood"的透明工具,让符合条件的用户下载自己账号与帖子被排序系统打上的标签。相比 2023 年 Twitter 的首次"部分开源"和 2026 年 1 月的再次发布,这次的实质增量不是"又放出一段代码",而是第一次同时交出两样东西:一个可以在公司外部运行的评分系统(Phoenix),以及每个用户自己的排序标签数据。
但放出来的边界同样明确:用 Grok 预测内容是否违规的那部分被刻意保留。这个边界恰好压在"影子封禁"这个多年争议的要害上——能审计的是排序,看不见的是判定。
开的是排序,不是审核
这次开源覆盖了"For You"推荐主链路:编排层 Home Mixer、负责站内(关注账号)内容的 Thunder、负责站外内容召回的 Phoenix Retrieval,以及模型配置、过滤器和核心排序系统的参数——也就是给不同信号加权的那套参数。TechCrunch 报道称,代码量约为此前的 10 到 15 倍;截至发布时,仓库 xai-org/x-algorithm 已有约 2.7 万星标、4600 次 fork。
被明确排除在外的,是"用 Grok 预测某条帖子是否可能违规"的系统。X 的解释是防止恶意行为者读代码后绕过规则刷垃圾内容。这个决定把推荐系统分成了两层:决定"你更可能想看什么"的排序层,和决定"什么内容不该被看到"的审核层。前者开,后者关。
Phoenix:一个可以运行的推荐系统
仓库里最实质的部分是 Phoenix,一个基于 Grok-1 transformer 改造的推荐模型,承担检索和排序两步。检索阶段用双塔结构——用户塔把用户的互动历史编码成向量,候选塔把所有帖子编码成向量,再用点积相似度从海量候选中召回一批;排序阶段用带"候选隔离"的 transformer,预测每条帖子触发各类行为的概率。
两个设计值得说明。一是候选隔离:排序时候选帖子之间不能互相"注意",只能看用户和其历史,这样单条帖子的得分不取决于同批还有哪些帖子,结果可缓存、可比较。二是多行为预测:模型不是输出一个"相关度"分数,而是同时预测 15 种行为的概率——点赞、回复、转发、引用、点击、视频观看、停留、关注作者,以及不感兴趣、屏蔽作者、拉黑、举报等负面信号。最终分数是这些概率的加权和,负面行为带负权重,会压低内容。
GitHub README 里有一句值得留意的表述:系统"移除了所有手工构造的特征和大部分启发式规则",靠 transformer 从互动序列里学习相关度。这与 2023 年那次被批评为"透明度剧场"的发布形成对照——当时的问题恰恰是代码不完整、看不出系统为何如此工作。
"能跑"需要打一个折扣。开源的是缩小版的冻结 checkpoint,训练数据来自真实互动,但只是某一时刻的快照,不是持续训练的生产模型;附带的演示语料是约 53.7 万条体育帖子的六小时窗口。X 称外部研究者已能基于这些代码自行训练并运行 Phoenix 评分系统,但公司后来澄清,研究者拿到的是评分系统的运行能力,并未获得对具体帖子的逐条评分。
Under the Hood:拿到标签,不等于拿到解释
与代码配套的"Under the Hood"工具挂在应用设置里:过去一个月发帖不少于 10 次的用户,可以下载一份聚合统计的 JSON,其中列出过去一个自然月内账户和帖子被应用了哪些标签。X 的建议是,非技术用户可以把这份 JSON 丢进任意一个 LLM,让它对照 GitHub 仓库做解读。该工具先以试点形式向注册满一年的账号开放,随后扩大。
这套设计的价值,在于把"用户是否被算法针对"从主观猜测变成可检查的对象;它的上限同样清楚——JSON 告诉你"有没有标签",不告诉你标签是怎么来的。给内容打上审核类标签的那套 Grok 判定模型,恰好是没开源的环节。用户能看到结果,却无法审计产生结果的判断。
影子封禁,解开了多少
"影子封禁"的争议比这轮开源久得多。2018 年,国会共和党人指控当时还是 Twitter 的平台"影子封禁"了他们的帖子——帖子被悄悄降低可见度而不通知作者,Twitter 当时否认。马斯克收购后,2023 年首次公开算法代码,随即被纽约大学 CSMaP 等研究者批评为"透明度剧场",理由是代码不完整、无法解释系统为何如此工作。2026 年 1 月 X 再次开源,兑现马斯克"七天内开源"的承诺,并承诺每四周更新一次;此前一个月,X 还因违反欧盟《数字服务法》的透明度义务被罚 1.4 亿美元。
这轮发布能终结争议吗?一部分能。排序层的偏见——例如某个群体的内容是否被系统性打低分——理论上现在可以被外部研究者审计,因为加权参数和模型结构都在仓库里。但影子封禁的核心机制更可能落在"可见性过滤"而非"排序打分"上:仓库里有一道 VFFilter,负责在排序后移除被标记为删除、垃圾、暴力或血腥的内容。这道过滤逻辑在代码里,而判断"是否违规"的 Grok 模型被明确排除在外,X 也没有说明排序降权与审核过滤在最终的不可见中各占多少。产品副总裁 Keith Coleman 对 TechCrunch 描述的愿景是,让公众"评估帖子如何在平台上分发、核实是否存在公平的竞技场,认为不公平就批评";就影子封禁而言,公众目前能核实的只有排序这一半。
审计不等于复现
最后一层限制,是"开源"与"可复现生产系统"之间的距离。公开的 checkpoint 是缩小、冻结的;生产系统持续训练、使用更大的模型,还依赖未公开的数据、基础设施和实时信号。外部研究者可以验证算法设计是否合理,却无法用公开代码重建一条真实的 For You 时间线。更不必说,X 在被马斯克私有化、与 SpaceX 合并后,在营收、用户指标、政府下架请求等维度反而更不透明——这次开源发生在它整体透明度收缩的背景下,而不是一个本就透明的公司补上的最后一块。
把三层边界放在一起,这次发布的真实意义是:它把"算法透明"从口号变成了一部分可审计的对象,并且首次让用户接触到自己的排序标签,但边界恰好落在最有争议的违规判定上。接下来可观察的不是"更多代码"本身,而是外部研究者是否会基于公开的权重与模型结构,对排序偏见做出可复现的测量;以及 X 是否会把审核层的判定逻辑,哪怕以脱敏或审计接口的形式,纳入同一套透明承诺。