众力资讯网

网站推荐算法技术拆解:为什么你喜欢A,平台会推A的黑料 没有一个专门叫“对立推送

网站推荐算法技术拆解:为什么你喜欢A,平台会推A的黑料
没有一个专门叫“对立推送”的独立算法,它是现代整套推荐系统多个机制叠加出来的现象
1. 向量匹配:标签泛化(基础层)
所有内容都会被打成向量标签。
- 你浏览了A,你的用户向量里面,A这个关键词权重拉高
- A的正面内容、A的黑料、争议八卦,共享同一个核心标签A
- 在向量空间里面,黑料和正面内容距离很近。
⚠️算法不会理解语义(它不知道这是夸奖还是抹黑),只识别关键词实体A。只要标签命中,就具备推送候选资格。
举个例子:你刷到某个明星短视频。不管是粉丝向还是爆料黑料,embedding向量里面都带有这个名字,都会进入你的候选池。
2. 探索‑利用权衡 Exploration‑Exploitation(经典博弈)
所有平台都有这套底层策略
1. Exploitation(利用):推你已经明确喜欢的A正面内容,保证你留下来。
2. Exploration(探索):系统不确定你到底有多强的偏好。它会主动投放同主题下其他立场内容(黑料、反面观点),用来做测试:
“看看你对负面版本会不会同样产生行为?”
它在做实验:你到底是只是对话题A感兴趣,还是只喜欢夸赞A的内容。
只要你停留3秒、哪怕生气划慢一点、打字反驳,就是正向信号。
3. 强化学习的奖励机制(最关键)
现在短视频平台大量使用强化学习RL做排序,目标是最大化engagement(互动收益),也就是停留时长、评论、转发、完播率。
✨算法没有善恶,它只认奖励:
愤怒、激动、想要反驳产生的互动,和点赞喜爱,在模型里是一模一样的正向Reward(奖励)
一条A的黑料如果你点开、写评论反驳,系统收到信号:这条内容对该用户有效,后续会提高同类内容排序权重。
于是形成一个正反馈闭环:
刷到黑料 → 生气,进行互动 → 算法收到高回报信号 → 推送更多对立内容
很多创作者摸透这套机制,专门批量产出正反两套内容,收割两边流量。支持者点赞,反对者过来吵架,两边都贡献互动数据。
4. 多兴趣建模
现在主流模型(比如抖音、快手)都是多兴趣网络,会给你维护好几套兴趣向量,而不是单一标签。
- 向量1:喜爱A
- 向量2:对争议、冲突类内容敏感
当你在A的负面内容有几次行为之后,系统会新建一条兴趣通道: 【话题A + 冲突向内容】 ,之后源源不断投喂这条分支内容。
5. 并不是平台故意要制造对立
它是优化目标带来的副作用:平台的优化指标是停留时长,不是你的信息健康度。
目标函数: Maximize(用户在线时长) ,而不是 Maximize(用户看到客观平衡信息)
🧠 现实里面完整链条(从头到尾)
1. 你点开几条A的正向内容 → 用户向量A权重上升
2. 根据探索策略,系统放出几条A的负面内容做小流量测试
3. 你看到黑料,情绪上头,停留、打字反驳
4. 强化学习模块收到高额互动奖励,上调同类内容排序分数
5. 多兴趣网络新增一条:你对A的争议内容感兴趣
6. 后续信息流里面,正反内容交替出现,有时候负面内容越来越多
✅ 从算法层面怎么破这个循环
从上面流程反推:
1. 不要停留:看到对立内容立刻划走,不要看完
2. 绝对不要评论反驳,这是最高权重的奖励信号
3. 不要点进去看评论区
4. 使用“不感兴趣”反馈,降低这条兴趣分支权重
5. 主动刷完全无关领域内容,稀释向量里面这个话题权重
误区:不要指望跟内容吵架能够“纠正算法”。恰恰相反,你的争吵行为就是这套算法最喜欢的输入。