一场主场1比1的平局之后,舆情日报写着:正面34%,负面41%,中性25%。市场总监看完只问了一句:下周的球衣促销还做不做?日报答不上来:它知道情绪偏哪边,却不知道负面冲着谁、因为什么、出自哪群人、传到了哪一层。
三分法在电商评论里大体够用,放到体育讨论里经常失灵:球迷的表达高度依赖比分、立场和圈内默契。下面用五个样本说明它错在哪里,再给出一个更可用的标注结构。样本中的评论与比例均为模拟。
样本一:“建议给主帅发对方俱乐部的年终奖”——反讽让标签整个反转
评论里有“建议”“奖”这类偏正面的词,模型很可能判正面,懂行的人一眼看出这是在骂换人。
反讽是情绪分析里研究最多的难题之一。一篇2025年4月的arXiv预印本用5929条人工标注推文做实验:只在单一主题数据上训练的模型,对反讽推文的准确率约30%,用通用推文训练的约60%,加入对抗式数据增强后能到约85%;去掉反讽成分,情感判断准确率最多能提高21%[1]。
提醒很直接:只见过一类数据的模型在反讽面前最吃亏,而体育反讽偏偏依赖领域知识。“功臣”“稳如泰山”“教科书”这类词,在输球之后大多要反着读。模型要看的不只是这一句,还有比分、球员本场表现和下面的回复语气。
样本二:一串动物表情——绕过审核的辱骂,文本模型看不见
第二条评论只有球员名字缩写加一串动物表情,没有任何负面词,文本模型会判中性。
World Athletics基于四届大赛做的网暴研究发现,用表情符号绕过平台规则的辱骂明显增多,种族主义和性别歧视一直是最主要的辱骂类型[2]。表情符号本身没有极性,含义取决于发给了谁。这类内容在三分法里连“负面”都拿不到,更不会被识别为严重辱骂。
所以“严重程度”应该是和情绪平行的独立字段,而不是挂在负面标签下的一个小分类。
样本三:“常州0州”——字面在骂,实际在玩
按新华网转发的微博数据分析,2025年苏超开赛后约两个月,“常州0州”这个话题阅读量达到1.1亿,“没有假球,全是世仇”一类的说法也跟着流传开来[3]。按字面,这些表达带着很强的贬损和对立色彩;放回语境,它们是地方球迷的自嘲和互相调侃,是这项赛事传播力最强的部分。
一律判为负面,报告就会建议品牌回避,方向和真实的商业机会正好相反。反过来,也不能看到“世仇”就当玩笑,调侃一旦越过地域攻击的边界,性质就变了。这里需要的字段不是正负,而是“表达方式”:真诚、反讽、调侃、自嘲、攻击。
样本四:满屏好评——正面也可能是组织出来的
某运动员发了一条代言内容,评论区前一百条几乎都是整齐的夸赞,正面率接近满分。
中央网信办2025年4月通报,网信部门会同体育主管部门集中整治网上体育“饭圈”问题,处置对象包括“刷量控评”、不良导向的榜单等产品功能[4]。控评的实质,是用组织化的正面内容盖住真实评论。三分法眼里这是健康的舆情;对品牌来说,它恰恰说明讨论被少数组织化群体占据,普通消费者的声音被挤出了可见区域。
这里要补的是“人群”和“传播结构”:这些正面评论来自多少个独立账号,账号之间是否高度重合,发布时间是否异常集中。
样本五:负面逐年上涨——但也许不是你的问题
最后一个样本不是一条评论,而是一条趋势线:某俱乐部社区的负面占比三年来一路走高。
一篇分析Reddit英超板块2013—2022年110多万条评论的预印本发现,社区规模扩大之后,负面情绪和毒性言论都在上升,讨论还外溢到种族主义、疫情、政治冲突等社会议题[5]。也就是说,负面比例上升,可能有一部分来自社区结构本身的变化,而不是俱乐部或球员做错了什么。
没有原因字段,就分不清“球迷对新援不满”和“整个社区的说话方式变了”。
一条讨论至少要拆成五个字段
| 字段 | 回答的问题 | 取值示例 | 对应样本 |
|---|---|---|---|
| 情绪极性 | 大方向偏好还是偏坏 | 正、负、中、混合 | 保留,但降为参考项 |
| 表达方式 | 字面意思能不能直接读 | 真诚、反讽、调侃、自嘲、攻击 | 样本一、三 |
| 对象与原因 | 情绪指向谁、因为什么 | 球员表现、裁判、管理层、票价、赞助商 | 样本五 |
| 人群与来源 | 谁在说,是否组织化 | 核心球迷、泛体育用户、对方球迷、营销号、控评群体 | 样本四 |
| 严重程度与商业关联 | 要不要人处理,和生意有没有关系 | 需下架、需关注、与品牌相关、与品牌无关 | 样本二 |
回到开头那份日报。拆完字段之后,结论可能变成:负面主要来自核心球迷对一次换人的不满,表达方式以调侃为主,没有扩散,也不指向俱乐部的商业伙伴。那么球衣促销照做,只是文案别拿这场比赛做噱头。
同一句话,走到不同层级就是不同的事
一句“下课”在球迷群里可能只是赛后的气话,第二天就没人提;一旦被剪进短视频、冲上热门话题、被媒体引用,就变成了“球迷集体要求换帅”。情绪极性没变,商业含义完全不同,所以系统还要记录一条内容走到了哪一层。对体育社交媒体运营团队来说,这个字段决定了是在评论区回应一句,还是要准备正式声明。
多字段标注也会错,怎么验证
字段越多,出错的方式也越多。韦德体育在项目中通常这样做:
- 按场景报告准确率,而不是只报总数:赛前预热、输球之夜、转会窗口的反讽比例差别很大,一个总体准确率会掩盖最差的场景。
- 低置信度样本回流人工:模型对“表达方式”拿不准的内容进入人工标注队列,标注结果再用来补充领域语料。
- 圈内词表要带有效期:球迷黑话和梗更新很快,一个梗半年后意思可能反转,词表需要标注生效时间并定期清理。
- 严重辱骂不抽样:涉及种族、性别和人身威胁的内容逐条人工看。
一次输球后,系统把约2000条评论判为负面。抽样200条人工复核,其中约三成是调侃或自嘲,真正针对球员个人的攻击不到一成,其余是对战术和换人的正常批评。如果把“负面2000条”直接写进报告,问题的严重程度会被放大两到三倍。
仍有AI很难处理的边界:方言和谐音梗、还没被标注过的新梗、同一句话在两个球迷群体里意思相反。遇到这些,模型应主动标“不确定”,交给熟悉圈子的人判断。
三分法可以留着,但不能单独拿去做决定
正面、负面、中性作为总览指标仍然有用,它能很快告诉你今天的讨论大致偏向哪边。但凡要据此做商业动作,比如借势、回避、续约、发声明,都得回到表达方式、对象原因、人群来源、传播层级和商业关联这些字段上。韦德体育的舆情分析看板把情绪极性放在最后一列,就是想让使用者先问“为什么”,再看“好不好”。
参考资料
- arXiv:《On the Impact of Language Nuances on Sentiment Analysis with Large Language Models: Paraphrasing, Sarcasm, and Emojis》,2025年4月8日。https://arxiv.org/abs/2504.05603
- World Athletics官网:《World Athletics publishes ground-breaking four-year analysis into online abuse》,2024年12月18日。https://worldathletics.org/news/press-releases/four-year-analysis-online-abuse-athletics
- 新华网:《171个热搜29亿阅读量:数据解码热搜中的“苏超”足迹》,2025年7月14日。http://www.news.cn/local/20250714/33f880030c4147ac9a30a30539c45a14/c.html
- 中央网信办官网:《有关部门严厉打击网上体育“饭圈”问题》,2025年4月2日。https://www.cac.gov.cn/2025-04/02/c_1745298042333612.htm
- arXiv:《Are Online Sports Fan Communities Becoming More Offensive? A Quantitative Review of Topics, Trends, and Toxicity of r/PremierLeague》,2025年10月30日。https://arxiv.org/abs/2510.27003