C题题目:Data With The Stars

2026美赛C题保姆级教程思路分析

C题整体表现的与之前不是特别一致,但是提供给了数据,依然属于相对比较好上手的题目,获奖需要一些小技巧(认真读题,把握出题人思路及注意事项)。整体上,属于逆向推断、赛制评估和优化设计的综合题目,其核心在于“用观测到的淘汰结果去反推隐藏投票,再用反推结果做赛制因果/公平性分析与制度设计”。

1 总体分析

1.1 问题设定与要求

以美国真人秀节目《Dancing with the Stars》(DWTS)为背景。DWTS 是英国节目“Strictly Come Dancing”的美国版本,属于国际同系列节目的一部分;美国版截至目前已播出34季。

节目机制大致是:每一季由多位名人选手分别与一位职业舞者配对,每周完成舞蹈表演;由评委团对每对选手进行技术评分,同时观众通过电话或网络为“希望留下的选手”投票(投票次数每周有上限,且观众是“保留投票”而非“淘汰投票”)。评委分与粉丝投票会被合成为一个“综合结果”,通常每周淘汰综合得分最低的组合;进入决赛的若干组选手再依据决赛周的综合结果排出冠亚季军等名次。

题目强调:评委分与粉丝票如何合成并非固定不变,且不同合成方式会引发争议与规则调整。DWTS早期(前两季)采用“按名次(rank)合成”的方式;但第二季出现争议(例如某名人评委分长期偏低却仍能走到很后面),节目在后续改用“按比例(percent)合成”的方式(附录给了两种方式的示例)。

此外,第27季再次出现争议(例如Bobby Bones 在评委分并不占优的情况下最终夺冠),节目据此在约第28季附近做了两项调整:

1)先用“评委分+粉丝票”的综合结果确定bottom two,再由评委在直播中投票决定淘汰其中一对;2)同时节目方又“可能”回到按名次(rank)合成的方法(题面说明具体从哪一季开始不完全确定,但合理假设为第28季)。

从“评价本质”上,题面指出:评委分旨在衡量舞蹈的技术水平(但仍存在主观性);粉丝投票更主观,除舞蹈质量外还会受到名人本身的人气、魅力等影响;而节目制作方可能在一定程度上也“乐见”评委与粉丝偏好冲突,因为这种冲突会提升讨论度与观众兴趣。

最后,题目提供了跨 1–34季的选手信息与每周评委打分数据,并说明:粉丝投票数是未知且被严格保密的,参赛队伍数、赛季周数、评委人数也会随季/周变化(因此数据中会出现 N/A、淘汰后为0分等记录规则)

具体的问题要求:

(1)反推/估计粉丝票数(核心任务

  • 建立模型,为“每位选手在其参赛的每一周”生成估计粉丝票数(真实值保密)。
  • 检查:你估计出来的粉丝票数,配合裁判分数后,能否复现每周谁被淘汰;并给出“复现一致性”的度量。
  • 给出:你估计的票数有多大不确定性/置信度?且这种不确定性是否因“选手/周次”而不同?
    (2)用估计票数去比较两种官方规则:按名次(rank)/按比例(percent)
  • 把两种规则都应用到每一季(跨季对比),看结果差异,并讨论是否某种规则更“偏向粉丝票”。
  • 针对“争议选手/赛季”做案例复盘(如 Jerry Rice、Billy Ray Cyrus、Bristol Palin、Bobby Bones),分析换一种合成规则是否会改变结局。
  • 还要讨论从约第28季开始的“bottom two 后由评委救人/淘汰”机制(题面认为合理假设是第28季左右),看它会怎样影响结果。
    (3)分析“职业舞者(pro dancer)”与名人特征(年龄、行业等)对成绩的影响
  • 用数据(含你估计的粉丝票)建模:职业舞者、名人特征等对“走多远/名次”的影响有多大?
  • 并比较这些因素对裁判分与粉丝票的作用是否一致。
    (4)提出一个你认为更公平/更好看的新赛制
  • 设计新的“裁判分+粉丝票”合成与淘汰规则,并论证为何更公平或更能提升节目效果。

1.3 核心要点:

(1)数据处理。

  • 数据里有 N/A(无第4裁判、或该季没那么多周)以及“淘汰后记为0分”的结构性规则,必须先统一处理,否则淘汰周识别会错。
  • 还要处理“有的周不淘汰、有的周淘汰>1人”的情况。

(2)把“票数反推”当成一个带约束的隐变量问题

题面在附录已经提醒:能产生同样淘汰结果的票数组合有很多组(逆问题多解)。

因此,模型必须能够回答两件事:

  • 怎么在多解里选“最合理的一解”(靠先验假设/正则化/概率模型)
  • 怎么给不确定性(不是“算出来了就完了”,而是“在满足淘汰结果的所有票数组合里,这组解有多稳/区间有多宽”)

(3)评价指标“可解释+可对比”

至少准备三类指标:

  • 一致性:你的估计票数在每周是否能复现淘汰者(命中率、log-likelihood、淘汰边际差等)。
  • 不确定性:每个(选手,周)票数的区间宽度/后验方差,并解释为什么有的周更不确定。
  • 公平性/偏向性:例如“裁判技术优势被粉丝票逆转的概率”“低裁判分但高票导致的晋级比例”等(你自定义,但要和题目关切一致:是否更偏粉丝)

1.4建模思路:

一个主模型 + 两个辅助模块的结构:

主模型:隐变量粉丝票推断(跨季统一)

  • 输入:每周裁判总分、当周存活选手集合、实际淘汰结果。
  • 输出:每周每位选手的估计粉丝票Vi,t(或票占比)、以及不确定性。

模型的实现有多种不同的方法,此处推荐:贝叶斯/概率排序模型(主要是考虑到不确定性)

  • 设Vi,t服从对数正态/Dirichlet占比,随周次平滑演化
  • “淘汰事件”不是硬约束,而是:合成分越低,被淘汰概率越大(softmax / logistic)
  • 用最大后验/后验采样得到点估计 + 可信区间,并天然给出“哪些周更不确定”

1.5 获奖关键:

(1)承认并解决“多解性”:别装作票数唯一;要把“不确定性来源”讲透,并用指标呈现。

(2)规则变更不确定性要做敏感性分析:题面说变更季不确定但可假设28;可以对“27/28/29开始变更”分别跑一遍,结论更稳。

(3)面向制作方的解释力:不仅给数学结果,还要说“为什么会出现Jerry Rice/Bobby Bones式结果、什么机制导致”。题面明确这些争议背景。

(4)可复现的流程图 + 清晰指标体系+美观表达:MCM非常看重表达结构

2 问题分析与解题思路

2.1 问题一思路

问题一的本质:构造Vi,t使得与裁判分合成后,能解释“每周谁被淘汰”,并量化不确定性。

(1)从原始数据恢复“每季每周的存活集合”和“淘汰者”

(2)构造“裁判表现”指标Ji,t

(3)把官方两种合成规则写成数学形式(这是后面所有约束的基础)

(4)建立“淘汰约束”——把观测结果变成数学信息

(5)解决“多解性”——选一个合理的票数解

(6)给出一致性与不确定性

建议大家使用matlab/ python进行求解。今晚将会更新具体的解体代码和结果图表,大家敬请期待。

2-4问后续更新

其中更详细的思路、各题目思路、代码、讲解视频、成品论文及其他相关内容,可以点击下方名片获取!

Logo

智能硬件社区聚焦AI智能硬件技术生态,汇聚嵌入式AI、物联网硬件开发者,打造交流分享平台,同步全国赛事资讯、开展 OPC 核心人才招募,助力技术落地与开发者成长。

更多推荐