赛事 中超 · 亚冠 · 国家队

K1体育 球迷数据实验室

进度 第 28 轮

栏目 02 · 站点自述与研究方法

把越位和出场时间,摆进一份能被复核的赛季档案

K1体育从 2019 赛季的一份越位记录起步,如今把中超、亚冠与国家队三线的技术统计整理成统一口径的球员档案。这一页交代这份档案由谁整理、按什么规则折算,以及每一条对外发布的数字走过了哪些步骤。

3,180

球员档案累计

1,240

其中中国球员

3,860

覆盖比赛记录

01

为什么先看越位,再看出场时间

越位是一次被判罚中断的进攻,出场时间是教练交出来的分钟数。两者都能逐场追溯,不靠主观打分。

栏目是从越位次数长出来的。进球和助攻早已有无数张榜单,越位却常常只出现在赛后技术统计的角落里,既没有人做过跨赛季的口径统一,也很少有人把它和球员的位置、出场时长放在一起看。我们把它单独拎出来作为第一条主线,是因为它足够干净:每一次越位都由比赛记录判定,不涉及二次解读。

出场时间是第二条主线,也是让第一条主线成立的前提。一名球员每场只踢二十分钟,他的越位次数和一名踢满全场的球员放在同一张表里比较,结论会直接失真。所以我们在 2021 赛季引入了每 90 分钟折算,把不同出场时长的球员拉回同一条基准线上。

第三年,我们把目光从球员挪到球迷组织。客场远征的样本此前散落在各家组织的记录里,既没有统一的比赛清单,也没有固定的统计区间。建立客场胜率样本库,本质上是给这些零散记录一个可横向比较的框架。

这三件事叠加起来,构成了站点现在的位置:它不生产观点,只把可以复核的字段整理成人能读下去的顺序。所有对外发布的指标都标注样本门槛与折算方式,任何一条结论都能回到具体比赛去核对。

深夜编辑室桌面,笔记本屏幕、战术板与打印统计表,画面中只出现操作者的手部
赛季内的工作台:右侧是当轮出场时间表,左侧是待复核的越位记录。

02

四次版本调整,各解决一个问题

版本号对应的是口径的变化,不是界面的改版。每一次调整都留下可查的说明。

  1. v1.0

    2019 赛季 · 档案库

    先让同一个球员在两份来源里对上号

    起步阶段只做一件事:把分散的比赛记录整理成同一张球员表。此前同一个球员在不同来源中的出场场次可能相差两三场,原因是替补登场与补时阶段的认定不一致。档案库确定了统一的收录规则,此后新增的字段都沿用这套基础身份。

  2. v2.0

    2021 赛季 · 每 90 分钟折算

    让替补和主力站在同一条线上

    按累计值排序时,出场时间长的球员天然占优。引入每 90 分钟折算后,抢断、越位这类事件型指标改为按出场时长等比换算,替补球员的效率第一次可以被直接比较。折算规则同时确定了最小样本门槛,避免单场数据放大成结论。

  3. v3.0

    2023 赛季 · 客场胜率样本库

    把远征记录从各家手里收拢到同一张表

    球迷组织此前各自记录客场行程与结果,区间、口径、胜负认定方式都不一样。样本库规定了统一的登记字段与统计区间,登记组织可以按赛季回看自己与同类组织的客场表现。这一版也第一次把看台数据和技术统计放在同一个仓库里管理。

  4. v4.0

    当前版本 · 时间轴视图与薪资结构拆解

    从赛季汇总走向周内走势与结构占比

    汇总表能回答谁排在前面,回答不了走势怎么变化。这一版把出场时间按轮次铺成时间轴,可以看到伤停、停赛与轮换造成的断点;薪资结构则按俱乐部逐队拆开,只呈现区间与占比,不涉及个人合同。看结构而不是看总数,是这一版的基本出发点。

03

三支团队,一条发布口径

内容与研究、数据工程、球迷运营各自负责一段流程,最终由同一套口径对外发布。

对外发布口径

两名校对确认后方可发布

内容与研究

12

定义口径与写法

负责榜单结构设计、赛季复盘写作与口径文档维护。这一组可以调整指标的呈现方式,但不能直接修改采集得到的原始数值。

数据工程

9

把口径写成可执行的规则

维护采集管道、折算脚本与字段校验。任何口径变动都要先在这一层落成可重复运行的规则,再回到内容组确认结果含义没有偏移。

球迷运营

6

连接看台与数据

负责球迷组织登记、客场样本回访与纠错工单分流。来自看台的疑问大部分先经过这一组,能当场说明的说明,需要改数据的转入校对流程。

40 余名

外部校对志愿者以赛季为单位参与工作,主要承担比分与出场时间的交叉比对,以及新赛季开赛前的基础字段核对。志愿者不接触未发布的薪资结构数据,只处理公开可查的比赛记录。

蜀锦纹样与数据网格叠合的抽象纹理,无文字
站点在视觉上把蜀地纹样与数据网格叠在一起,提醒读者这份档案的来处。

04

一条数据要走完五步

采集、折算、交叉验证、复核、发布。顺序固定,任何一步发现问题都退回上一步。

  1. 01

    采集

    按轮次抓取比赛记录,先落原始值,不做任何换算。同一场比赛至少保留一份备份来源。

  2. 02

    折算

    按既定口径换算成每 90 分钟数值,并同步写入出场时长,保证任何结论都能反推回去。

  3. 03

    交叉验证

    用不同来源比对同一名球员的出场与事件记录,差异超过阈值时标记为待查,不直接入库。

  4. 04

    复核

    由内容组与数据工程双方各确认一次,涉及榜单名次的条目额外核对样本门槛。

  5. 05

    发布

    附带口径角标一并上线,标注折算方式与样本要求,方便读者自行判断适用场景。

样本门槛定在单赛季出场不少于 540 分钟,对应约六场完整比赛。门槛不是随手取的整数:低于这个时长,每 90 分钟折算会把单场的高光或失常放大成整季结论,一名出场一百多分钟的球员只要有一次抢断高峰,就能排进前列。这类结果在统计上站不住,读起来也容易误导。

门槛之上仍有分层。跨越门槛但在 900 分钟以下的球员,我们会标注为小样本,提示其折算值的置信度低于主力球员。榜单默认只展示达到门槛的条目,被过滤掉的部分不会以任何形式出现在排名中。

05

什么时候能看到新数字

三条固定节奏加一条临时调整说明,节奏写在页面上,读者可以据此安排查看时间。

更新节奏与对应口径
时间窗 更新内容 口径说明
赛后 90 分钟 当轮技术统计 抢断、越位、出场时间为原始值,尚未折算。
48 小时 各类榜单 完成交叉验证后按每 90 分钟折算,并套用 540 分钟门槛。
每周一 越位与出场时间周报 按轮次汇总走势,标注伤停与停赛造成的出场断点。
国际比赛日 国家队窗口期口径调整 窗口期内联赛暂停,折算基数改为窗口期出场时长,单独成表不并入联赛榜单。

06

和谁一起把样本做厚

协作不涉及授权与认证,只是在同一套字段规则下交换可核对的数据。

06-1

球迷组织

登记组织可按赛季回传客场行程与观赛记录,字段与统计区间由站点统一规定。目前登记 186 家,覆盖 27 座城市,累计客场样本 2,160 场。回传数据仅用于客场胜率样本库的汇总,不用于任何形式的商业分发。

06-2

校园球队

面向高校与中学球队提供口径文档,方便教练按同一套折算方式记录本方球员的出场与事件数据。我们不参与球队内部训练安排,也不对比赛结果作任何评价。

06-3

地方数据交流活动

参与以统计方法为主题的公开交流,分享折算规则与校对流程的实际问题。交流中只讨论方法与字段定义,不涉及任何具名人员或机构的评价。

客场看台的灯光与远景剪影,是这份档案最初的问题来源。
看台远景与球场灯光的宽幅视角,人物为远景剪影

发现数字不对,怎么告诉我们

纠错只需要三样东西:页面名称、有疑问的具体字段、你认为正确的取值。描述清楚这三项,复核速度会快很多。我们不会因为一处错误就整体下架榜单,但会先把对应条目标记为待查,再走一遍交叉验证流程。

  1. 记录页面名称与你看到的数值。
  2. 写明你依据的比赛或来源,方便比对。
  3. 发送到客服邮箱,等待复核结果。