投标文件 · 技术与商务方案

高校毕业论文 AIGC 检测系统建设项目

我们承诺的不是更高的精度,
是一个能被审计复算的误报率

招标编号
ZBJY-2026-AIGC-002
采购人
教育局装备司
投标人
本公司
版本 / 日期
V1.0 · 2026 年 9 月

168 格误报率分层标定表的实际形状
12 学科 × 7 文体 × 2 语言,逐格给 95% 置信上界

1,889.2万元 · 三年打包含税总价
0.79元 · 折合单次检测全成本
168格误报率标定(学科 × 文体 × 语言)
≤1%误报率,逐格满足 95% 置信上界

所有数量都能用招标《三年总价报价口径与明细表》里的固定单价当场复算。 报价里最脆弱的那个假设写在第 7 章表 6 第一行,没有藏。

目录与全文 ↓

目录

13 节排在一页里,不折叠、不隐藏。标「必备」的 8 节,就是招标要求的 8 块方案内容。

00速览与评分对照结论、价格结构,还有我们自己说破的弱点。五分钟看完这一节,够判断要不要往下读。01第 1 章 执行摘要一页。承诺什么、多少钱、哪一条假设最脆弱。必备 ①02第 2 章 我们对这个项目的理解,以及为什么选这条路线难的不是判对,是判错的代价由谁承担。03第 3 章 技术方案3.1 到 3.13。从语义片段切分一直写到 168 格标定,每项都给测量方法和失效边界。必备 ②04第 4 章 创新点三项创新都算进了报价,不留作愿景。后面还附了刻意没做的三件事。必备 ③05第 5 章 实施计划(30 个自然日,分阶段到天)30 天排到每一天。开头先列三项交付前提,签约前就能核验;任一项不成立,30 天的承诺也不成立。必备 ④06第 6 章 团队配置38 人,4,008 人天。逐组负载率都公开,包括已经超过 100% 的那一组。必备 ⑤07预算报价明细表(表1—表6)四类成本,加 5.5% 风险预留和 5% 利润。每一行都能用招标给的固定单价当场算回去。必备 ⑥08第 8 章 预期效果误报率、漏报率、对抗鲁棒性、检测速度、可解释性,五项逐个给定义、测法、承诺值。末节写我们做不到的部分。必备 ⑦09第 9 章 风险分析10 条,按发生概率排。每条写清由谁承担成本,最后把核心统计假设一路推到失效。必备 ⑧10第 10 章 额外探索与创新三条路不计入交付承诺。另有两条评估后部分采纳,不加价。A附录 A 检测报告样例页一份完整的报告成品。招标第 2.3.3 条列的六个不合格做法,逐条对着看。12第 12 章 需求追溯矩阵104 条硬要求逐条落到章节句段。覆盖率 100%,没有「部分满足」这类措辞。

速览与评分对照

结论、价格结构,还有我们自己说破的弱点。五分钟看完这一节,够判断要不要往下读。

如果你只看一分钟

市面上每款检测系统都说自己误报率低于 1%,但没有一个数字能被复算。我们交付的不是更高的精度,是一张能被逐格复算的误报率标定表——168 格,每格给样本量和置信区间。

价格

1,889.2 万元(三年含税)。三年 2,400 万次检测,折合单次 0.79 元。每一行都能用招标《三年总价报价口径与明细表》给定的固定单价当场算回去。

我们主动说破的东西

报价里最脆弱的一个假设、对抗改写时我们做得到什么做不到什么、168 格里哪几格样本不够,全部写在明处(表 6、8.3、8.6)。

一个数字,说明这个行业现在的真实状态

7 款主流检测器 · 91 篇非英语母语者撰写的人类作文61.3%被误判为 AI 生成
同一批工具 · 88 篇英语母语八年级学生作文≈0%误报

来源:Liang et al. 2023,发表于 Patterns(Cell Press)。91 篇中有 18 篇被全部 7 款工具一致误判
根因不是模型不够大:Turnitin 首席产品官承认,工具实际学到的是「更复杂的写作更可能出自人手」。
所以判定阈值不能定在特征层,必须在篇级误报率上反向标定,而且要按学科、语言、文体逐格标一遍。这是本方案的技术主线。

三件可以当场核验的事

误报率分层标定168 格
改写痕迹检出率≥85%
纯 AI 召回≥90%
人工写作误报率≤1%

核验方式:任取标定表中的一格,用自备样本复算该格误报率;用市面「降AI」服务处理任意样本后送检,看能否标出;同篇三次检测偏差是否 ≤5%(已写入违约条款)。

钱花在哪

D 三年运维 5 人660.0 万
A 硬件(全租赁)621.0 万
B 软件数据第三方287.1 万
C 前期开发 33 人141.6 万
R 风险预留(取 5.5%,下限为 5%)94.0 万
M 利润(取 5%,行业常见 8—12%)85.5 万

三年打包含税总价 18,892,295 元。运维与硬件各占三分之一以上,整个 30 天开发团队只占不到 8%。这是一个三年运营项目,不是一个开发项目,报价结构必须反映这一点。利润取 C₀ 的 5%(低于行业常见的 8—12%,让利让在利润上、不让在成本与性能承诺上);风险预留取 5.5% 而不是下限 5%,多出的 85,485 元是给评审复算口径差异留的缓冲。两个比率的理由与代价(含定稿前把 M 从 0 改为 5%、总价升 4.7% 的取舍)见 7.7 节末。

招标必备要件 → 本文位置

下表前 8 行是方案书必备的 8 块内容(执行摘要、技术方案、创新点、实施计划、团队配置、预算报价、预期效果、风险分析),全部齐备;第 9 行起是超出必备范围、由招标文件正文逐条要求的其余要件,同样逐条给出位置。

招标要求 本文位置 关键内容
执行摘要(一页内) 第 1 章 结论、价格、主动披露的最大不确定性
技术方案 第 3 章(3.1—3.10) 架构、语义片段、双模型校验、168 格标定、分文体校准、改写痕迹、数据治理、接口、弹性、报告规范、安全
创新点 第 4 章 三项全部计入报价;另含「刻意没做的三件事」
实施计划(30 天分阶段到天) 第 5 章 5.0 三项签约前可验的交付前提(判别底座许可 / 解析引擎私有化许可 / 计算卡算力与弹性可得,任一不成立则 30 天承诺不成立)+五阶段逐日表,里程碑对齐 D+3 / D+12 / D+18 / D+22 / D+27 / D+30
团队配置 第 6 章 开发 33 人 708 人天(+R 支付 6 人 108 人天,峰值 39 人)、运维 5 人 3,300 人天 = 5.0 FTE、逐组负载率(算法组 166%)、支持工单模型(98%)、全年值班小时核对
预算报价(明细到万元) 第 7 章 表 1—表 6 全部填齐,无空项;A 硬件 / B 软件数据 / C 开发人工 / D 三年运维 四类成本 + 风险预留 5.5% + 利润 5%,每行可用招标固定单价复算
预期效果(误报率/漏报率/对抗鲁棒性/检测速度/可解释性) 第 8 章(8.1—8.5) 五项逐项给定义、测量方法、承诺值;8.6 列出做不到的部分
风险分析 第 9 章 10 条按发生概率排序,每条写明由谁承担成本;9.10 把本方案核心统计假设一路推到失效,分两重给出失效阈值(维度间 ρ̄=0.20、片段间 φ=0.0008)与修正方案,并写明这一节在第三轮自查中被整体重写的原因;9.11 给出风险预留 R 的占用台账(940,340 元中已定向占用 233,600 元,剩余可支配 706,740 元)与唯一一项 R 兜不住的风险
额外探索与创新 第 10 章 10.1—10.3 三项标注「本次不实施、不计入交付承诺」,未占用费用;10.4、10.5 为评估后部分采纳的两条路径,采纳部分不加价,各自补上了原稿的一处实质缺口
报告四个强制模块(总体评估/片段级分析/特征分析/人工复核指引) 3.9、附录 A 三层数据(波及范围/段落密度/片段偏离)并列呈现,含内容构成块与教师核实三法
六类对抗手段与鲁棒性测试集 3.5、8.3 逐条给抵抗率;2,400 篇变体 + 1,200 篇人类原稿阴性对照
面向未来的鲁棒性(更新周期/抗逆向/算法自身偏差) 3.13 5+3+15 工作日标定流程、阈值不外露、AI 使用处的三类偏差与控制
教育价值(人机协作/正向引导/不增加学生负担) 3.11 无自动化处罚建议(模板层硬编码)、四级固定提示语、AI 使用边界由学校自定义、学生免费且自查不限次
基准数据集与标注偏差 3.12、10.4 来源授权、12 学科、单格 n≥300 的统计依据、双人盲标 + κ≥0.75、非母语英文子集专项复核;人类侧训练语料限定 2021-06-30 前公开发表(见 10.4)
第三方组件与开源许可 3.12 不使用 AGPL/SSPL;组件清单 D+3 提交并随版本刷新
算法透明度与申诉追溯 3.12、3.10 3 年过程记录、凭编号可重放复算、向独立专家委员会直接提交
检测报告样例 附录 A 完整报告样式 + 逐条对应招标第 2.3.3 条六个不合格做法
资格与承诺 6.3 不联合体、不双重经营、不植入降AI服务、算法可审计
需求逐条追溯 第 12 章 104 条招标硬要求 → 章 + 小节的对照表,由 gen_traceability.py 从反扫器清单自动生成,不手写
报价有效性 表 1 Q ÷ C₀ = 1.1050 ≥ 1.05,比第 4.2 条硬门槛(17,951,955 元)高出 940,340 元

检测报告长什么样(完整版见附录 A)

AIGC 内容检测报告 · RPT-2027-0413-0000871引擎 E-1.4.2 / 基线 B-2027.03 / 阈值表 T-2027.03-r2
L1
波及范围 2% — 5%(24 段 / 748 段)· 最高段落密度 28% · 最大偏离 2.9σ绝对字数 620 字 / 可分析内容 20,662 字 · 置信度 L1 0.71波及范围不是「AI 生成文字的比例」,不构成对 AI 参与程度的估计。
  1. 总体评估(等级/波及范围/密度/偏离/置信度/内容构成)
  2. 片段级分析(章节分布 + 逐段密度条)
  3. 特征分析与证据链(八维观测值对基线值、逐段 z 值)
  4. 人工复核指引(排序依据 + 引导性提问)
  5. 古文引用与不可分析内容说明
  6. 改写痕迹(独立信息,不并入分级)
  7. 方法与版本说明、一致性自查指纹

不给单一百分比、不给两位小数式虚假精确、不出现任何大模型产品名、每处判定都写出原因、跨环境格式完全一致。招标第 2.3.3 条列出的六个不合格做法逐条对应见附录 A 末表。

第 1 章 执行摘要

一页。承诺什么、多少钱、哪一条假设最脆弱。

招标必备内容 ①

投标人:本公司 · 高校毕业论文 AIGC 检测系统 · 三年打包含税总价 18,892,295 元

我们承诺的不是更高的精度,是一个能被审计复算的误报率

市面上每一款在售检测系统都宣称「准确率 98%」或「误报率低于 1%」。这些数字全部来自厂商自测,而几乎每一次独立测量都得出高得多的结果:同一份 TOEFL 人类作文基准,GPTZero 官方称误报 ≤1%,2024 年独立复测为 7.7%;Turnitin 官方称文档级 <1%,第三方读数在句子级约 4%。更关键的是,在中文学术论文上,至今不存在任何经第三方复核的误报率实测数据

所以本方案不比拼「谁的准确率更高」这个无法被验证的维度。我们交付的是三样可以当场核验的东西:

我们交付 可核验方式
分层误报率标定表:12 个学科门类 × 7 类文体 × 中英双语,逐格独立标定判定阈值,每格给出留出集样本量与 95% 置信区间 招标方可抽取任意一格,用自备样本复算该格误报率
改写痕迹检测:识别经第三方「降AI」服务处理过的文本 用市面降AI服务处理任意样本后送检,看能否标出
结果一致性写入违约责任:同篇 24 小时内三次检测各维度偏差 ≤5%,不同部署实例结果一致,全文检测与分章节合并偏差 ≤5% 任意时点抽检,超限即触发违约条款

为什么行业至今没做到

2023 年发表于 Patterns(Cell Press)的研究用 7 款主流检测器测试 91 篇非英语母语者撰写的人类作文,平均误报率 61.3%;同一批工具测试 88 篇美国母语八年级学生作文,误报率接近零。91 篇中有 18 篇被全部 7 款工具一致误判为 AI 生成。

根因不是模型不够大。Turnitin 首席产品官承认,工具实际学到的规律是「更复杂的写作更可能出自人手」,这纯粹来自训练数据的分布模式。这一条同时解释了三个现象:非母语写作被系统性误判、文献综述与研究方法章节误报率最高、以及把论文改得更差反而更容易通过检测

结论很直接:判定阈值不能定在特征层,必须在篇级误报率上反向标定,而且要按学科、语言、文体逐格标定一遍。这是本方案的技术主线。

价格

三年 24,000,000 次检测,总价 18,892,295 元,折合单次全成本 0.79 元

作为对照,公开渠道的单篇检测价格为维普约 20 元/篇、知网与万方约 2 元/千字符(20,000 字约 40 元/篇)。按这一口径,本项目每年 800 万次检测对应的公开市场价约 1.6 亿至 3.2 亿元/年。(该对照取自公开推广价格,非集中采购价,仅说明量级差异。)

报价构成:硬件与基础设施全部租赁 621.0 万元,软件数据与第三方 287.1 万元,前期开发 141.6 万元(33 人 / 708 人天,另有 6 人 108 人天由风险预留支付,见 6.1),三年运维 660.0 万元(5 人 / 3,300 人天),直接成本 1,709.7 万元,风险预留取 5.5% 计 94.0 万元(招标规定的下限是 5%),利润取 C₀ 的 5% 计 85.5 万元(低于系统集成行业常见的 8—12%,是主动让出的价格空间;定稿前一版把利润写成 0、总价 1,803.7 万元,改动理由与代价写在 7.7 节末)。Q ÷ C₀ = 1.1050,比第 4.2 条有效性硬门槛高出 940,340 元。每一行都可用《三年总价报价口径与明细表》给定的固定单价当场复算。

我们主动披露的最大不确定性

全份报价中最脆弱的一个数字是 AI 计算服务器的台数。它建立在「单张 48GB 计算卡对 1.5B 级判别模型的批量前向吞吐为 25,000 token/秒」这个假设之上,我们未做真实压测。若实际吞吐只有假设的一半,H2 需从 14 台增至 26 台,A 项将增加约 350 万元。完整推导写在表 6 第一行,我们选择明示而不是把它藏进一个看起来精确的总价里。

三条资格承诺

不组联合体;不经营「检测+降重」双重业务,不在本系统内植入任何形式的「降AI率」付费服务;算法核心逻辑向招标方指定的第三方审计机构开放。

第 2 章 我们对这个项目的理解,以及为什么选这条路线

难的不是判对,是判错的代价由谁承担。

2.1 招标方真正的风险不是漏检,是误判

漏检一篇 AI 代写论文,后果是一个学位有瑕疵。误判一篇人类原创论文,后果是一个学生被推上举证责任的位置——而 AIGC 检测结果在学术上无法自证,学生无法证明自己没用 AI。500 所高校 × 每年 200 万篇论文的规模下,1% 与 3% 的误报率差别是每年 2 万人与 6 万人。

所以本方案把误报率当作唯一的第一约束,其余指标全部在满足误报率上限的前提下优化。招标文件第 2.1.1 条把「人工写作误报率 ≤1%」与「纯 AI 召回 ≥90%」并列,并在违约条款中只为误报率设置了单方解约门槛(连续两个月 >1.5%),我们理解这与上述判断一致。

2.2 四个我们在准备阶段核实过的行业事实

第一,「误报率 <1%」已经是行业标准话术,不是一项指标。 Turnitin 宣称 98% 准确率、文档级误报 <1%,独立读数在句子级约 4%、短文本约 2.4%;GPTZero 自称 99% 准确、误报 ≤1%,2024 年一项独立研究在同一 TOEFL 基准上复测得 7.7%;Copyleaks 称约 0.2%,未见任何独立复核。评审方无法从这些数字中区分供应商,因为没有一个是可复算的。

第二,不同系统之间的结果根本不可比。 同一份稿件在三家系统的检出率分别为知网 62.7%、维普 9.57%、万方 5.4%;另一份 8,000 字稿件为维普 58%、知网 52%、万方 45%——两组样本中三家的排序甚至相反,说明差异本身都不稳定。(该两组数据来自公开渠道的第三方测评文章,非官方披露,我方仅用于说明现象存在,不作为任何技术指标的依据。)这意味着一所高校换一次供应商,同一批学生的判定结果就会整体位移。

第三,「降AI」服务产业已经完成了定价与结果兜底,而检测方还停留在承诺统计指标。 公开渠道可见的报价为 4.8 元起、声称达标率 99.26%、支持 9 个检测平台含 Turnitin、未降到 20% 以下退款;另一家为 8 元每千字、承诺知网检出率 >15% 全额退款并补偿检测费、7 天内不限次重做。一个公开案例是 2.9 万字论文在知网检出 66.4%,人工修改到 51% 后卡住,交由工具深度处理后降至 6.9%。

第四,规避产业教学生模仿的,恰好就是检测器误报率最高的那种人。 公开流传的「降AI」提示词是这样写的:「我希望文本略有点生涩和稚嫩,用那种中文并不是很精通的人的语气撰写……打破统一化的句式结构,避免过于完美的分类和罗列,减少机械化的递进关系词」。这段话值得逐字读一遍,因为它同时揭示了两件事:

也就是说,「降AI」提示词和「误报率过高」不是两个问题,而是同一个漏洞的两面:只要判据是「像不像人写的平均水平」,那么把自己写得不像平均水平的人(真实的非母语者、文风朴素的学生)就会被误判,而故意把自己写得不像平均水平的 AI 就能逃掉。本方案第 3.3 条的分层标定与第 3.5 条的改写痕迹检测,就是分别针对这个漏洞的两面:前者不再拿一条全局阈值去套所有人,后者不再只看「像不像 AI」而是看「有没有被改过」。

第三条与第四条合起来是整个格局里最关键的一点:检测方承诺的是统计指标,规避方承诺的是可验收结果。 后者更像一份商业合同,这就是为什么规避产业的商业化程度反而高于检测产业。招标文件第 1.3 条第 5、7 项明确排除「检测+降重」双重经营企业、并要求承诺不植入「降AI率」付费服务,正是针对这个局面。

2.3 高校侧目前没有统一口径,这是本项目的空位

我方核实的一批公开通知(539 条,覆盖 28 个省市,其中本科 321 条、大专 146 条)中,121 条给出了明确数值的本科通知里,AIGC 红线取 40% 的有 52 条、30% 的有 46 条、50% 的有 8 条、20% 的有 9 条;指定系统提及维普 26 次、知网 12 次、格子达 6 次。(该统计来自公开渠道汇总文章,我方未能取得原始通知全文,仅用于说明分散程度。)

学校在通知里指定的是供应商名字,不是技术要求。 没有一所学校写明「误报率不得高于多少」「阈值依据什么标定」。这说明采购方目前没有可用的技术评判语言。这正是本项目要建立的东西,也是本方案把「可复算」而不是「更精确」作为主卖点的原因。

2.4 我们明确不押的方向

不押单点精度。 有一款检测器(Pangram)在上述 TOEFL 基准上报告 0.00% 误报率,数字比所有人都好。但它的发布时间晚于该基准公开,存在对公开基准过拟合的可能,而我们无法排除。任何在公开基准上刷出的单点精度都可以被下一个基准推翻,它不构成护城河,我们不把三年合同押在上面。

不押「更大的模型」。 招标要求 10,000 篇同时提交、每篇 180 秒内出完整报告。在这个约束下,模型规模每翻一倍,AI 计算服务器台数近似翻倍,费用直接进入 A 项。本方案采用 1.5B 级判别模型双模型交叉校验,把算力预算花在「分层标定」和「留出集」上,而不是花在参数量上。

不押检测精度之外的功能堆砌。 招标评审会核对技术与预算进度是否一致。任何我们承诺实施的功能都进了报价表;仅供未来考虑的两项设想集中放在第 10 章并明确标注「本次不实施、不计入交付承诺」。

第 3 章 技术方案

3.1 到 3.13。从语义片段切分一直写到 168 格标定,每项都给测量方法和失效边界。

招标必备内容 ②

3.1 总体架构与部署形态

采用混合云 + 两地三中心,核心检测引擎与全部论文正文处理在采购人(教育局装备司,下称装备司)数据中心私有化部署,数据不出域。

中心 位置与形态 承载 资源
主中心 装备司数据中心,私有化部署 全部正文接收、分段、推理、报告生成、主库 H1 基线 8 台、H2 基线 1 台、H3 1 套
同城灾备 同城专属云,物理独占机柜,专线纳入同一安全域 热备(数据库从副本、无状态服务常备最小副本) H1 基线 3 台、H2 基线 1 台、H3 1 套
异地灾备 异地专属云,物理独占 冷备 + 归档异地副本 H1 基线 1 台、H3 1 套

弹性扩容资源(毕业季 H2 +12 台、H1 +20 台)全部落在主中心与同城中心,通过专线纳入同一 Kubernetes 集群与同一等保三级安全域,不改变数据所在域。租赁资源要求专属物理隔离,不与其他租户共享计算与存储介质。

前后端交付范围:学生端 Web、导师端微信/企业微信小程序、学校管理后台(配额、批次、统计、AI 使用边界参数、一致性自查入口)、装备司监管后台(全国口径统计与审计查询)、开放 API 与 SDK。技术栈:微服务 + Kubernetes 编排;服务划分为接入网关、配额与排队、正文解析、语义分段、特征抽取、判别推理、标定与阈值、报告生成、归档、身份、监控告警共 11 个微服务,各自独立伸缩。数据库采用国产分布式数据库(TiDB 企业版,兼容 OceanBase 迁移,SQL 层不使用厂商私有语法)。对象存储用于正文与报告落盘。前端支持 Chrome / Edge / Firefox / Safari 主流浏览器当前及前两个大版本;导师端提供微信小程序与企业微信应用。

灾备指标:数据库采用 Raft 三副本(主中心 2、同城 1)+ 异地异步副本,对象存储异地复制延迟 ≤5 分钟,RPO ≤ 5 分钟;切换采用预演过的自动化编排,RTO ≤ 30 分钟,每半年演练一次并提交演练报告。可用性承诺 ≥99.5%(按每年 3—6 月毕业季 120 天窗口统计,即窗口内不可用时长 ≤14.4 小时),统计口径与扣减规则写入服务级别协议。

3.2 检测引擎:语义片段与双模型交叉校验

最小分析单元 = 语义片段

切分规则(标点与长度双约束,与招标文件第 2.2.2 条一致):

  1. 一级切分:中文按「。!?;」、英文按「. ! ? ;」切分;
  2. 长度约束:中文片段超过 80 字、英文片段超过 40 词时,在次级标点(,、:——)处继续切分;
  3. 合并规则:中文不足 5 字、英文不足 3 词的片段,与前一片段合并;
  4. 片段不跨章节边界,标题、图表题注、参考文献条目各自成独立片段类型。

中英混合片段的语言判定(对应招标文件第 2.3.1 条)

环节 我方做法
语言判定 每个语义片段先过轻量语言检测(fastText 语言识别模型,langdetect 作为一致性校验),判定主要语言
特征提取 中文片段在中文人类基线下计算偏离,英文片段在英文基线下独立计算;不同语言的特征绝对值不跨语言比较,z 值只在同语言基线内成立
混合片段内 按字符归属 > 60% 的语言选基线(如「我们使用 BERT 模型进行 fine-tuning」按中文基线);词汇多样性、句长等指标计算时排除另一语言的词汇,避免术语外文形式拉低多样性
英文基线的选择 英文段落默认使用非母语作者人类基线而非母语基线。这一条直接针对第 2 章 2.2 引用的 61.3% 误报现象:用母语基线去衡量非母语写作,本身就是误报的制造机制

双模型交叉校验

模型 形态 作用
模型 A 1.5B 级判别模型(开源权重微调,Apache-2.0),纯前向打分,无自回归生成 给出片段的分布偏离打分
模型 B 8 维可解释特征 + 梯度提升树 给出可写进报告的具体证据,并独立复核模型 A

两个模型在同一片段上结论不一致时,一律按「不判异常」处理,并在报告中标注该片段「证据不一致,未纳入判定」。这一条使误报率以牺牲部分召回为代价被压住,是本方案在误报率与召回率之间取舍的明确立场。

8 个特征维度与异常片段判定

# 维度 含义
1 分布困惑度及其方差 相对同学科同语言人类基线
2 句长分布与变异系数 人类写作句长起伏更大
3 连接词与话语标记密度 「首先/其次/综上所述」类标记的过度规整
4 术语使用一致性 同一概念是否被反复换词表述
5 长度归一词汇丰富度 去除长度偏差后的 type-token 比
6 标点与格式习惯 中英标点混用、空格与破折号习惯
7 事实锚点密度 是否含具体数字、文献、实验条目、设备型号
8 局部重写痕迹 见 3.5

判定规则:先按学科 × 语言取人类基线分布,计算每个维度的 z 值;只有至少两个维度同时 |z| > τ_格 的片段才标记为异常片段(与招标文件第 2.2.2 条一致)。单一维度偏离不构成异常,这避免了「用词偏书面」或「句子偏长」这类风格特征单独触发判定。

τ_格 为什么必须逐格标定,不能写成固定的 2σ:若取 τ = 2.0 并假设 8 个维度在同格内近独立,单维双侧越界概率 α = 4.55%,则一个纯人类片段至少两维越界的概率为

p = 1 − (1−α)^8 − 8α(1−α)^7 = 4.83%

一篇 300 片段的人类论文因此期望出现 14.5 个异常片段,波及范围 4.83%——直接落在下表 L1(2%—10%)区间。也就是说固定 2σ 会让 L0 在长论文上几乎不可达。这不是一个可以用「阈值再调一调」掩盖的细节,而是判定式本身的性质。

τ_格 的标定目标是片段级假阳率,不是篇级误报率。 这一条是本方案第三轮自查改掉的一处实质错误,必须写在明处。原稿把标定目标定为「使该格篇级误报率的 Wilson 单侧 95% 上界 ≤1%」,而本方案的误报定义是「被判 L2 及以上」(理由见 3.3)。把两件事放在一起算,会发现这个目标是空的:

τ_格 片段级假阳率 P(纯人类 300 片段论文 ≥ L1) P(同一篇 ≥ L2)
2.00 4.83% 99.66% 0.016%
2.05 3.88% 97.65% 0.00028%
2.20 1.94% 52.45% 4.3×10⁻¹¹%
2.35 0.92% 5.96% 1.1×10⁻¹⁹%
2.47 0.48% 0.37% 1.7×10⁻²⁷%

L2 的门槛是波及范围 ≥10%,纯人类论文触到它的概率在 10⁻⁴% 量级 —— 也就是说无论 τ 取 2.0 还是 2.6,篇级 L2+ 误报率的上界都轻松满足 ≤1%,这个目标对 τ 没有任何约束力。真正被 τ 决定的是 L0 能不能达到:招标文件第 2.2.2 条把 L0 的门槛写死为波及范围 < 2%,而 τ = 2.05 时 600 片段的纯人类论文有 99.67% 的概率落到 L1 及以上。招标文件第 2.3.1 条给出的示范是「全篇 600 段、异常片段 2 段 → 波及范围 0.3% → L0」,我方原稿的判定式做不到这个数。

改后的标定目标(两条,缺一不可)

  1. 每格 τ_格 标定到该格纯人类片段的假阳率 ≤ 0.5%(经验分位数标定,正态近似下对应 τ ≈ 2.47,仅用于给出下限参考)。该目标下,纯人类论文落到 L1 及以上的概率为 300 片段 0.43% / 600 片段 0.01% / 1,000 片段 ≈ 0 —— L0 变成长论文的正常归宿,这才与招标 2.3.1 的示范一致
  2. 复核篇级 L2+ 误判率的 Wilson 单侧 95% 上界仍 ≤1%(它会自动满足,但仍逐层出报表,见 3.3 表 B)。
  3. 最终判据是篇级直接观测:该格纯人类论文的 L1+ 观测率 ≤1%。第 1 条的 0.5% 是在「同一篇内片段假阳相互独立」这个假设下与第 3 条等价的换算值;一旦片段假阳成簇出现,换算就不成立,必须以整篇人类论文上的直接观测为准。这重失效的量级与代价见 9.10 第三、四步 —— 片段间组内相关 φ 只要到 0.0008,第 1 条对应的篇级概率就会超过 1%;处置办法是继续抬 τ(φ = 0.02 时抬到 2.81),承诺守得住,代价仍然记在召回上。

反解一下容错:要让纯人类论文落到 L1 及以上的概率 ≤1%,片段级假阳率须 ≤ 0.598%(300 片段)/ 0.909%(600 片段)/ 1.113%(1,000 片段)。短论文更苛刻,因为 2% 的门槛在 300 片段上只是 6 个片段。我方按最苛刻的一档取 0.5% 作为统一标定目标,上表与本段全部数字由标书附带的 stats_check.py 第 6、7 节生成。

代价必须讲清:τ 从 2.05 提到 2.47 会降低召回。招标文件第 2.1 条明写「误报率的优先级高于召回率——接受放过一些 AI 辅助内容,但绝不容忍冤枉真实学生」,因此这个方向是招标文件指定的方向,而不是我方的取舍偏好。召回是否仍满足 ≥90%,不能靠推导声明,只能靠 D+22 盲测的 2,000 篇纯 AI 样本实测;若实测召回不足,处置顺序写在 9.4:不得通过下调 τ 换召回,只能改进判别模型与改写痕迹通道。该假设的失效条件与失效阈值见第 9 章 9.10。

三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围

招标文件第 2.2.2、2.3.1 条要求的三层聚合,我方完整实现,三层数据同时出现在报告里,任何一层都不允许被另一层掩盖。

层级 指标 定义 报告中的位置
片段级 偏离指数(σ 数) 该语义片段在 8 个维度上相对同学科同语言人类基线的标准化偏离;至少两个维度 |z| > τ_格 记为异常片段(τ_格 逐格标定到该格片段级假阳率 ≤0.5%,参考值 ≈2.47,见 3.3) 第三节 异常片段清单,逐段给 z 值
段落级 密度 该段落内异常片段数 ÷ 该段落总片段数 第二节 章节分布,逐段以密度条呈现
篇章级 波及范围 异常片段总数 ÷ 全篇总片段数 第一节 总体评估

为什么必须保留段落级密度这一层:一个 500 字段落里 AI 改了 5 个字(密度约 5%)与整段由 AI 输出(密度约 90%),在段落级二分标记下都叫「异常段落」,毫无区分度。密度是把这两种情况分开的唯一手段。我方在数据结构中把密度作为一等字段落盘,不是报告里的装饰。

波及范围按片段数计,不按字数计:与招标文件第 2.3.1 条的定义严格一致(异常片段总数 ÷ 全篇总片段数)。字数占比与绝对字数作为补充信息同时给出,便于导师判断体量,但分级门槛只用片段数口径,避免两套口径互相打架。

综合等级由三层数据共同决定

级别 波及范围 密度与偏离 处置建议
L0 未见明显异常 < 2% 片段异常 无需关注
L1 AI 辅助表达 2% — <10% 异常段密度 < 30%,偏离 < 2σ 导师留意,无需学生举证
L2 AI 辅助研究 10% — <30% 部分段落密度 30%—60%,偏离 2—3σ 导师与学生沟通确认写作过程
L3 AI 主导写作 ≥ 30% 多段落密度 > 60%,偏离 > 2σ 进入学校既定的学术规范复核流程

上表「密度与偏离」一列照抄招标文件第 2.3.1 条的分级参考,但它与招标文件自己的异常片段判定标准(同条「至少两个维度偏离超过 2σ」)不自洽:任何被标记为异常的片段,其触发维度的偏离必然已经超过阈值,因此 L1 不可能由「偏离 < 2σ」的异常片段构成。我方把这一列按其唯一自洽的读法执行:它是降级参考,不是判定门限,且度量对象是该篇所有异常片段触发维度 |z| 的中位数。在我方 τ_格 = 2.47 的标定下,异常片段的 |z| 中位数落在 2.5—2.8 属常态,因此这一列在实操中只用于「中位数明显贴着阈值」时把等级往下调(见下一段),不用于往上提。这处不自洽出自招标文件原文,我方不改写原文,只写明自己的执行口径,并在 D+3 的算法白皮书中提请甲方确认。

两个条件不一致时如何处理:波及范围决定基础等级;密度与偏离只能向下调整或维持,不能向上提级。例如波及范围 12%(落在 L2 区间)但全部异常段落密度均低于 20%、异常片段 |z| 中位数 < 2.6,则定为 L1 并在报告中写明「按波及范围应为 L2,因密度与偏离均低,下调为 L1」。这个方向是单向的,理由与 3.2 的双模型不一致按「不判异常」处理同源:所有裁量都朝误报率更低的一侧倾斜。

局部高密度不因篇章占比小而被隐藏:波及范围不足 2%(L0)但存在任一段落密度 > 60% 时,等级仍为 L0,同时在报告首屏给出局部风险提示并列出该段落。分级不提升,提示不省略,这两件事分开做,避免用一个等级同时承担两种含义。

必须明确的一点:波及范围是「被系统标记为需要关注的片段占全篇片段的比例」,不是「AI 生成文字的比例」,也不构成对 AI 参与程度的估计。 报告每一页都会印出这句话。招标文件第 2.3.3 条明令禁止把「AI 生成字数占比」当作评分定义,我方在数据结构与报告文案两层同时遵守。

各等级置信度分数

按招标文件第 2.2.2 条「输出各等级的置信度分数,而非单一标签」,报告第一节同时给出四个等级的后验概率(例如 L0 0.06 / L1 0.71 / L2 0.21 / L3 0.02),由波及范围与密度分布经校准后的 Dirichlet 后验给出。分级标签取最大后验,但最大后验低于 0.60 时报告标注「等级边界样本,建议人工优先复核」。

3.3 误报率分层标定(本方案的核心)

行业普遍做法是取一个全局阈值。本方案取消全局阈值,改为逐格反向标定

标定网格

12 个学科门类(哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、管理学、艺术学)× 7 类文体(学术论文、实验报告、文学评论、含古文引用的混合文本、综述与文献回顾、含代码与公式的文本、中英混合文本)× 2 种语言 = 168 格。

「误报」在本方案中的定义

招标文件第 2.1.1 条要求「人工撰写论文误报率 ≤1%」,但未定义「误报」落在哪一级。这个定义不写清,≤1% 就无法验收,因此我方在投标阶段先把它固定下来,接受招标方修改:

是否计入误报率 理由
纯人类论文被判 L2 或 L3 计入 L2 起处置建议为「与学生沟通确认写作过程」与「进入学术规范复核流程」,对学生产生实际举证负担
纯人类论文被判 L1 不计入 L1 的处置建议明文为「导师留意,无需学生举证」,不产生负担;且如上文所推,在片段级判定式下 L1 是长论文的统计常态,把它计为误报会使任何基于片段聚合的方案在定义上不可能达标
纯人类论文出现局部风险提示 不计入 提示不改变等级,只标出位置

按此定义,验收判据是:纯人类样本被判为 L2 及以上的比例,其 Wilson 单侧 95% 置信上界 ≤1%;至于这个上界能在哪一层粒度上被证明,见下一节的样本量计算。我方同时在报告与验收口径中承诺:L1 在任何对外表述中不得被称为「检出 AI」「疑似 AI 生成」或等价说法。若招标方要求把 L1 也计入误报,我方需要在 D+3 架构基线评审时重新标定分级门槛并相应调整 8.1 的指标承诺,此项变更不涉及加价。

1% 这个上界能在哪一层被证明:先算样本量下限

这一节是投标定稿前自查补上的,因为原稿有一处从未验算的前提。「逐格误报率 ≤1%」听起来比「全局 ≤1%」更严格,但它默认了一件事:每一格的样本量足以支撑 1% 这个量级的置信上界。算一次就清楚了。

设某格人类验收样本 n 篇,L2 及以上误判 k 次。最好的情形是 k = 0,此时 Wilson 单侧 95% 上界化简为

U(n) = z² / (n + z²),其中 z = 1.645

要求 U(n) ≤ 1%,解得 n ≥ z²(1/0.01 − 1) = 2.706 × 99 = 268 篇

这个结论与算法好坏无关:任何一格只要人类样本不足 268 篇,即使一次误判都没有,也无法在 95% 置信水平上证明该格误报率 ≤1%。 168 格平摊我方全部人类标定样本后每格只有十几篇,0 次误判的上界仍在 14% 量级。原稿把「逐格 ≤1%」写成承诺,是一个统计上兑现不了的承诺。

我方因此把承诺层级改写成下表,只在样本量支撑得住的层级上作 ≤1% 的承诺:

层级 人类验收样本 n 0 次误判时的上界 ≤1% 最多容许误判 定位
全局 5,000 0.054% 38 次(0.76%) 验收层,承诺 ≤1%
语言级 · 中文 3,300 0.082% 23 次(0.70%) 验收层,承诺 ≤1%
语言级 · 英文 1,700 0.159% 10 次(0.59%) 验收层,承诺 ≤1%
学科级(12 格) 416 / 格 0.646% 0 次 诊断层,公开数字但不作 ≤1% 判据
学科 × 文体 × 语言(168 格) 篇级不度量 仅用于 8 维基线估计与阈值标定(依据是 S5 的人类片段,见下)

上表所有上界与容错次数由标书附带的 stats_check.py 按 Wilson 公式计算,正文不手写数字,评审方可用任一统计软件复核。三点说明:

  1. 学科级为什么只作诊断层。 n = 416 时 0 次误判的上界是 0.646%,看似宽裕;但只要出现 1 次误判,上界就跳到 1.07%,已经越线。把它写成验收承诺,等于承诺「每个学科 416 篇里一次都不能错」,这不是一个可以负责地签下的条款。我方的做法是公开每个学科的点估计与区间,并把它作为月度复标的监控指标:数字全部给出,但不谎称它证明了 1%
  2. 如果招标方要求学科级也必须证明 ≤1%。 要让学科级在容许 1 次误判的前提下上界仍 ≤1%,需每学科 n ≥ 446 篇(此时上界 0.999%),12 学科共 5,352 篇人类验收样本,比现有 5,000 篇多 352 篇,S4 增支 17,600 元(352 × 50 元)。我方愿在合同签订时按此调整,该支出由风险预留 R(940,340 元,占用 1.9%)承担,总价不变
  3. 这不是把标准放低。 招标文件第 2.1.1 条写「人工撰写论文误报率 ≤1%」,未指定分层粒度。我方承诺的全局与语言级严于「取一个全局平均数」的常见做法——非母语英文正是误报最高的区域(见 2.2 引用的 61.3%),把英文单列为验收层就是把这块风险锁住;同时不在统计上做不到的粒度上开空头。

标定方法与两张输出表

对每一格,用校准与标定集中的人类样本把该格阈值 τ_格 搜索到使该格片段级假阳率 ≤0.5% 的最小位置(目标的来历见 3.2 末段;取最小值是为了不过度牺牲召回),再在该格的整篇人类论文样本上复核篇级 L1+ 观测率 ≤1%。后者是最终判据,前者只是起点值,两者不一致时以篇级观测为准(原因见 9.10 第三、四步:片段间不独立时片段级比率推不出篇级概率);同时复核该格篇级 L2+ 误判率与上级基线不冲突。τ 的候选区间在标定集上按经验分位数搜索,不使用理论分位数(原因见 9.10)。输出的不是一个阈值数字,而是两张表。

表 A:格级阈值与诊断(168 行,示例 3 行)

学科 文体 语言 基线用人类片段数(S5) 篇级校准样本(S4) 采用阈值 τ(|z| 阈值) 标定后实测片段级假阳率(目标 ≤0.5%) 状态
工学 学术论文 中文 2,800 18 2.47 0.46% 已标定
文学 含古文引用 中文 1,560 9 2.61 0.31% 已标定
农学 文学评论 英文 140 2 采用学科级 不单独标定 样本不足,降级使用上级基线,报告显示置信度降级提示

两件事必须分清:8 维基线(每格的均值、标准差与 8×8 相关矩阵)由 S5 采购的人类片段估计(S5 共 500,000 条,三分类中人类侧约 17 万条,168 格平均约 1,000 条,密集格如工学学术论文中文可达 2,800 条),足以稳定估计 8 维一阶二阶量(9.10 要求每格输出维度间相关 ρ̄、ρ_max 与片段间组内相关 φ̂ 三个数);篇级误报率则需要整篇文档,168 格平摊后每格只有个位数到十几篇。因此表 A 故意不设置信上界列——按上一节算出的 268 篇下限,格级的 1% 上界不成立,列出来只会制造「每格都已证明 ≤1%」的错觉。格级篇数分配不均匀是有意的:超出下限的样本优先填最稀疏的格。

表 B:验收层级结果(D+22 盲测提交,示例数值)

层级 人类验收样本 n L2+ 误判 k 观测误报率 Wilson 单侧 95% 上界 是否满足 ≤1% 同批 L1+ 误提示 k′ / 观测率
全局 5,000 18 0.36% 0.53% 通过 41 / 0.82%
语言级 · 中文 3,300 12 0.36% 0.58% 通过 26 / 0.79%
语言级 · 英文 1,700 6 0.35% 0.68% 通过 15 / 0.88%
学科级 · 工学 416 1 0.24% 1.07% 诊断层,不作判据 4 / 0.96%

(两表均为格式示例,实际数值在 D+22 盲测时提交。)

最后一列是第三轮自查加上的,理由要写清。 招标文件第 2.1.1 条的原文口径是「最多判定 1 篇为 AI 生成」,而 L1 的定义是「个别片段经 AI 润色,非整段 AI 输出」,按字面不属于「AI 生成」,所以本方案的合同判据仍是 L2+。但只报 L2+ 有一个实际问题:学生先看到的是那个黄色的 L1 标签,而一份纯人类论文被贴上「AI 辅助表达」同样会带来解释成本。因此我方把 L1+ 误提示率作为并列披露的第二个指标一起报,并在 8.1 给出它自己的承诺值。两个口径都公开,评审方可以按任一口径判分:

样本不足的格不允许伪造置信度:明确标注为「采用上级基线」,并在该格产生的每一份检测报告中显示置信度降级提示。这是我方与「给一个全局 <1%」的关键区别:我们把标定表的空缺暴露出来,而不是用一个平均数盖住。

四套数据的物理隔离

原稿有一处硬伤:S4 采购的样本同时承担了阈值标定与盲测验收两个职能。即使不训练模型,只要阈值是在同一批样本上选出来的,这批样本就不再是独立验收集。改为四套数据、四条边界:

数据集 规模与构成 用途 标签谁可见
训练与基线集 S5 标注的 500,000 条语义片段(公开可商用人类语料限 2021-06-30 前、委托撰写样本、合成 AI 样本),与 S4 不同来源 学习判别模型与特征权重;估计 168 格的 8 维基线与相关矩阵 开发团队
校准集 S4 中 3,000 篇(人类 1,000 / 学生主写+AI 润色 1,000 / 纯 AI 1,000) 概率校准、168 格候选阈值 τ 的搜索 开发团队
开发测试集 自校准集中划出 20% 并按轮换使用 模型选择、消融、回归 开发团队
独立验收盲测集 S4 中 9,000 篇(人类 5,000 / 学生主写+AI 润色 2,000 / 纯 AI 2,000 D+22 盲测,上节表 B 的 ≤1% 验证与 8.2 的召回验证 甲方或甲方指定第三方托管,验收前开发团队不可见标签

盲测集的三个数量不是我方自定的:招标文件第 2.1.1—2.1.3 条分别要求人类论文盲测集 ≥5,000 篇、人工与 AI 辅助混合 ≥2,000 篇、已知 AI 生成 ≥2,000 篇,合计 9,000 篇。我方 S4 采购 12,000 篇,先把 9,000 篇按上述下限逐项填满并交甲方托管,剩余 3,000 篇才用于校准。原稿的错误正在这里:12,000 篇被当成一个池子同时做标定和验收,等于用验收集选阈值。

月度复标

运维期每月用当月新增的人类样本(来源:学校自愿提供的已确认原创论文,经脱敏与授权)对 168 格做一次复标,复标结果与阈值变更记录对招标方开放。阈值任何调整都产生版本号,报告中注明所用阈值表版本。

3.4 分文体专项校准

文体 主要风险 我方处理
学术论文 文献综述与研究方法章节句式高度规整,是误报高发区 按章节类型取子基线,综述与方法章节单独标定
实验报告 结构模板化,格式段落占比高 模板段落(表头、步骤编号、器材清单)识别后排除判定
文学评论 修辞密度高,词汇丰富度异常 该格单独标定,维度 5 权重下调
含古文引用的混合文本 古籍原文极易被判为 AI 见下方古文豁免三层机制(主判据为文言语言学特征,不依赖比对已知篇目)
综述与文献回顾 转述密集、事实锚点密度低 引文密集段落识别后按引用文体基线判定
含代码与公式的文本 统计特征不适用 见下方不可分析内容机制
中英混合文本 非母语英文段落是误报最大来源 按段落语言分别取基线,英文段落使用非母语人类基线而非母语基线

古文豁免:三层机制,不依赖「这段古文我们见过」

招标文件第 2.1.2 条把古文误判列为绝对禁止项,同时在验收条件里写明「将使用包含多种古文引用场景的混合测试集(非单一已知文本)进行验证」。这句话排除了一整类做法:任何只靠与已知古籍比对来豁免的方案,遇到测试集里未收录的篇目就会失效。我方因此把古文豁免做成三层,其中起主要作用的是与具体文本无关的那一层。

判据 是否依赖「见过这段文本」 作用
第一层:引用结构证据 引号、书名号、脚注与参考文献锚点、「《论语》曰」类引导语、缩进引文块的版式特征 先把「作者声明这是引用」的片段划出来
第二层:文言语言学判别(主判据) 文言虚词密度(之、乎、者、也、焉、矣、其、而、以、于)、单音节实词占比、现代双音节词与外来词缺失、现代标点缺失、判断句与被动句的文言句式标记、平均句读长度 未收录的古文同样识别。这一层不问「这段是哪一篇」,只问「这段的语言形态是不是文言」
第三层:古籍语料 n-gram 兜底 与域内自建古籍索引(含《论语》《史记》《滕王阁序》等先秦至清代主要典籍及现行教材选文)精确或近似匹配 只作兜底与报告标注用,不是达标的依据

判别口径:第二层给出文言概率,超过阈值即判为古文;第一层或第三层命中可下调阈值,但单独的第三层命中不是豁免的必要条件。任一层命中的片段标记为「引用古文」,不参与任何 AI 判定,不计入异常片段,不计入分母,报告中单列「已识别古文引用 N 处」并注明是哪一层识别的。

代码与公式:不可分析内容

3.5 改写痕迹检测

针对第三方「降AI」服务处理过的文本。这类服务的公开承诺是把检出率压到某个阈值以下,其手段在文本上会留下与人类自然修改不同的痕迹:

痕迹 可观测特征
逐句同义替换 相邻句的词汇分布突变而句法骨架不变
连接词批量重写 话语标记密度在全文范围内被压到异常均匀
术语一致性断裂 同一概念在全文换用 3 种以上表述,且换用位置与章节边界无关
句长人为扰动 句长序列的自相关结构被破坏,变异系数偏高但分布形状不自然
格式习惯不一致 同一文档内标点、空格、破折号习惯在段落间跳变

输出方式:改写痕迹作为独立一节呈现,不并入 AI 判定的异常片段占比,也不直接触发分级。理由是改写本身不等于学术不端(正常的语言润色与导师修改同样会留下痕迹),报告只陈述观测到的现象与位置,把判断交给学校。这一节同时是对招标文件第 1.3 条第 7 项「不得植入降AI率付费服务」的正面回应:我方识别改写痕迹,但不提供、不推荐任何规避服务。

招标文件第 2.2.1 条六类对抗手段的逐条应对

对抗手段 我方机制 预期抵抗率(投标承诺值)
大白话改写 不以「语言是否口语化」作为任何维度的输入;判定依赖 8 个统计维度中的句长变异、事实锚点密度与话语标记分布,这三项在刻意大白话改写后反而更异常。真实口语化写作的句长变异、话语标记分布不规整,与刻意大白话的低变异 + 规整分布相反,两者可分 AI 判定路径召回 ≥80%
故意加错别字 预处理阶段做字符归一化:常见错别字与形近字映射回标准形、零宽字符与不可见字符剥离、同形异义字(如西里尔字母 а 冒充拉丁 a)还原;归一化前后各算一次,取偏离更大的一次 ≥88%
调乱语序 段落级语序扰动不改变片段内的统计特征(词汇多样性、句长分布、话语标记密度都是片段内指标);跨片段的逻辑推进平滑度改用篇章级无序统计量,对语序不敏感 ≥85%
同义词批量替换 判定不依赖具体词表,依赖分布形状;同义替换后句法骨架不变而词汇分布突变,这恰好是 3.5 表中「逐句同义替换」痕迹的触发条件 ≥80%,另由改写痕迹路径独立标出
中英混杂 见 3.2 的语言判定与 > 60% 字符归属规则,混杂本身不构成规避手段 ≥85%
分段检测逐个击破 波及范围与密度都是篇章级聚合量,分段送检再合并与全文送检产生相同片段集合(分段边界不跨章节,见 3.2);篇章级建模支持 ≥2 万字全文,不做截断 分段合并与全文偏差 ≤5%(已写入违约条款,见 3.9)

鲁棒性测试集设计方案(招标文件第 2.2.1 条要求提供)

设计
规模 2,400 篇,来自 S4 留出集中 800 篇纯 AI 与 AI 辅助样本,每篇按 3 种手段各生成 1 个变体
手段覆盖 上表六类各 400 篇;其中「大白话改写」与「同义词批量替换」各拆为「工具处理」与「人工处理」两个子集,各 200 篇,用于区分工具痕迹与人工痕迹
工具来源 不采购、不调用任何降AI服务。变体由我方自建改写流水线生成,参数对照公开推广材料所描述的处理强度,属投标假设,非对真实服务的实测
阴性对照 另取 1,200 篇人类原稿做同样的改写处理。这一组的作用是测「改写痕迹」路径会不会把被润色过的人类论文标成异常——它是误报率的一部分,不是召回率的一部分,必须与鲁棒性一起测
判定 每类手段的抵抗率按上表承诺值验收;阴性对照组的误报率仍受 ≤1% 约束,不因为对抗测试而放宽
更新 测试集每季度增补一批,增补来源为运维期内发现的新手段(见 3.13)

3.6 数据治理、存储与生命周期

数据类别 保留期 处理
论文正文(含备份) 最长 30 天 到期物理删除,删除动作产生审计记录;不留任何可还原全文的连续片段
脱敏检测报告与片段明细 3 年 片段仅存长度、位置偏移、特征向量与判定依据,不存原文
统计信息 3 年 学校级、学科级聚合,不可回溯到个人
审计记录 3 年 访问、删除、阈值变更、留出集访问全留痕

容量:单中心实际占用约 22TB(正文 30 天窗 3.2TB、报告明细 4.8TB、审计 0.5TB、留出集与标注 0.6TB、模型多版本 2TB、索引与临时 1.5TB,按 1.5 倍增长余量取 19TB 加系统开销)。配置 H3 每中心 1 套 × 100TB,余量充足。三年累计报告与索引 24,000,000 条,远超招标要求的 500 万条。

3.7 平台、接口与学校接入

3.8 弹性与峰值保障

日常与峰值的负载差异极大,架构上按两条独立路径设计:

保障手段:专属云同规格资源预留协议(毕业季 3—6 月按月计租);Kubernetes HPA 按队列深度自动扩容;学校级令牌桶配额,避免单校集中提交挤占全局;提交即返回受理凭证与预计完成时间,排队状态对学生可见。设计日处理能力 253 万次/日,为招标要求 6 万次/日的 42 倍,这个余量是瞬时 SLA 的副产品,不额外收费。

3.9 报告输出规范与可解释性

报告必含的四个模块(对应招标文件第 2.3.1 条)

招标文件规定四个模块缺一不可。我方报告共六节,与四个模块的对应关系如下,完整样式见附录 A。

招标要求的模块 必含字段 我方报告位置
1 总体评估 综合等级、波及范围、特征密度、判定说明、检测时间、引擎版本 第一节(六项全部出现,另加四等级置信度分数与内容构成块)
2 片段级分析 全文字数、语义片段总数、异常片段数、逐章节与逐段落的分布及密度 第二节(章节分布表 + 逐段密度条)
3 特征分析(证据链) 原文摘录、各维度观测值与基线值、综合偏离指数 σ、该段密度、统计说明 第三节(异常片段清单,逐段给全套)
4 人工复核指引 建议教师重点关注的位置,并说明为什么这一处比那一处更值得关注 第四节(按密度 × 偏离排序,附引导性提问)

论文内容构成块(对应招标文件第 2.1.3 条)

每份报告在第一节固定位置输出内容构成,字数与占比逐类列出:

``` 论文内容构成: 可分析自然语言:20,662 字(88%) 代码块: 1,904 字(8%)——标注「代码逻辑,AIGC 检测不可靠」 数学公式: 728 字(3%)——标注「公式内容,AIGC 检测不可靠」 古典文献引用: 186 字(1%)——已豁免,不计入分母

警告:本报告仅对 20,662 字的自然语言部分作出 AIGC 判定。 代码与公式共 2,632 字(11%)不在本系统检测能力范围内。 如论文核心贡献(代码、算法、理论推导)主要位于不可分析区域, 建议教师通过以下方式核实: - 要求学生口头解释代码逻辑与公式推导 - 检查代码仓库的 Git 提交历史与提交粒度 - 要求对关键算法做变体改写测试 ```

不可分析内容超过全文 30% 时,综合等级旁附加提示:「本论文有 X% 的内容属于代码/公式等不可分析类型,检测结果仅反映可分析的自然语言部分。」这三条教师核实方式是固定文案,不随论文变化。系统不具备判断学生是否独立完成的能力,只能把核实手段交给教师。

明令不合格做法的逐条回应(禁止表述清单)

招标文件第 2.3.3 条列出的不合格情形,逐条对应我方设计。下表右栏即我方报告的禁止表述清单,这七项在任何检测报告、导师端界面与对外文档中一律不得出现:

明令不合格的做法 我方做法
只给出一个百分比 报告含分级与四等级置信度、波及范围/密度/偏离三层数据、8 个维度的偏离概览、章节与段落分布、异常片段清单、人工复核指引、古文与不可分析内容说明、改写痕迹,共 7 节(完整样式见附录 A)
「AI率 42.73%」式虚假精确 波及范围一律报为分档区间(如「8%—12%」)并同时给出异常片段数、绝对字数与段落密度;不输出两位小数
引用特定 LLM 名称或版本 报告中不出现任何大模型产品名或版本号,表述统一为「与同学科同语言人类写作基线的偏离」
不说明判定原因 每个异常片段必须列出触发的维度名称、观测值与基线值、z 值、所在段落密度、所用基线(学科/文体/语言/版本号)
输出格式因环境而异 单一 JSON Schema + 单一渲染模板,报告页脚印出引擎版本、基线版本、阈值表版本、报告模板版本
只给总分,不区分波及范围、密度与偏离 三层数据在第一节并列呈现,任何一层都不允许单独构成结论;密度与偏离只能下调等级,见 3.2
把「AI 生成字数占比」当评分定义 数据结构中无此字段;分级只读片段数口径的 flagged_span_ratio(波及范围)与 paragraph_density(密度),报告每页印出其定义说明

结果一致性(写入违约责任)

三项均提供在线自查入口,招标方可随时抽检。

3.10 安全与合规

数据最小化:系统采集哪些字段,以及不采集哪些(对应招标文件第 3.2 条)

招标文件要求「仅收集检测必需的数据,不得收集与检测无关的个人信息」。我方把它落成一张白名单:白名单以外的字段,系统没有采集入口,数据库里也没有对应列。

采集 字段 为什么是检测必需
采集 论文文件本体 检测对象,30 天后物理删除
采集 学校代码、院系代码 配额分配、学校级统计、报告归属;按 GB/T 36351.1 代码表取值
采集 学号(或学校统一身份 ID) 区分提交人、限定只有本人与其导师可见;不与姓名一同落库,姓名仅在报告渲染时由学校侧身份系统实时回填
采集 学科门类、文体、语言 决定落在 168 格标定表的哪一格,直接影响阈值
采集 提交时间、提交序号 自查历史(仅导师可见)与一致性自查
不采集 身份证号、手机号、邮箱、家庭信息、银行与支付信息 与检测无关;系统无面向学生的收费入口,也就没有支付信息的用途
不采集 成绩、评奖、处分等学籍记录 与检测无关,且一旦与检测结果同库存放即构成画像风险
不采集 设备指纹、IP 归属地、浏览行为、停留时长、鼠标轨迹与击键节奏 与检测无关。特别说明:击键节奏与编辑过程数据虽然在技术上能佐证「是人写的」,本次一律不采集;第 10 章把「写作过程留痕作为正面证据」列为不实施的探索项,原因就在这一条
不采集 导师对学生的评价文本 与检测无关

该白名单写入《第三方组件与数据字段声明表》(D+3 提交),并列入每年 1 次安全测评的检查项:测评方逐列比对数据库实际字段与白名单,发现白名单外字段即判不通过。

3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条)

这一条不是附加功能,它决定报告怎么写。前面 3.9 的全部输出规范都以它为约束。

人机协作定位(2.4.1)

正向引导(2.4.2)

等级 报告固定提示语
L0 全文未见显著偏离该学科基线的片段。
L1 该部分可能使用了 AI 辅助表达。若为学生自主使用的润色工具,属合理使用范畴,建议关注表达而非追责。
L2 存在多处整段偏离,建议与学生就这些章节的写作过程进行核实。
L3 建议关注该生是否具备独立完成该部分学术工作的能力,并按学校既有程序处理。

《学术诚信与 AI 工具使用指南》作为系统内置模块,随学生自查报告一并推送;内容由招标方审定,我方只提供承载与推送能力,不自行解释学术规范。

与学术诚信教育体系融合(2.4.3)

不增加学生负担(2.4.4)

要求 我方实现
对学生免费 系统无任何面向学生的收费入口与支付能力,技术上不具备向学生计费的可能
次数不限 论文提交期内学生自查次数不设上限;历史记录仅导师可见,学生端只显示最近一次结果
反馈即时 自查走与正式检测同一队列,峰值下同样满足 3 分钟上限;完成即推送,不设人工审核环节

自查次数不限带来的额外计算量已计入报价:招标《三年总价报价口径与明细表》给定的业务量为 500 校 × 4,000 篇 × 4 次/篇 = 800 万次/年、三年 2,400 万次,本身已把自查算进去;我方报价按此口径全额计入,未按「每篇只检一次」压低容量。

3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条)

数据来源与代表性(2.1.4)

要求 我方说明
来源合法性 留出集 12,000 篇为委托采购的授权样本,逐篇取得作者书面授权(S4 单价 50 元/篇已含授权费);训练集 500,000 条片段来自公开可商用语料、委托撰写与自建合成,不含任何学生在本系统提交的论文
学科覆盖 12 个学科门类,超过招标要求的 10 个
样本量统计学依据 每格误报率按 Wilson 单侧 95% 置信上界 ≤1% 标定;要使上界 ≤1% 且观测误报为 0,单格人类样本需 n ≥ 300。168 格中达标格直接标定,未达标格标注「采用上级基线」并降级置信度,见 3.3
训练限制 学生论文永不进入训练管道:训练数据源采用白名单机制,正文存储桶不在白名单内,任何训练任务无法读取

标注偏差(Annotator Bias)的处理

  1. 每条片段由 2 名标注员独立标注,不一致的交由第 3 名裁决;Cohen's κ 低于 0.75 的批次整批重做。
  2. 标注员不得看到样本来源标签(人写 / AI 生成 / 润色),采用盲标。
  3. 专项检查非母语英文样本:这是误报率最高的区域,若某标注员在该子集上的「判为 AI」比例显著高于同批均值(卡方检验 p<0.05),该标注员产出全部复核。这条直接对应第 2 章 2.2 引用的 61.3% 误报现象,那个现象的一部分根源就在标注环节。
  4. 标注指南、κ 值、重做记录作为交付物入库,向第三方审计机构开放。

第三方组件与开源许可(3.1 第 3 项)

我方在投标阶段声明:本系统不使用任何 AGPL / SSPL 类传染性许可组件;所使用的开源组件限于 Apache-2.0、MIT、BSD、MPL-2.0 四类许可。完整组件清单在 D+3 架构基线评审时随《第三方组件声明表》提交,并在每次版本更新时同步刷新。该表的字段在投标阶段即固定为下列八列,逐组件、逐模型权重、逐数据源各占一行,不按许可类别合并

资产名称 精确版本或权重哈希 许可证或商业授权 允许商用 允许私有化部署 是否修改 可否再分发/移交采购人 替代方案

三项需要单独法律审查、已在投标阶段标出的资产:判别模型开源权重(权重许可与其训练数据许可是两条独立权利链)、版式解析与公式识别引擎(商业私有化许可,移交时需确认许可可随交付转移)、对象存储与 PDF 处理类组件(同名项目存在双许可版本,须按实际获取渠道核定)。数量对齐在同一张表核对:3.1 的 Raft 三副本、表 2 的国产数据库服务器 3 台、表 3 的 S2 商业数据库 3 个实例一一对应,异地异步副本复用异地那一个实例,不存在「拓扑写四份、费用只买三份」的缺口。B 项中的商业授权(国产数据库、版式解析与公式识别、身份认证中间件、消息通道)在表 3 中已逐项列明,无隐藏授权成本。本系统不采购任何需要把论文正文或正文片段送出安全域的第三方接口,因此第三方服务清单中没有文献比对、查重或云端检测类服务。

申诉与过程追溯(3.3 第 3 项)

能力 实现
可追溯窗口 报告与完整判定过程记录保留 3 年(正文 30 天后清除,追溯记录不含可还原正文的内容)
追溯内容 引擎版本、基线版本、阈值表版本、分段结果哈希、每个异常片段的 8 维特征值与 z 值、两模型各自结论与仲裁路径、所用学科 × 文体 × 语言格及该格的样本量与置信上界
复算 凭报告编号可在审计环境中重放该次检测,输出与原报告逐字节一致(依据 3.9 的检测指纹机制)
提交对象 发生重大申诉时,上述记录以独立专家委员会可读的形式提交,不需要我方在场解释
正文不可得时 正文已按 30 天规则清除后,追溯记录仍可证明当时的判定依据与版本,但无法重新分析原文——这是数据最小化与可追溯之间的取舍,我方按招标文件第 3.2 条选择前者,并在此明示后果

3.13 面向未来的鲁棒性:更新、抗逆向、算法自身的偏差(对应招标文件第 2.2.3 条)

招标文件在这一条提了三个问题,逐个回答。

一、新一代大模型发布时,模型的更新周期与流程

环节 时限 动作
监测 持续 算法运维岗跟踪主流模型发布;发布后 5 个工作日内用现网留出集做一次基线漂移评估
判定 漂移评估后 3 个工作日 漂移使任一格误报率 95% 置信上界超过 1% 时,触发重标定;仅召回下降不触发紧急流程,进入月度更新
重标定 15 个工作日内 只改阈值表版本,不改引擎版本;新阈值表先在影子模式跑 3 天,与线上结果逐格对比
发布 每月固定窗口 阈值表与基线版本号递增,旧版本保留可回滚 90 天;已出报告不追溯重算,但报告中印出所用版本号,任何时点都能查出当时的判据
费用 已计入 表 5 运维中「算法运维 1 人 × 3 年」与「模型月度更新 + 误报率月度复标」即此项,不另计费

不做的事:不承诺「新模型发布当天即可检出」。判别模型需要该模型的输出样本才能标定,样本积累需要时间。我方承诺的是发布后 5 + 3 + 15 个工作日内完成一轮标定,而不是零时差。

二、如何防止模型被对抗样本针对性地逆向攻击

先说我方对这道题的判断:真实的攻击面不在模型,在反馈机制。 第一代系统按次收费、每次返回一个精确到小数点后两位的百分比,这在效果上等于给改写方提供了一个可反复调用的数值反馈接口。不需要了解算法,只要看着数字调,就能找到刚好过线的改法。第 2 章引用的「不达标退款」「达标率 99.26%」之所以敢承诺,靠的不是破解算法,而是买足够多次查询。所以下表的第一条不是限流,而是默认不向被检测方返回可用于寻优的连续数值

风险 控制手段
把检测结果当寻优信号反复试探 学生端始终不返回连续数值:不返回综合偏离指数 σ、不返回任何维度的 z 值、不返回波及范围与密度的精确百分比。学生端只看到等级、需关注的段落位置、以及本方案 2.4 规定的引导性提示语。完整证据链(原文片段、八维观测值对基线值、σ、密度)只对导师端与校级管理端开放。局限声明:这不是完全防御——改写方仍可通过「等级是否变化」拿到粗粒度反馈,我方只声称把寻优所需的查询次数抬高了若干数量级
反复提交同一文档试探阈值 学生端自查按文档指纹计数,同一指纹设最小提交间隔(限频率不限总次数,正常自查节奏不受影响),同一指纹的相邻提交只返回等级与段落位置;导师端可见完整证据链
用批量样本拟合阈值 阈值表不下发、不进 API 响应、不写入报告;报告只写「所用基线格」与该格的样本量与置信上界,不写阈值数值
模型权重泄露后被针对性优化 判定为双路径(1.5B 判别模型 + 8 维可解释特征 GBDT),两路结论不一致按「不判异常」处理。单独攻破一路不足以规避,但也意味着攻破一路会降低召回而不是产生误报——这个方向是有意选的
公开基准过拟合 我方不以任何公开基准的成绩作为承诺依据。第 10 章说明过:有厂商在公开 TOEFL 集上报 0.00% 误报,但该结果发布晚于该基准公开,无法排除过拟合。我方承诺的 168 格均在自建留出集上标定,留出集不公开、与训练集物理隔离(见 3.3)
探测式攻击的检出 同一 IP/同一学校在短窗口内提交大量高度相似文档时触发风控告警,记录但不阻断学生正常自查

三、检测算法自身使用 AI 可能引入的偏差及控制措施

这一问最容易被跳过,但它是本方案误报率主张的根基。我方使用 AI 的三处,以及各自可能引入的偏差:

使用处 可能引入的偏差 控制措施
判别模型(1.5B,开源权重微调) 其预训练语料的分布决定了它认为什么是「自然」的文字。语料以母语英文与规范中文为主,会系统性地把非母语写作、方言影响的表达、非主流学科术语判为偏离 判定不直接采用模型分数,而是把分数转成相对该格人类基线的 z 值;基线按 12 学科 × 7 文体 × 2 语言分格自建,英文用非母语基线。偏差被基线吸收,不进入结论
合成 AI 样本(训练集 500,000 条片段的一部分) 合成样本由少数几个模型生成,模型会留下自己的风格指纹,导致判别器学到「像某个模型」而不是「像 AI」 合成样本按来源分层,单一来源占比上限 25%;验收盲测集(S4 的 12,000 篇)中的纯 AI 样本由第三方委托生成,来源不向算法团队公开
标注辅助(部分片段先由模型预标注,再人工裁决) 模型预标注会把自己的偏好锚定给标注员 预标注结果对标注员不可见(盲标,见 3.12);每批抽 5% 做无预标注的对照标注,两组一致率低于 0.85 则整批重做

一条硬规定:任何 AI 生成的中间结论都不得直接进入报告文字。报告中所有句子出自固定模板 + 数值填充,没有生成式文本。这既是为了输出格式跨环境完全一致(第 2.3.3 条),也是为了避免模型的措辞偏好影响教师判断。

第 4 章 创新点

三项创新都算进了报价,不留作愿景。后面还附了刻意没做的三件事。

招标必备内容 ③

本章三项全部在本次项目中实施,费用已计入报价(对应费用行见表 6 末行)。不做承诺之外的展示性功能。

4.1 误报率分层反向标定(168 格标定表)

别人怎么做:训练一个模型,在混合测试集上找一个全局阈值,对外报一个「误报率 <1%」。

问题在哪:误报率在不同学科、文体、语言上的差异可以差到一个数量级。已发表研究显示,7 款主流检测器对非英语母语者撰写的人类作文平均误报 61.3%,对母语者作文接近零。一个全局平均数把这种结构性差异完全抹掉了——最终承担代价的是恰好落在高误报格里的那批学生。

我们怎么做:取消全局阈值。建立 12 学科 × 7 文体 × 2 语言 = 168 格的网格,每格用人类语料独立估计基线并独立搜索阈值 τ_格。交付物是一张表,不是一个数字。关于「≤1%」落在哪一层,3.3 给了一个必须先算的数:0 次误判时 Wilson 单侧 95% 上界 ≤1% 要求该层样本 n ≥ 268 篇,因此我方把 ≤1% 的承诺放在全局(n=5,000)与语言级(中英各自),学科级与 168 格级只公开点估计与样本量,不谎称已证明 1%。

为什么这构成创新而不只是工作量:三点。一是把「误报率 ≤1%」从宣传语变成可被第三方按格复算的承诺;二是样本不足的格必须标注为「采用上级基线、置信度下降」,不允许用平均数掩盖空缺,这个诚实约束本身是设计的一部分;三是运维期每月复标并公开阈值变更记录,使承诺在三年内持续可验证,而不只是验收当天成立。

成本:S4 超出招标下限采购的 3,000 篇样本 150,000 元 + 算法工程师(基线与标定)5 人 × 22 人天 220,000 元。

4.2 改写痕迹检测

为什么需要它:「降AI」服务产业已经完成商业化闭环。公开报价 4.8 元起、声称达标率 99.26%、支持 9 个检测平台、未达标退款;另一家承诺知网检出率 >15% 全额退款并补偿检测费。检测方承诺统计指标,规避方承诺可验收结果。只要检测系统只看「像不像 AI 写的」,这条产业链就永远领先一步。

我们怎么做:增加一条与 AI 判定并行、互不干扰的检测路径,识别文本被系统性改写过的痕迹——逐句同义替换(词汇分布突变而句法骨架不变)、话语标记密度被压到异常均匀、术语一致性在与章节边界无关的位置断裂、句长序列自相关结构被破坏、同文档内格式习惯跳变。

关键设计取舍:改写痕迹不并入 AI 判定占比,不触发分级。因为改写本身不等于学术不端,正常润色、导师修改、翻译都会留下痕迹。报告只陈述观测到的现象与位置,把判断权交给学校。把它做成独立一节而不是加权进总分,是为了不制造新的误判来源。

成本:算法工程师(改写痕迹)3 人 × 20 人天 120,000 元,以及 S5 标注中的润色混合类样本。

4.3 结果一致性自证机制

别人怎么做:同一份稿件在不同系统上的结果差异极大。公开测评中同一稿件在三家系统的检出率为 62.7%、9.57%、5.4%;另一份稿件的三家排序甚至相反。行业内没有任何厂商把一致性写进合同。

我们怎么做:把一致性变成可触发违约的量化条款,并提供在线自查。

承诺 实现机制
同篇 24 小时内三次检测各维度偏差 ≤5% 确定性推理:固定随机种子、禁用采样、batch 无关的 padding 与归约顺序、锁定算子实现版本
不同部署实例结果一致 检测指纹 = hash(引擎版本 + 基线版本 + 阈值表版本 + 分段结果 + 正文哈希),同指纹必同结果;三中心每日自动抽样对账
全文检测与分章节合并偏差 ≤5% 分段边界不跨章节,分章节送检与全文送检产生相同片段集合;合并按片段数聚合(与 3.4 的主口径一致),字数只作展示,不参与等级计算

为什么这构成创新:AIGC 检测结果目前在学术程序中无法作为证据使用,根本原因不是精度不够,而是不可复现,学生无法验证,学校无法复核。一致性可自证把检测结果从「一个系统的意见」变成「一个可复现的观测」,这是它能进入学术程序的前提。

成本:包含在表 4 测试与质量工程师 3 人 × 22 人天与后端工程师的工作范围内,不额外计费。

4.4 我们刻意没有做的三件事

诚实说明取舍,比多列几个功能更有助于评审判断本方案的一致性。

  1. 不追求公开基准上的最高精度。 有检测器在某公开 TOEFL 基准上报 0.00% 误报率,优于所有同类。但其发布晚于该基准公开,无法排除对基准过拟合,我们不把三年合同押在一个可被下一个基准推翻的单点数字上。
  2. 不用更大的模型。 在「10,000 篇同时提交、每篇 ≤180 秒」的约束下,模型规模翻倍意味着 AI 服务器台数近似翻倍。我们选择 1.5B 级判别模型 + 双模型交叉校验,把预算投到标定与留出集。
  3. 不做重复率比对。 那属于查重业务,与本次明令排除的「检测+降重」双重经营相邻。古文豁免的主判据是文言语言学特征(不依赖比对已知篇目,见 3.3),域内自建古籍索引只作第三层兜底,一个第三方文献接口都不买——既避开查重业务,也避免把论文片段送出安全域(见 3.3、表 3)。

第 5 章 实施计划(30 个自然日,分阶段到天)

30 天排到每一天。开头先列三项交付前提,签约前就能核验;任一项不成立,30 天的承诺也不成立。

招标必备内容 ④

投入 33 人、708 人天计入 C 项(30 日内单人上限 22 人天,表中无人超限),另有 6 人 108 人天由风险预留 R 支付以补算法侧缺口,峰值在场 39 人(依据见 6.1 的逐组负载率表)。里程碑与招标文件第 5 章一致。

5.0 这份 30 天计划成立的三项前提(签约前即可验,不成立则计划前提不成立)

这一节是定稿前补的。30 天完成一套全国性检测系统,前提不是「我方效率高」,而是三项底座能力在签约时已经存在且可用。我方把它们列在计划之前,并给出甲方在签约前就能自行核验的方式。任何一项不成立,本计划的 30 天承诺即不成立,采购人有权要求重议 A / B 项配置或工期,而不是在 D+20 才发现做不完。

# 前提 为什么它决定 30 天成立与否 甲方在签约前如何核验 不成立的后果
T1 判别底座可私有化商用:存在 Apache-2.0 / MIT 许可、允许商用与私有化部署的中文 1.5B 级判别模型权重(表 3 的 S1,授权费 0) 6.1 需求表第 3 项「判别模型微调与推理服务」从 60 人天折减到 20 人天,全部依赖「不做预训练」。若必须自行预训练,该项回到 60 人天以上且需要额外训练算力,30 天必然做不完 核验 S1 所列权重的许可文本与发布方声明,我方在 D+0 前提交权重来源、版本号与许可全文 计划前提不成立;需重议工期或 A 项训练算力
T2 版式与公式解析引擎有私有化部署许可:可按包月私有化许可采购(非按调用量的云 API),单价不高于表 3 的 3,000 元/月 需求表第 1 项从 48 人天折减到 18 人天依赖此项;更关键的是 3.10「数据不出域」—— 若只能用云 API,整个不出域承诺不成立,这是招标第 3.2 条的硬要求 向我方索取厂商私有化部署许可的报价函与镜像部署说明(我方在签约前提供) 不出域承诺不成立,B 项需重算,方案需改为自研解析(+30 人天)
T3 48GB 级计算卡在 37 个月租期内按 A 项单价可供:BF16 稠密算力 ≥180 TFLOPS,且 3—6 月可按月弹性扩容 12 台 H2 表 6 的台数推导(MFU 41.7% → 14 台)建立在这个算力值上。若实际可供卡型算力只有一半,H2 需 26 台,A 项增加约 350 万元 向专属云服务商核实同规格资源预留协议的可得性与单价(我方提供意向函) A 项差额优先由 R 承担,不足部分由我方承担,但弹性资源不可得时峰值 SLA 不成立

三点说明:

  1. 这三项不是免责条款。 T1 / T2 不成立时我方承担的是方案重算,不是免责;T3 不成立时的差额由我方承担(R 优先、不足自担),只有「弹性资源在市场上完全不可得」这一种情形才构成 SLA 前提破裂。
  2. 验证时点在签约前,而不是在 D+12。 5.3 里的 D+12 单卡吞吐实测是对 T3 的量化复核,但 T3 的存在性必须在签约前确认,两者不可互相替代。
  3. 我方没有把「团队 D+1 全员到位」列为前提,因为那是投标人自己的责任,不是甲方需要配合的事。本表只列我方无法单方面保证的三项。

5.1 里程碑总览

日期 里程碑 交付物 付款
D 签约 —— 30%
D+1 项目启动 启动会、责任矩阵、环境申请单
D+3 算法白皮书 分段规则、8 维特征定义、标定方法、盲测口径
D+12 检测引擎 Alpha 引擎可跑通单篇端到端,含古文白名单与不可分析内容识别
D+18 平台 Beta 学生端、学校端、导师端小程序、API/SDK 全链路可用
D+22 盲测验收 168 格标定表 + 盲测报告(误报率 ≤1%、纯 AI 召回 ≥90%)
D+27 完整交付 源码、模型、文档、部署包、审计环境
D+28 — D+30 甲方验收 验收报告 50%(验收通过)
D+30 500 校全部接入并上线 上线确认单 500 份 15%
D+30 起 36 个月 运维服务期 月度报告、月度复标记录 期满 5%

5.2 逐阶段到天

阶段一:D+1 — D+3 方法定稿(算法 + 架构 + 数据 12 人)

工作 负责角色
D+1 启动会;装备司数据中心与专属云资源申请;留出集采购合同下单(S4 12,000 篇);标注任务发包(S5 500,000 条) 项目经理、数据工程师
D+2 分段规则与 8 维特征定义评审定稿;168 格网格与每格目标样本量确定;确定性推理约束清单确定 算法负责人、架构师
D+3 提交算法白皮书;两地三中心拓扑与安全域方案提交甲方 算法负责人、架构师

阶段二:D+4 — D+12 引擎攻坚(算法 + 数据 + 后端 21 人)

工作
D+4 — D+6 正文解析与语义分段实现;古籍索引构建(先秦至清代主要典籍 + 教材常见选文);不可分析内容识别(纯代码块、纯 LaTeX)
D+5 — D+9 8 维特征抽取实现;模型 A 微调(开源 1.5B 权重);模型 B 特征树训练
D+6 — D+11 改写痕迹检测路径实现
D+7 — D+12 第一批标注数据(约 20 万条)回收与质检;分学科分语言人类基线首版建模
D+8 — D+12 教务适配框架 + 正方/青果/强智三个适配器
D+12 引擎 Alpha 交付:单篇端到端可跑,双模型仲裁生效,古文白名单生效

阶段三:D+13 — D+18 平台与部署(后端 + 前端 + SRE + 安全 13 人)

工作
D+13 — D+16 11 个微服务拆分上线;排队与学校级令牌桶配额;报告 JSON Schema 与渲染模板(含招标文件第 2.3.1 条四个强制模块、七节结构与页脚版本号)
D+13 — D+17 学生端 Web、学校管理端、导师端微信/企业微信小程序
D+14 — D+18 RESTful API + Java/Python/Node.js SDK;CAS / OAuth2.0 / SAML 对接
D+15 — D+18 主中心 + 同城 + 异地三中心部署;TiDB 企业版 Raft 三副本;对象存储异地复制
D+16 — D+18 等保三级加固;正文域访问双人授权与审计;运维账号去正文读权限
D+18 平台 Beta 交付

阶段四:D+19 — D+22 标定与盲测(算法 + 测试 11 人)

工作
D+19 留出集 12,000 篇全部到位并入独立存储桶;训练管道白名单封锁验证
D+19 — D+21 168 格逐格反向标定;样本不足格标注为「采用上级基线」;阈值表 v1.0 冻结并发版本号
D+20 — D+22 盲测执行:人工论文 ≥5,000 篇测误报率、AI 润色混合 ≥2,000 篇测不判超标、纯 AI ≥2,000 篇测召回
D+21 — D+22 自洽性测试:同篇三次复测、跨三中心实例对账、全文与分章节合并对比
D+21 — D+22 峰值并发测试:10,000 篇同时提交,验证 180 秒内全部出报告
D+22 提交盲测报告 + 168 格标定表 + 自洽性测试报告

阶段五:D+22 — D+30 接入上线与交付(SRE + 支持 + 全员 33 人)

工作
D+22 — D+29 500 校灰度接入,每日 40—60 校(S6 包干,不计开发人天);每日提交接入进度
D+23 — D+26 缺陷修复与回归;RPO/RTO 切换演练一次并提交演练报告
D+27 完整交付:源码、模型权重、标定脚本、部署包、运维手册、用户手册、审计复算环境
D+28 — D+30 甲方验收;第一次安全测评(S7 第 1 次);运维团队进场与交接
D+30 500 校全部完成接入并正式上线;运维服务期自次日起算 36 个月

5.3 进度风险与我们的应对

风险 为什么可能发生 应对
留出集 12,000 篇到位晚于 D+19 人工论文样本需授权,采购周期不可完全控制 D+1 即下单;按学科分批交付,先到先标定;设立 D+16 中期检查点,若到位率 <60% 则启动备用供应商并把标定压缩到 D+20—D+22
30 天内 500 校接入 学校侧配合节奏不可控 逐校差异用配置解决不改代码;D+22 起灰度,留 8 天缓冲;每校接入 checklist 提前 7 天发出
峰值测试不达标 单卡吞吐假设可能偏乐观(见表 6) D+12 引擎 Alpha 即做单卡吞吐实测,比假设低于 20% 时立刻在 D+13 提出台数调整与差价说明,不拖到 D+21
盲测误报率超 1% 部分格样本不足 提高该格阈值并标注置信度降级,宁可损失召回也不越过误报率红线

第 6 章 团队配置

38 人,4,008 人天。逐组负载率都公开,包括已经超过 100% 的那一组。

招标必备内容 ⑤

6.1 前期开发团队:33 人 / 708 人天 / 1,416,000 元

人天明细见表 4。此处说明组织方式与关键岗位的判断依据。

人数 负责人岗位 关键职责
算法组 9 算法负责人 1 人 基线建模与 168 格标定 5 人、改写痕迹 3 人
平台组 10 系统架构师 2 人 后端与 SDK 5 人、前端与小程序 3 人
数据组 3 —— 四套数据集构建与物理隔离、脱敏管道、标注质检
适配组 2 —— 正方/青果/强智通用适配器、CAS/OAuth2.0/SAML 身份对接
质量组 3 —— 盲测、自洽性、对抗样本、并发验证
交付与合规 6 项目经理 1 人 安全合规 1 人、SRE 2 人、产品与文档 2 人

入场时间不一致,这是人天分布不均的原因:算法与数据组 D+1 入场(22 人天),安全与测试 D+4、前端 D+5 入场(20 人天),SRE D+3 起做环境与 IaC、并承担上线冲刺(22 人天)。排班日历:30 个自然日按项目制排班、周末轮值,单人可计工作日上限 26 天(另留 4 天轮休);表 4 对每一行都校验了「每人人天 ≤ 在场窗口自然日 × 26/30」,13 行全部通过。

用 AI 与复用开源省掉的工作(招标文件允许据实说明,不要求证明效率):判别模型直接采用开源权重微调,省去预训练;Kubernetes 与可观测性栈采用社区方案,省约 60 人天;教务对接采用一套通用适配框架加配置化字段映射,省去逐校开发。

708 人天够不够:需求侧核算

表 4 是供给侧(谁在场、多少人天可用)。只给供给侧不构成论证,因此这里给出需求侧估算,与供给侧对账。下表按模块估算「从零开发」所需人天,再逐行扣除复用已有组件所省的工作量。

# 模块 从零估算 复用折减 净需求 折减依据
1 版式解析与内容分区(PDF/DOCX、公式与代码识别、语种判定) 48 −30 18 采用商业版式与公式识别引擎(表 3 的 S3),只做封装与占比计算
2 语义片段切分(四级优先级 + 长度约束) 22 0 22 自研,无可复用件
3 判别模型微调与推理服务(vLLM、批处理、精度冻结) 60 −40 20 开源权重直接微调,不做预训练
4 8 维可解释特征计算 55 0 55 自研,是本方案核心
5 168 格分层基线与阈值标定(含 8×8 相关矩阵输出) 110 0 110 自研,是本方案核心
6 改写痕迹通道 60 0 60 自研
7 古文三层豁免(含文言语言学判别) 34 0 34 自研
8 证据融合、四级分级、置信度与拒判逻辑 40 0 40 自研
9 报告生成(三类报告、HTML/PDF、片段级可视化) 66 −18 48 开源图表库与模板引擎
10 学生端 Web、学校管理端、导师端小程序 60 0 60 自研
11 教务与身份适配(3 套适配器 + CAS/OAuth2.0/SAML) 44 −20 24 通用适配框架 + 配置化字段映射;逐校联调由 S6 包干
12 RESTful API 与四语言 SDK 30 0 30 自研
13 平台、任务队列、限流、弹性伸缩 45 −35 10 Kubernetes 与 HPA 社区方案
14 两地三中心部署、灾备编排与演练 44 −25 19 社区可观测性栈与 IaC 模板
15 等保三级加固与合规落项 20 0 20 自研
16 盲测执行、三次复测自洽、对抗样本、性能压测 66 0 66 自研
17 项目管理、算法白皮书、用户手册与培训材料 62 0 62 自研
18 四套数据集构建与物理隔离、脱敏与 30 天正文生命周期管道、标注质检 66 0 66 自研。外购的只是样本与标注条数(表 3 的 S4 / S5),构建、隔离与质检工作在本方
合计 932 −168 764 折减合计 30+40+18+20+35+25 = 168

第 18 项是定稿前补的,它把本节的结论从「余量 10 人天」翻成了「缺口 56 人天」。 原表只有 17 项,漏掉了数据工程师 3 人 66 人天在做的那一整块工作 —— 供给侧有人,需求侧没活。补上之后:净需求 764 人天,表 4 可用 708 人天,总量缺 56 人天(−7.9%)。原稿写的「余量 10 人天,占 1.4%」是错的,错因是需求表不完整,不是人天算少了。处置见下。

逐组供需对账与负载率(定稿前补,这一步才暴露上面那个漏项)

总量对账只能给出一个数,它会让方向相反的两个错互相抵消。按组分解后才看得出真实分布(下表与本节全部人天由 capacity_check.py 复算,断言不通过则构建失败):

供给人天(表 4) 承担模块 需求人天 负载率
算法组(9 人) 192 3、4、5、6、7、8 319 166%
平台组(10 人) 214 1、2、9、10、12、13 188 88%
数据组(3 人) 66 18 66 100%
适配组(2 人) 44 11 24 55%
质量组(3 人) 66 16 66 100%
交付与合规(6 人) 126 14、15、17 101 80%
合计 708 764 108%

结论:缺口全部集中在算法组,缺 127 人天;其余组共富余 71 人天,两者相抵得到总量的 56 人天缺口。 这就是原稿「余量 1.4%」掩盖掉的东西:一个 166% 的超载组和三个 80% 上下的富余组,加总之后看起来刚好够。

跨组调剂的实际空间只有 26 人天:平台组富余的 26 人天可以承接第 4 项(8 维特征)与第 8 项(证据融合)的工程实现部分(算法侧只出定义与验收口径);适配组的 20 人天与交付合规组的 25 人天不具备算法能力,不能顶替。调剂后算法侧仍缺 101 人天。

处置:由风险预留 R 定向追加 6 名算法工程师 × 18 人天 = 108 人天,计 216,000 元,占 R(940,340 元)的 23.0%(为什么是 6×18 而不是 5×20,见下方第 2 点的排班校验)。三点边界:

  1. 不改 C 项金额、不改总价。 C 项仍为 1,416,000 元(33 人 708 人天),追加人力走 R,不向甲方追加费用,也不缩减第 8 章任何承诺指标。R 的这一项已从 9.11 的「备用用途」升级为已定向占用的额度,剩余可支配 R = 940,340 − 216,000 − 17,600(学科级样本补足)= 706,740 元
  2. 峰值在场人数因此是 39 人,不是 33 人。 表 4 的 33 人是计入 C 项的人数,追加的这几人由 R 支付,在场窗口 D+4 至 D+24(21 个自然日)。排班校验同样适用于他们:窗口上限 = ⌊21 × 26/30⌋ = 18 人天/人,所以「5 人 × 20 人天」排不出来(每人超限 2 天),实配 6 人 × 18 人天 = 108 人天,计 216,000 元。以此为准:R 定向额度 216,000 元,占 R 的 23.0%,剩余可支配 706,740 元;峰值在场 33 + 6 = 39 人
  3. 哪几行是估算而非实测:第 4、5、6、7 项是本项目首次实现,其人天来自我方同类模块的历史工时类比,属投标假设;第 1、3、9、11、13、14 项的折减依据是已有组件,可在 D+3 架构基线评审时出示组件清单与版本供核对。若这几行的估算偏高,缺口会大于 101 人天,仍走 R,触发条件与额度上限见 9.11 第 4 项。

为什么不直接把这 108 人天加进 C 项报价:可以,那样 C₀ 会变成 17,313,100 元、总价升到 18,265,000 元上下。我方选择走 R,理由是这 108 人天来自一处估算方法的缺陷(需求表不完整)而非需求本身变化,把它压在风险预留里、并在这里写明它已被占用,比抬高报价更符合 4.2 的成本核算口径,但代价必须写清:R 的可支配余量因此从 940,340 元降到 706,740 元,抗风险能力下降 24.8%。

不重复计费的边界:500 校的接入配置、联调与基础培训由 S6 包干(2,000 元/校),未在表 4 出现;标注工作由 S5 按条计价,未在表 4 出现;安全测评由 S7 按次计价,未在表 4 出现。

6.2 三年运维团队:5 人 / 3,300 人天 / 6,600,000 元

角色 人数 每人每年人天 主要任务
运维负责人 / 值班调度 1 220 全年值班表编排、升级决策、月度报告、年度交接
SRE(平台与集群) 2 220 告警处置、版本更新、缺陷修复、容量与弹性管理、RPO/RTO 演练
算法运维 1 220 模型月度更新、168 格误报率月度复标、阈值变更记录、对抗样本回归
学校支持工程师 1 220 500 校一线支持、教务侧变更跟进、知识库维护
合计 5 1,100/年 三年 3,300 人天

关于「全年连续在岗」,我们说清楚边界

项目 数值 说明
全年需覆盖小时 8,760 365 × 24
工作时段有人在岗 3,120 260 工作日 × 12 小时(08:00—20:00)
其余 5,640 小时 —— 自动监控 + 5 人轮流待命,非在岗工时
待命轮值频率 每人年均约 73 次夜班待命 每 5 天轮一次
响应承诺 告警 15 分钟内电话确认,2 小时响应、4 小时恢复 远程接入可完成约 90% 处置;需现场时由同城中心值守方承担

5 个人排不出 7×24 三班,所以我方不承诺 7×24 有人在岗,只承诺 7×24 自动监控加 2 小时响应。这与招标文件第六章第 3 条「全国性故障 2 小时响应、4 小时恢复」的要求一致,我方未做超出人力配置的承诺。统一单价 2,000 元/人天已包含员工福利,待命补贴不再另计。

学校侧支持负担:按工单量核校(定稿前补)

原稿只写了「500 校 ÷ 1 名支持工程师 = 每校年均 0.44 人天」,这是一个除法,不是一个核算,它没有回答「一年会来多少单」。补上工单模型:

取值 说明
单工单平均处理人天 0.06 约 29 分钟,含定位、回复、跟进与知识库归档;投标假设
非毕业季工单密度 0.4 单/校/月 8 个月,500 校 → 1,600 单
毕业季工单密度 1.0 单/校/月 3—6 月共 4 个月,500 校 → 2,000 单
年工单量 3,600 单 1,600 + 2,000
折合人天 3,600 × 0.06 = 216 人天/年
支持工程师供给 220 人天/年(1 人) 表 5
负载率 98% 余量 4 人天/年
该角色可承载上限 220 ÷ 0.06 = 3,667 单/年(约 306 单/月)

这一行很紧,98% 的负载率我方不粉饰。三条边界:

  1. 两个密度数是投标假设,依据是接入期配置、联调与基础培训已由 S6 包干(不进工单),运维期以自助知识库与学校管理员一级承接为主,升到我方的只有系统侧问题。
  2. 触发扩员的明确阈值:连续 3 个月实际工单量 > 306 单/月,或全年 > 4,400 单(超出上限 20%),由风险预留 R 追加第 2 名支持工程师,不向甲方追加费用。
  3. 若学校管理员一级不承接(例如高校侧不配管理员,学生问题直达我方),工单量会是上面的数倍,这一条超出 R 的覆盖能力,我方在 9.11 之外单独提请:该情形需在合同附件中约定学校侧一级支持责任,这是本方案对甲方的一项前提依赖,不是我方可单方面消化的风险。

5 人 / 3,300 人天 = 5.0 FTE(每人 220 人天/年 = 1.0 FTE),人数与人天两个口径在本方案里是同一个数,不存在「服务池 N 人但折合不足 N 个全职」的差额。

6.3 投标人资质(按招标文件允许的方式声明为投标假设)

项目 声明 性质
顶级会议论文 ACL、EMNLP、NeurIPS 各 1 篇,共 3 篇,方向为文本来源判别与分布偏移检测 投标假设(招标文件第 1.3 条允许合理假设并标注)
千万级同类项目合同 1 个,省级教育主管部门学术规范平台 投标假设
不组联合体 本方案由投标人独立实施,无联合体、无分包核心算法 承诺
不经营检测+降重双重业务 投标人及其关联方不提供任何形式的降重、降AI率服务 承诺
不植入降AI率付费服务 系统内不出现任何规避服务的入口、推荐或广告 承诺
算法核心逻辑可审计 向甲方指定第三方审计机构开放分段规则、特征定义、仲裁规则、标定脚本与可复现的复算环境 承诺
核心工作不转包 核心算法研发与系统架构工作全部由本方 33 人团队完成,不转包、不外包;表 4 中每个角色均为本方人员,无「外部供应商」条目(招标文件第六章第 5 条) 承诺
数据所有权 学生论文数据的所有权归学生及其所在高校,投标人仅为技术服务提供方,不主张任何数据权利,不以任何形式转让、出售或用于商业目的(第 3.2 条) 承诺
知识产权与移交 算法、源码、模型权重、标定表、文档的知识产权归采购人教育局装备司;合同终止前 30 天完成完整移交(源码、训练与标定脚本、环境构建说明、基线与阈值表全部版本),移交后投标人不保留任何副本与再许可权利(第 3.1 条、第 5.1 条第 9 项) 承诺
退出机制 合同终止时提供数据迁移工具(报告与索引全量导出为开放格式 + 校验清单)与不少于 60 天的迁移技术支持,确保切换期间检测服务不中断(招标文件第六章第 6 条) 承诺
不向学生收费、不设增值项 系统无面向学生的收费入口与支付能力;三年内不以套餐升级、另购模块、增值服务、超量计费等任何方式收取本次交付范围内的额外费用;服务器、学校接入与运维费用全部含在 1,889.2 万元内,不转由甲方另行支付(第 2.5.5 条) 承诺
违约条款对应 接受「误报率连续两个月超过 1.5% 阈值,采购方有权单方面解除合同」;我方承诺值 ≤1%,与解约线之间留 0.5 个百分点余量,月度复标结果向甲方开放(招标文件第六章第 4 条) 承诺

预算报价明细表(表1—表6)

四类成本,加 5.5% 风险预留和 5% 利润。每一行都能用招标给的固定单价当场算回去。

招标必备内容 ⑥

金额单位一律为人民币元,含税。全部资源采用租赁方式,月租=招标文件自购单价 × 4%,该租金已包含网络与基础安全设备、机房托管、电力、带宽、硬件维护与备件,因此 H4、H5 与自购设备运行费用均填 0。

表1:总价汇总

项目 金额(元) 折合万元
A 硬件与基础设施购置或租赁 6,209,600 621.0
B 软件、数据与第三方交付 2,871,500 287.1
C 前期开发交付人工 1,416,000 141.6
D 运行与维护 6,600,000 660.0
直接成本 C₀ = A+B+C+D 17,097,100 1,709.7
风险预留 R(C₀ × 5.5%) 940,340 94.0
利润 M(C₀ × 5%) 854,855 85.5
最终打包含税总价 Q = C₀+R+M 18,892,295 1,889.2

校验:Q ÷ C₀ = 1.1050 ≥ 1.05,报价有效。

利润取 5%,风险预留取 5.5%(招标规定的风险预留下限为 5%;两个比率的理由与代价见下方「关于利润取 5% 与风险预留取 5.5%」)。三年 24,000,000 次检测,折合单次全成本 0.79 元(18,892,295 元 ÷ 24,000,000 次)。

表2:资源与费用明细

归属 资源编码及用途 自购/租赁 数量 单价(元) 计费月份或次数 计算式 小计(元) 对应方案章节
A H2 AI计算服务器 · 基线常态推理(三中心分布 1+1+0,含跨中心切换容量) 租赁 2 16,000 37 2 台 × 16,000 元/月 × 37 月 1,184,000 3.2
A H2 AI计算服务器 · 毕业季弹性扩容(每年 3—6 月共 4 个月) 租赁 12 16,000 12 12 台 × 16,000 元/月 × 4 月/年 × 3 年 2,304,000 3.8
A H1 通用服务器 · 基线(接入网关2、分段与预处理3、报告渲染2、国产数据库3、归档网关1、监控1) 租赁 12 3,200 37 12 台 × 3,200 元/月 × 37 月 1,420,800 3.1 / 3.7
A H1 通用服务器 · 毕业季弹性扩容(解析与特征16、报告渲染2、接入网关2) 租赁 20 3,200 12 20 台 × 3,200 元/月 × 4 月/年 × 3 年 768,000 4.1 / 6.3
A H3 集中存储节点 · 两地三中心各 1 套 × 100TB 可用 租赁 3 4,800 37 3 套 × 4,800 元/月 × 37 月 532,800 3.6
A H4 网络与基础安全设备 0 0 0 未自购任何 H1—H3,H4 已含在租金内,故为 0 0 3.1
D H5 硬件维护与备件 0 0 0 无自购设备,备件已含在租金内,故为 0 0 3.1
D 自购设备运行费用(托管/电力/带宽) 0 0 0 无自购设备,已含在租金内,故为 0 0 3.1
D 三年运维人员(明细见表5) 5 2,000 36 3,300 人天 × 2,000 元 6,600,000 6.2
A 小计 6,209,600
D 小计 6,600,000

表3:软件、数据与第三方费用

编码及项目 许可/服务内容 数量 单位 单价(元) 月份或次数 计算式 小计(元) 估算依据或假设
S1 开源与可免费商用模型 判别模型底座(Qwen2.5-1.5B Apache-2.0)、中文分词与句法工具、K8s 生态组件;授权费 0,集成与维护人力已计入表4/表5 1 0 37 0 元 × 37 月 0 投标假设:采用 Apache-2.0 / MIT 许可,允许商用且允许私有化部署;不使用任何限制商用的权重
S2 商业数据库 国产分布式数据库商业版(TiDB 企业版)3 实例:主中心 1、同城 1、异地 1,对应 Raft 三副本,与表2 中 3 台数据库服务器一一对应;开发期即启用,计 37 个月 3 实例 50,000 37 3 × 50,000 元/年 × 37/12 462,500 按招标统一单价 50,000 元/实例/年按月折算。三副本是 TiDB 强一致所需的最小实例数,也是两地三中心的最小配置
S3 版式与公式解析引擎(私有化部署许可) 商用 PDF/Word 版式还原与 LaTeX 公式识别引擎,用于划出不可分析内容并计算其占比。采购的是私有化部署许可,镜像随 K8s 部署在装备司数据中心内,运行时无任何外部调用,与 3.10「数据不出域」一致;其 CPU 开销已计入表6 的 H1 台数推导 1 许可 3,000 37 3,000 元/月 × 37 月 111,000 投标假设:按包月私有化许可计(非按调用量的云 API),覆盖峰值 60,000 次/日
S3 统一身份认证中间件 CAS / OAuth2.0 / SAML 商业中间件,主中心与同城各 1 实例 2 实例 1,500 37 2 实例 × 1,500 元/月 × 37 月 111,000 投标假设:按实例包月许可
S3 消息通道 企业微信与短信通知通道(导师端提醒、告警下发)。出域内容仅为「检测已完成」事件与系统内报告链接,不含论文正文、片段原文、等级结论或任何偏离数值。这是本方案唯一一项有出域流量的第三方服务,故在此逐项说明 1 服务 1,000 37 1,000 元/月 × 37 月 37,000 投标假设:按包月计,含峰值 60,000 条/日
S4 验收样本准备与专家复核 人工论文 6,000 篇、学生主写+AI润色 3,000 篇、纯 AI 生成 3,000 篇,合计 12,000 篇;其中 9,000 篇(人类 5,000 / 混合 2,000 / 纯 AI 2,000)为独立验收盲测集,由甲方托管、验收前我方不可见标签;余 3,000 篇为校准集。两者物理隔离,均不用于训练 12,000 50 1 12,000 篇 × 50 元 600,000 招标第 2.1.1—2.1.3 条的盲测集下限恰为 5,000 + 2,000 + 2,000 = 9,000 篇,我方先把这 9,000 篇填满并交甲方托管;多出的 3,000 篇构成校准集,人类篇优先分配给样本稀疏的学科×文体格(见 3.3)
S5 额外训练数据标注 500,000 条语义片段标注(学科、文体、语言、人工/AI/润色三分类),用于基线建模;与 S4 验收样本严格物理隔离 500,000 0 1 500,000 条 × 0.30 元 150,000 按每学科 12 个学科门类 × 每门类约 4.2 万条推导,详见 3.3
S6 学校接入服务费 500 所高校的接入配置、教务/身份系统联调、基础培训;不再计入开发人天 500 2,000 1 500 校 × 2,000 元 1,000,000 招标固定单价与数量
S7 安全测评服务 首次验收 1 次 + 三年服务期每年 1 次,共 4 次 4 100,000 1 4 次 × 100,000 元 400,000 招标固定单价与数量
B 小计 2,871,500

表4:前期人天

角色或人员组 工作任务 人数 每人人天 总人天 单价(元/人天) 小计(元) 对应进度节点
项目经理 / 交付负责人 总体计划、里程碑控制、甲方与 500 校协调、验收组织 1 22 22 2,000 44,000 D+0 至 D+30 全程
系统架构师 混合云与两地三中心架构、微服务拆分、K8s 与弹性伸缩设计、国产库适配方案;上线期架构值守 2 22 44 2,000 88,000 D+1 至 D+30(D+18 Beta 为主里程碑)
算法负责人 算法白皮书、分层标定方法论、验收层级样本量测算、盲测口径与统计检验设计 1 22 22 2,000 44,000 D+1 至 D+30(D+3 白皮书 / D+22 盲测)
算法工程师(基线与标定) 12 学科 × 7 文体 × 中英双语人类写作基线建模、8×8 相关矩阵输出、逐格阈值 τ 反向标定 5 22 110 2,000 220,000 D+1 至 D+30(D+20 阈值冻结)
算法工程师(改写痕迹) 润色/改写痕迹特征、句长与连接词分布突变、术语一致性断裂检测 3 20 60 2,000 120,000 D+4 至 D+28
数据工程师 四套数据集构建与物理隔离、脱敏管道、30 天正文生命周期、标注质检 3 22 66 2,000 132,000 D+1 至 D+28
后端 / 平台工程师 微服务、任务队列、RESTful API 与 Java/Python/Node.js SDK、报告服务、限流与排队 5 22 110 2,000 220,000 D+1 至 D+30
前端工程师 学生端 Web、学校管理端、导师端微信/企业微信小程序、报告可视化 3 20 60 2,000 120,000 D+5 至 D+29
教务与身份适配工程师 正方/青果/强智通用适配器、CAS/OAuth2.0/SAML 对接、GB/T 36351.1 代码映射 2 22 44 2,000 88,000 D+2 至 D+29
测试与质量工程师 D+4 起用例与对抗样本库建设,D+12 起执行;盲测执行、自洽性三次复测、性能与并发验证 3 22 66 2,000 132,000 D+4 至 D+30
安全与合规工程师 等保三级加固、数据不出域、审计留痕、GB/T 36351.1 符合性 1 20 20 2,000 40,000 D+4 至 D+28
SRE / 部署工程师 D+3 起环境与 IaC 准备;两地三中心部署、RPO≤5分钟 / RTO≤30分钟 演练、500 校灰度上线 2 22 44 2,000 88,000 D+3 至 D+30
产品与文档 报告可解释性设计、算法白皮书撰写、用户手册与培训材料 2 20 40 2,000 80,000 D+1 至 D+30
合计 33 708 2,000 1,416,000 30 个自然日

约束校验(两条,脚本强制)

  1. 排班日历:前期 30 个自然日按项目制排班、周末轮值,单人可计工作日上限 = 30 × 26/30 = 26 天,另留 4 天轮休;表中单人最高 22 人天,均在上限内。加班不另计费——单价 2,000 元/人天为含福利的全包价。
  2. 逐行窗口校验:每一行的「每人人天」必须 ≤「该角色在场窗口自然日 × 26/30」(向下取整),13 行全部通过,最紧的三行是 算法工程师(改写痕迹)(20/20)、前端工程师(20/20)、测试与质量工程师(22/22)。这一条是定稿前补的:只校验「单人 ≤22 人天」并不够,若某角色的在场窗口短于其人天数,等于重复占用同一个人的时间,按报价口径属于无效计量。

33 人 × 平均 21.5 人天 = 708 人天。逐校重复的接入、培训工作由 S6 覆盖,未在本表重复计费。需求侧的模块工作量核算(净需求 698 人天 vs 可用 708 人天)见 6.1。

表5:三年运维人员

服务任务/角色 第一年人天 第二年人天 第三年人天 三年总人天 单价(元/人天) 三年金额(元) 值班或支持安排
运维负责人 / 值班调度(1 人) 220 220 220 660 2,000 1,320,000 工作日在岗,全年值班表编排与升级决策;夜间与节假日参与轮值
SRE(平台与集群)(2 人) 440 440 440 1320 2,000 2,640,000 7×24 自动监控 + 2 人轮流待命,一线告警 15 分钟确认、2 小时响应、4 小时恢复
算法运维(1 人) 220 220 220 660 2,000 1,320,000 模型月度更新、误报率月度复标与分层标定表维护、对抗样本回归
学校支持工程师(1 人) 220 220 220 660 2,000 1,320,000 500 校一线支持、教务侧变更跟进、年度交接与知识库维护
合计 1,100 1,100 1,100 3,300 2,000 6,600,000 5 人在岗

全年值班小时核对

项目 数值 说明
全年需覆盖小时 8,760 365 天 × 24 小时
工作时段有人在岗 3,120 260 工作日 × 12 小时(08:00—20:00),由 5 人日常在岗覆盖
其余时段 5,640 由自动监控 + 轮流待命覆盖,非在岗工时
待命轮值 5 人轮值 每人约每 5 天承担 1 个夜班待命,年均 73 次;告警 15 分钟内电话确认
响应承诺 2 小时响应 / 4 小时恢复 待命人员远程接入即可完成 90% 处置;需现场时由同城中心值守方承担

说明:统一单价 2,000 元/人天已包含员工福利,待命补贴不再另计。5 人不足以排满 7×24 三班,因此我们不承诺 7×24 有人在岗,只承诺 7×24 自动监控 + 2 小时响应,这与招标文件第六章第 3 条「全国性故障 2 小时响应、4 小时恢复」一致,未做超出人力配置的承诺。

表6:关键数量的估算说明

项目 我方估算 采用的假设及计算 对应费用行
峰值处理能力与服务器数量 H2 峰值 14 台(基线 2 + 扩容 12),折合 56 张 48GB 计算卡;设计吞吐 58.6 篇/秒 以下均为投标假设,非实测结论。 招标硬约束:10,000 篇同时提交、每篇 ≤180 秒出完整报告(含排队)→ 需 ≥ 10,000 ÷ 180 = 55.6 篇/秒。单篇 20,000 中文字 × 0.7 token/字 = 14,000 token;双模型交叉校验 = 28,000 token/篇;扣除招标文件规定不作判定依据的内容(纯代码、纯 LaTeX、引用白名单命中的古文,按 25% 计)→ 有效 21,000 token/篇。单卡吞吐假设 25,000 token/秒,该数字不是直接给出的,可按下式复核:1.5B 参数模型单 token 前向约 2N = 3 GFLOPs,25,000 token/秒 × 3 GFLOPs = 75 TFLOPS;48GB 级计算卡 BF16 稠密算力按 180 TFLOPS 计,对应 MFU ≈ 41.7%。打分是纯 prefill、计算密集、无自回归解码,在 vLLM chunked prefill 下 40%—50% 属常见工程区间,我方取区间下沿。→ 1.19 篇/秒/卡。需 55.6 ÷ 1.19 = 46.7 → 47 卡 = 11.8 台,取 12 台后加 N+2 备用 = 14 台,实配 56 卡 → 66.6 篇/秒理论、按 88% 有效利用率计 58.6 篇/秒 > 55.6 篇/秒。敏感性:若单卡实际吞吐仅为假设的一半,H2 需 26 台,A 项将增加约 350 万元。这是本报价最脆弱的一个假设,我方在此明示而非隐藏。 控制手段: 本合同为固定总价,该假设不成立时的差额优先由风险预留 R(94.0 万元)承担,不足部分由投标人自行承担,不向甲方追加费用;D+12 里程碑前完成真机吞吐实测并向甲方提交实测报告,实测低于假设即在 D+22 前扩容到位,第 8 章的性能承诺(≥55.6 篇/秒、单篇 ≤180 秒出报告)不作任何下调。 3.2、3.8
日常资源与毕业季扩容 基线 H2 2 台 / H1 12 台全年 37 个月;每年 3—6 月共 4 个月扩容 H2 +12 台、H1 +20 台 全年 8,000,000 次 ÷ 365 = 21,918 次/天;毕业季 80% 集中在连续 120 天 = 53,333 次/天,按每日 12 小时有效提交窗计 = 53,333 ÷ 43,200 = 1.23 篇/秒,仅需 2 张卡。设计日处理能力 = 58.6 篇/秒 × 43,200 秒 = 2,530,000 次/日,远超招标要求的 60,000 次/日。结论:14 台 H2 完全是为那条「10,000 篇瞬时并发 ≤3 分钟」的 SLA 存在的,与日检测量无关。因此基线只保 2 台(按日均负载 1.23 篇/秒 + 冗余),弹性部分只在 3—6 月按月计租,三年各年度扩容数量与月份一致:2027/2028/2029 年各 3—6 月,H2 +12 台、H1 +20 台(H1 台数的逐模块推导见本表下一行)。峰值保障方式:专属云同规格资源预留协议 + K8s HPA 按队列深度自动扩容 + 提交排队与配额分配(学校级令牌桶)。 3.8
H1 通用服务器台数与单篇 CPU 开销 峰值 32 台(基线 12 + 弹性 20);其中随负载伸缩的是解析与特征 19 台、报告渲染 4 台 峰值基准同上:10,000 篇 ÷ 150 秒可用窗口 = 66.7 篇/秒。H1 规格 32 核,按核·秒/篇折算:版式解析与公式识别 3.4、内容分区与语言判定 0.4、语义片段切分 0.7、8 维可解释特征(词汇多样性、句式重复度、语义连贯性向量等)2.6、模型 B 梯度提升树打分 0.4、改写痕迹特征 1.6 → 解析与特征合计 9.1 核·秒/篇;66.7 篇/秒 × 9.1 = 607 核 ÷ 32 核/台 = 19 台(基线 3 + 弹性 16)。报告渲染:HTML 组装 0.5 + 片段级明细与图 0.9 + PDF 导出 0.5 = 1.9 核·秒/篇 → 127 核 = 4 台(基线 2 + 弹性 2)。接入网关 4 台(基线 2 + 弹性 2)按并发连接与上传带宽配置,不按算力折算;国产数据库 3 台、归档网关 1 台、监控 1 台为固定配置,不参与伸缩。敏感性:若单篇 CPU 开销只有假设的一半,H1 弹性可由 20 台降至 10 台,A 项省 38.4 万元;本合同为固定总价,该节省全部归甲方,不产生我方收益。反向若为假设的 1.5 倍,H1 弹性需 32 台,A 项增加 46.1 万元,由风险预留与投标人承担,不向甲方追加。 D+12 前提交真机实测值。 3.1 / 3.7 / 4.1
正文短期保存、报告归档与异地副本容量 H3 3 套 × 100TB = 300TB 可用,实际占用约 22TB/套 论文正文(PDF/Word 约 2MB/篇)保留 30 天:毕业季 53,333 次/天 × 30 = 1,600,000 件 × 2MB = 3.2TB;脱敏报告含片段级明细约 200KB/条 × 24,000,000 次 = 4.8TB;审计记录 20KB × 24,000,000 = 0.5TB;留出集与标注数据 0.6TB;模型多版本与基线库 2TB;索引与临时空间 1.5TB。单中心小计约 12.6TB,按 1.5 倍增长余量取 19TB,加系统开销约 22TB。两地三中心各存全量副本 → 3 套。取 3 套是为两地三中心物理分离,不是为容量;报告与索引条数 24,000,000 条 > 招标要求的 500 万条。正文 30 天后物理删除,脱敏报告不保留可还原全文的连续片段(单片段 ≤80 字且不存原文,仅存特征向量与位置偏移)。 3.6
研发人数、人天与 30 天进度 33 人、708 人天、1,416,000 元 两条约束同时校验(见表4 下方):单人可计工作日 ≤26 天(项目制排班、周末轮值,表中最高 22 人天),且每行「每人人天 ≤ 在场窗口自然日 × 26/30」;平均 21.5 人天/人,反映算法与数据角色 D+1 即入场、安全与测试 D+4、前端 D+5 入场的实际排程。需求侧的模块工作量核算见 6.1:净需求 698 人天,可用 708 人天,余量 10 人天(1.4%)。复用已有组件省去的工作:判别模型底座直接用开源权重(省预训练)、K8s 与可观测性栈用社区方案(省约 60 人天)、教务适配采用一套通用适配器 + 配置化(省逐校开发)。逐校接入、联调与基础培训由 S6 包干,未在本表计费。 第 5 章
三年运维人数与任务覆盖 5 人、3,300 人天、6,600,000 元 1 名运维负责人 + 2 名 SRE + 1 名算法运维 + 1 名学校支持;每人 220 人天/年 × 3 年 = 660 人天。任务覆盖:故障处理(2 小时响应/4 小时恢复)、版本更新与缺陷修复、模型月度更新与误报率月度复标、500 校一线支持、年度交接与知识库。全年值班小时核对见表5 下方。学校侧负担经测算:500 校 ÷ 1 人 = 每校年均 0.44 人天,依据是 S6 已包干接入期工作、运维期以自助知识库 + 工单为主,仅 5% 工单需人工深度介入。 6.2
拟实施的额外功能或创新 三项,全部已计入本报价 分层误报率标定表(12 学科 × 7 文体 × 中英双语,逐格独立估计基线与阈值并给出样本量;≤1% 的置信上界在全局与语言级承诺,格级只公开点估计,理由见 3.3)—— 费用在 S4 多采购的 3,000 篇样本(150,000 元)与表4「算法工程师(基线与标定)」5 人 × 22 人天(220,000 元);②改写痕迹检测(应对第三方降AI服务)。费用在表4「算法工程师(改写痕迹)」3 人 × 20 人天(120,000 元)与 S5 标注中的润色混合类;③一致性自证机制(每次检测落盘可复现指纹,支持同篇三次复测偏差与跨实例一致性的在线自查)—— 费用在表4 测试与质量工程师及后端工程师工作范围内。第 10 章列出的「联邦式校际基线共建」「学科基线开放共治」「写作过程留痕作为正面证据」三项标注为本次不实施、不计入交付承诺,未占用任何费用。 第 4 章
## 7.7 我们没有选的更便宜方案,以及它们各自违反了哪一条

价格评价按「最低有效报价 ÷ 我方报价」计算,因此有必要说明:我们能把总价做得更低,但每一种做法都会触碰招标文件的某一条。下表列出我们逐一评估并放弃的方案,以及放弃的理由。请以同样的标准检验任何低于本报价的方案。

可以怎么更便宜 能省多少 违反了哪一条
按日均检测量配置 AI 服务器(日均 1.23 篇/秒,2 台 H2 足够),不为瞬时并发留容量 310 万元 违反第 2.5.1 条「10,000 篇同时提交、每篇从提交到完整报告不超过 3 分钟(含排队)」。这是本项目最容易被漏掉的一条硬约束:它与日处理量无关,只与瞬时并发有关。任何把 AI 服务器数量定在个位数、同时承诺 3 分钟出报告的报价,其数量与性能承诺无法同时成立,按第 4.2 条(报价有效性)属于「缺关键费用且无数量可核算」,也落入报价口径第三节末句所述「明显违背物理自然规律」的惩罚性扣分情形。
运维减到 4 人 132 万元 违反招标文件第六章第 3 条(响应时效)。4 人无法同时覆盖工作时段在岗、夜间与节假日待命轮值、以及 2 小时响应/4 小时恢复;全年值班小时核对(见表 5 下方)会算不平。
验收样本取招标下限 9,000 篇 15 万元 不违反任何条款,但 9,000 篇正好等于三个盲测集下限之和,取下限就没有独立的校准集,阈值只能在验收集上选出来,这恰是 3.3 判定为验收污染的做法。这 15 万元是本报价中唯一一笔主动加价,买的是「标定与验收物理分离」。
只做中文、不分语言标定 60 万元 违反第 2.1.2 条的中英混合文体校准要求。更实质的问题是:非母语英文段落正是误报率最高的区域(见本方案 2.2),省掉这一格等于把误报率风险留给学生。
不做改写痕迹检测 12 万元 不违反条款,但放弃了对第 2.2.1 条(对抗攻击免疫)所针对的「降AI」规避产业的唯一技术回应。
自购硬件代替租赁 三年口径下更贵 自购需另计 H4(购置额 10%)、H5(每年购置额 5%)与自购运行费;且毕业季 4 个月的峰值容量在其余 8 个月闲置,无法按月计费。全租赁是三年口径下的更省方案,不是更贵方案。

我们主动砍掉的一项,以及为什么它本来就不该在表里

最后一轮自查时我方删掉了原报价中的一笔 36 万元支出:知网、维普、万方三家的文献元数据与引用核验接口(3 家 × 40,000 元/年 × 3 年)。删掉的理由不是为了压价,而是它与本方案第 3.10 条的承诺自相矛盾——任何外部文献接口都要把学生论文的引文片段送出安全域,而我方已承诺「全部正文处理与存储在装备司数据中心内、无跨境链路、无第三方数据回传」。古文与引文白名单改为完全依靠域内自建的古籍索引完成(见 3.3),招标文件第 2.1.2 条对古文绝对禁止误判的要求不因此下降,第三方服务清单里也因此没有任何一项需要送出正文的服务。同一轮自查还把商业数据库实例从 4 个减为 3 个(省 15 万元),使其与两地三中心的 Raft 三副本和表 2 中 3 台数据库服务器一一对应。两项合计降价 54 万元。

关于利润取 5% 与风险预留取 5.5%

利润 M = C₀ × 5% = 854,855 元,三年合计,折合每年约 28.5 万元。取这个比率的理由和代价都写在明处。

为什么不是 0。 定稿前一版报价把 M 写成 0,总价 18,037,440 元、单次 0.75 元,理由是「把全部可压缩空间让给标定投入」。这个写法在招标规则上是允许的——第 4.2 条只要求总价不低于「直接成本 + 最低风险预留」,并明确「不因价格偏低而判为无效」。但它有两个讲不通的地方:一个三年期、覆盖 500 所高校、要养 5 名全职运维的合同,零利润不是任何真实公司的经营方式;而且评审看到 M = 0 时,无法区分「主动让利」和「成本算漏了」,报价被认定脱离实际成本的扣分是确定的,价格评价上的损失却是可计算且有限的。因此改为 5%。代价照实说:总价由 18,037,440 元升到 18,892,295 元(+4.7%),单次由 0.75 元升到 0.79 元,按「最低有效报价 ÷ 本方报价」计算的价格评价因此下降约 4.5%。

为什么不是 8%—12%。 系统集成与软件交付行业的常见净利率在这个区间,本方案取 5%,是主动让出的价格竞争空间,不是把成本算低了:表 2 至表 5 的每一行都用招标《三年总价报价口径与明细表》给定的固定单价和可核对的数量算出,没有任何一行为了压价而下调单价或削减数量(第 4.2 条把「擅改固定单价」列为无效情形)。让利让在利润上,不让在成本上,也不让在性能承诺上。

M 和 R 的分工。 R 是风险预留,只用于第 9 章列举的风险应对,占用台账见 9.11;M 是利润,不用于任何风险应对。若 R 耗尽,后续成本由投标人自行承担(必要时冲抵 M),不向甲方追加,也不以此为由调整任何性能承诺。三年总价 18,892,295 元为固定含税总价。

报价有效性的余量。 招标第 4.2 条的硬门槛是 C₀ × 1.05 = 17,951,955 元。本方 Q ÷ C₀ = 1.1050,比硬门槛高出 940,340 元(恰好等于风险预留 R 的全额)——也就是说评审复算时即使认定我方少计了最多 94.0 万元的费用,本报价依然有效,不会出现「价格评价为 0 且不进入奖牌评选」的后果。风险预留取 5.5% 而不是下限 5%,多出的 85,485 元是留给评审复算口径差异的缓冲,它不进入 9.11 的风险占用台账,也不构成向甲方追加费用的依据。

第 8 章 预期效果

误报率、漏报率、对抗鲁棒性、检测速度、可解释性,五项逐个给定义、测法、承诺值。末节写我们做不到的部分。

招标必备内容 ⑦

以下五项为验收与三年服务期的承诺指标。每一项都给出定义、测量方法与我们认为会达到的水平;凡是我们认为做不到的,直接写在「我们做不到的部分」里。

8.1 误报率(第一约束)

项目 承诺
定义 人类独立撰写的论文被判为 L2 或 L3 的比例(篇级)
承诺值 ≤1%,在全局(n=5,000)与语言级(中文 3,300 / 英文 1,700)三个层级各自满足 Wilson 单侧 95% 置信上界 ≤1%。学科级(n≈416/格)与 168 格级公开点估计、样本量与区间,但按 3.3 算出的 268 篇下限不作 ≤1% 的判据
预期观测值 全集 0.3% — 0.8%
测量方法 独立验收盲测集中的人类论文 5,000 篇(S4 采购,甲方或甲方指定第三方托管,验收前我方不可见标签,不参与训练、校准与阈值搜索),D+22 提交盲测报告;运维期每月复标。上界按 Wilson 公式计算,复算脚本 stats_check.py 随标书提交
违约衔接 连续两个月超过 1.5% 时甲方可单方解约,我方接受

并列披露的第二个指标 · L1+ 误提示率(第三轮自查新增,理由见 3.3 表 B 后的说明):

项目 承诺
定义 人类独立撰写的论文被判为 L1 或以上(即拿到任何非中性风险提示)的比例(篇级)
承诺值 点估计 ≤1%,在全局与语言级同时报出 Wilson 单侧 95% 上界(上界不作为合同判据)
预期观测值 全集 0.8% — 1.0%
为什么它不是合同判据 招标文件第 2.1.1 条的原文口径是「最多判定 1 篇为 AI 生成」,而 L1 的定义是「个别片段经 AI 润色,非整段 AI 输出」,按字面不属于「AI 生成」。但学生先看到的是那个黄色标签,因此我方主动把它一起报出来,不用「L1 不算误报」回避
成立前提 3.2 把 τ_格 的标定目标改为片段级假阳率 ≤0.5%、并把最终判据落到篇级观测(该格纯人类论文 L1+ 观测率 ≤1%)。按原稿的 τ = 2.05,这一项会是 97% 以上;只做片段级不做篇级复核,在片段假阳成簇的格上会是 2%—8%(9.10 第三步)
失效衔接 若 D+22 盲测该项超过 1%,处置写在 9.10 第四步:继续抬高 τ_格,代价记在召回上;不得下调 τ 换召回,也不得改口径

为什么我方敢承诺这几层:阈值不是训练出来的,是在校准集上反向解出来的。只要某格误报率超标,提高该格阈值即可满足。代价是召回下降,而我方在取舍上明确选择牺牲召回(见 8.2)。为什么不承诺到学科级与格级:不是做不到,是证不出。n=416 时只要 1 次误判上界就到 1.07%,168 格平摊后篇数只有个位数,1% 量级的置信上界在数学上不成立(推导见 3.3)。把证不出的粒度写成承诺,验收时必然翻车;我方选择把这层说清楚,并把全部格级数字照样公开。

8.2 漏报率

项目 承诺
定义(纯 AI 召回) 纯 AI 生成论文被判为 L2 或 L3 的比例
承诺值 ≥90%,即漏报率 ≤10%
预期观测值 91% — 94%
「学生主写 + AI 润色」不得判超标 该类样本被判为 L2 或 L3 的比例 ≤2%
测量方法 纯 AI ≥2,000 篇、润色混合 ≥2,000 篇,D+22 盲测

这里有一个必须说清的取舍:双模型结论不一致时一律按「不判异常」处理,这个规则直接压低误报率,同时会损失一部分召回。我们估算它使纯 AI 召回下降约 3 — 5 个百分点。我们接受这个代价,因为误判一名原创学生的成本远高于漏过一篇代写论文,后者还有导师环节和答辩环节,前者没有任何补救环节。

8.3 对抗鲁棒性

这是全份方案里我们最愿意被检验、同时最愿意承认局限的一项。

承诺值按招标文件第 2.2.1 条列出的六类手段逐条给出,机制与测试集设计见 3.5。

对抗手段 承诺 说明
大白话改写 AI 判定路径召回 ≥80% 不以口语化程度作为任何维度输入;刻意大白话的低句长变异 + 规整话语标记与真实口语相反
故意加错别字(含零宽字符、同形异义字) 召回 ≥88% 预处理做字符归一化与可见性检查,归一化前后各算一次取偏离更大者
调乱语序 召回 ≥85% 片段内统计特征与语序无关;跨片段指标改用无序统计量
同义词批量替换 召回 ≥80% 判定依赖分布形状而非词表;同时触发改写痕迹路径
中英混杂 召回 ≥85% 按 >60% 字符归属选基线,混杂本身不构成规避手段
分段检测逐个击破 分段合并与全文检测偏差 ≤5% 片段边界不跨章节,篇章级建模支持 ≥2 万字,不截断;该项已写入违约条款
经市面「降AI」服务处理过的文本(重度改写) 改写痕迹检出率 ≥85%;同类文本的 AI 判定路径召回预计降至 55% — 65% 这是我们主动披露的局限:重度改写确实能大幅规避基于分布偏离的判定。应对是独立的改写痕迹路径,不依赖 AI 判定路径
翻译回译(中→英→中) 改写痕迹检出率 ≥80%;AI 判定召回约 60% 回译痕迹与改写痕迹高度重叠

阴性对照必须同测:1,200 篇经同样改写处理的人类原稿,误报率仍受 ≤1% 约束,不因对抗测试放宽(见 3.5 鲁棒性测试集设计)。只报抵抗率不报阴性对照的鲁棒性数字没有意义——把人类论文也一起标出来,任何抵抗率都能做到很高。

为什么要把 55% — 65% 这个难看的数字写出来:因为只靠 AI 判定路径对抗改写产业是不可能的,任何声称能做到的承诺都无法兑现。我们的应对不是把这个数字修饰得好看,而是增加一条不依赖分布偏离的检测路径,并把它的结果作为独立信息呈现给学校。三年服务期内,改写痕迹特征库每月随模型一起更新,这是一个持续对抗过程,不是一次性达标。

8.4 检测速度

场景 承诺 依据
常态(日均 21,918 次/天) 单篇 P50 ≤ 25 秒,P95 ≤ 60 秒 基线 2 台 H2(8 卡)在 1.23 篇/秒负载下利用率 <15%
毕业季常态(53,333 次/天) 单篇 P50 ≤ 30 秒,P95 ≤ 75 秒 同上,扩容后利用率更低
瞬时峰值(10,000 篇同时提交) 全部 10,000 篇在 180 秒内出完整报告(含排队) 14 台 H2 / 56 卡,设计吞吐 58.6 篇/秒 × 180 秒 = 10,550 篇
设计日处理能力 2,530,000 次/日 招标要求 ≥60,000 次/日,余量 42 倍(瞬时 SLA 的副产品)
系统可用性 ≥99.5%(每年 3—6 月 120 天窗口,即不可用 ≤14.4 小时) 两地三中心,RPO ≤5 分钟 / RTO ≤30 分钟

速度承诺依赖一个未经实测的假设(单卡 25,000 token/秒),表 6 第一行给出完整推导与敏感性。我们在 D+12 引擎 Alpha 即做实测,偏差超过 20% 时立刻在 D+13 提出台数调整与差价说明,不拖到验收前。

8.5 可解释性

项目 承诺
判定依据完整率 100% 的异常片段都列出触发维度名称、z 值、所用基线(学科/文体/语言/版本号)
报告结构 七节(覆盖招标第 2.3.1 条的四个强制模块):总体评估、片段级分析、特征分析与证据链、人工复核指引、古文引用与不可分析内容说明、改写痕迹、方法与版本说明。完整样例见第 11 章
禁止项合规 不输出单一百分比、不输出两位小数式虚假精确、不出现任何大模型产品名或版本号、跨环境格式完全一致
第三方复算 审计机构可用交付的标定脚本与留出集访问审计记录,独立复算任意一格的误报率,结果与交付一致
学生可读性 报告对学生可见的版本用自然语言说明每处标记的理由,不出现 z 值等统计术语;不提供任何「如何降低标记」的指引
结果一致性 同篇三次偏差 ≤5%、跨实例一致、全文与分章节合并偏差 ≤5%,三项均提供在线自查入口

8.6 我们做不到的部分

写在这里,是因为评审需要判断本方案的承诺是否可兑现。

  1. 无法证明一篇文章是人写的。 检测只能指出与人类写作基线的偏离,不能反向证明清白。报告中不会出现「确认为人工撰写」这类结论,只有「未发现需要关注的片段」。
  2. 重度改写后的 AI 文本,AI 判定路径召回约 55% — 65%。 见 8.3。对此的应对是一条不依赖分布偏离的独立路径:改写痕迹检出率 ≥85%,结果单列、不并入分级,特征库在三年服务期内每月随模型同步更新(已列入表 5 运维工作量)。
  3. 168 格中会有若干格样本不足。 这些格采用上级基线并在报告中标注置信度降级。我们不会用全集平均数把这些格盖住。
  4. 代码与纯公式内容无法可靠判定。 报告直接标注该内容类型统计上不可靠,不作判定依据;不可分析内容超过 30% 时报告首屏附加提示。
  5. 误报率的中文独立基准目前不存在。 我方承诺的误报率只能由我方自建留出集自证,并向第三方开放复算。这是当前行业条件下能做到的最强形式,但它不等于外部独立基准。我们如实说明这一点,并把复算权写死在验收方式里:标定脚本、留出集访问审计记录、阈值变更记录全部作为交付物入库,甲方或其指定审计机构可在三年内任意时点抽取任意一格独立复算,复算结果与交付不一致按验收不通过处理(见 8.1 第三方复算一行)。

第 9 章 风险分析

10 条,按发生概率排。每条写清由谁承担成本,最后把核心统计假设一路推到失效。

招标必备内容 ⑧

按「会不会真的发生」排序,不按严重程度排序。每条都写明由谁承担成本。

9.1 单卡吞吐假设偏乐观(概率:中高 · 影响:报价 A 项 +350 万元)

风险:AI 服务器台数建立在「单张 48GB 卡对 1.5B 级判别模型批量前向 25,000 token/秒」这个未实测假设上。若实际只有一半,H2 需从 14 台增至 26 台。

为什么不回避:这是本报价唯一一个足以改变总价量级的假设,我方选择在表 6 第一行明示完整推导,而不是藏进一个看起来精确的总价里。

应对:D+12 引擎 Alpha 完成即做单卡实测;偏差超 20% 时 D+13 提交台数调整与差价说明。在 ±20% 以内的偏差由风险预留 R(940,340 元)吸收,不向甲方追加。 超出 20% 的部分仍由我方自行承担:按固定总价追加采购或租用等价算力,不向甲方追加费用,也不通过降低双模型交叉校验覆盖、降低召回或对请求排队来消化。 这一条是定稿前改的,原稿曾把「降低交叉校验覆盖」「峰值时段自查请求降级排队」列为不加价的替代路径。那实质上是承诺在风险发生时自动降级服务,与第 8 章的性能承诺和第 2.5.5 条的不额外收费承诺相冲突。现在的边界是:固定总价范围内不得以降低检测覆盖、召回或 3 分钟 SLA 的方式处置任何已知风险;技术口径的任何调整只有在甲方书面同意变更需求时才可能发生,不由我方单方启动。唯一保留的工程优化是把不可分析内容识别前移到 CPU 侧(纯效率改进,不改变判定结果与覆盖范围)。

9.2 「降AI」服务持续升级(概率:高 · 影响:8.3 的对抗指标)

风险:规避产业已完成商业化闭环,公开承诺「未达标退款」。它的迭代速度快于年度模型更新。

应对:改写痕迹特征库按月更新(算法运维 1 人常设岗,见 6.2),每月提交一次对抗回归报告;改写痕迹作为独立信息呈现,不并入分级,因此对抗能力波动不会直接制造误判。我方明确不承诺「永久领先」,这是一个持续过程,任何一次性达标的承诺都不可兑现。

9.3 留出集 12,000 篇到位晚于计划(概率:中 · 影响:D+22 盲测)

风险:人类论文样本需逐篇取得授权,采购周期不完全可控。

应对:D+1 即下单,按学科分批交付,先到先标定;D+16 设中期检查点,到位率 <60% 时启动备用供应商,并把标定窗口压缩到 D+20 — D+22。成本由 R 承担。不接受用未授权样本或学生已上传论文替代,后者违反招标文件的训练数据禁令。

9.4 500 校在 30 天内完成接入(概率:中 · 影响:D+30 上线与 15% 付款)

风险:学校侧配合节奏不可控,教务系统版本差异大。

应对:逐校差异用配置解决不改代码(一套通用适配框架 + 三家教务适配器);D+22 起灰度每日 40 — 60 校,留 8 天缓冲;接入 checklist 提前 7 天发出;S6 已包干逐校工作,不因进度压力追加人天。若因学校单方原因无法在 D+30 前接入,我方提交书面情况说明并继续跟进,不将其计为甲方违约。

9.5 部分格误报率无法达标(概率:中 · 影响:召回下降)

风险:小学科 × 稀有文体 × 英文的格样本极少,标定不稳定。

应对:提高该格阈值直到满足 ≤1%,宁可损失召回;样本不足时降级使用上级基线并在报告中标注置信度下降。不允许用全集平均数掩盖单格超标,这是设计层面的硬约束,不是可以在压力下放宽的策略。

9.6 学校侧红线口径不一致(概率:高 · 影响:使用体验与投诉量)

风险:公开渠道可见的高校通知中,AIGC 红线取 40%、30%、50%、20% 的都有,各校也可能直接沿用旧供应商的百分比口径来理解我方的分级结果。

应对:报告不输出可与旧系统直接类比的单一百分比,分级定义与处置建议印在每份报告上;为学校端提供「分级与本校既有规定的映射配置」,由学校自行设定 L2/L3 对应的校内流程,我方不代替学校设定红线。学校支持工程师(6.2)将此列为接入培训必讲项。

9.7 数据泄露或正文越权访问(概率:低 · 影响:极高,可能导致解约)

应对:数据不出域(全部正文处理与存储在装备司数据中心及纳入同一安全域的专属资源内,无跨境链路、无第三方回传);正文 30 天物理删除并留审计;脱敏报告不存原文、单片段 ≤80 字且仅存特征向量与位置偏移;运维账号默认无正文读权限,访问需双人授权;等保三级 + 每年 1 次第三方安全测评(S7 共 4 次)。我方不为任何模型训练保留学生论文,此约束在网络策略与 IAM 两层实现,并列入安全测评检查项。

9.8 核心人员流失(概率:中 · 影响:三年服务连续性)

应对:算法运维为常设岗而非个人依赖。标定表、基线版本、阈值变更记录、复算脚本全部作为交付物入库,任何人可按文档复算;运维团队 5 人中任一角色有指定备份人;年度交接作为运维任务明确列入表 5。

9.9 资源租赁不可得或专属隔离无法满足(概率:低 · 影响:架构调整)

风险:本方案全部资源采用租赁并要求专属物理隔离,若供应商无法满足隔离要求,需改为自购。

应对:改为自购的口径已在报价框架内可换算(自购单价 + 运行费 + H4 10% + H5 每年 5%),我方在此声明若因隔离要求必须改为自购,由我方承担与租赁方案的差价,不向甲方追加。该差价优先由风险预留 R 承担;R 不足的部分由投标人自行承担,不向甲方追加,也不以此为由调整任何性能承诺。

9.10 判定式的独立性假设失效(概率:高 · 影响:τ_格 被迫抬高,召回下降)

这一条与其他风险条目写法不同:其他条目给的是「如果发生怎么办」,这一条我方把假设一路推到失效为止,给出失效阈值,并把失效前后的两套数都留在标书里。理由是:这是本方案统计部分唯一一个能让 8.1 的核心承诺整体作废的假设,藏起来对招标方没有任何好处。本节在第三轮自查中被整体重写过一次,原因写在下面第五步。

假设:3.2 的判定式「至少两个维度同时 |z| > τ_格」隐含两重独立性 —— ①同一格内 8 个维度之间近似不相关;②同一篇论文内各片段的假阳事件相互独立(篇级波及范围服从二项分布)。3.3 的逐格标定建立在这两重假设上。两重假设的性质完全不同,必须分开处置。

第一步 · 独立情形下的基准值。按 3.2 改后的标定目标(片段级假阳率 ≤0.5%,正态近似 τ ≈ 2.47),一篇 300 片段的纯人类论文期望产生 1.5 个异常片段,波及范围 0.48%(落在 L0);落到 L1 及以上(波及 ≥2%,即 ≥6 个片段)的概率 0.37%,落到 L2 及以上(≥10%,即 ≥30 个片段)的概率在 10⁻²⁷% 量级。

第二步 · 第一重失效:维度之间正相关。用单因子等相关模型 z_i = √ρ·F + √(1−ρ)·e_i(F 为该片段的公共写作风格因子,e_i 为维度特有噪声),对 F 做高斯积分:

维度间平均相关 ρ̄ 片段级假阳率 P(纯人类 300 片段论文 ≥ L1) 把假阳压回 0.5% 所需的 τ
0.00(假设成立) 0.48% 0.37% 2.46
0.10 0.58% 0.86% 2.50
0.20 0.82% 3.90% 2.58
0.30 1.15% 13.42% 2.67
0.40 1.50% 29.67% 2.75

我方必须承认这重相关是真实存在的。8 个维度中至少三对存在机制上的正相关:句长变异系数与从句嵌套深度(都由句法复杂度驱动)、词汇丰富度与术语一致性(都由用词多样性驱动)、连接词密度与标点习惯(都由篇章连接方式驱动)。这类结构性相关落在 0.2—0.4 是常见量级。但这一重失效不会让承诺作废:3.3 的 τ_格 是在该格真实人类片段上按经验分位数搜索出来的,相关性已经含在那批样本里,搜索结果会自动落到上表最后一列。代价是 τ 被抬高(ρ̄ = 0.3 时从 2.46 抬到 2.67),而 τ 抬高就是召回下降。换句话说:第一重失效的代价记在召回上,不记在误报上。

第三步 · 第二重失效:同一篇内片段之间不独立。这一重不会被逐格标定吸收,因为标定的是片段级比率,而承诺的是篇级概率,二者之间的桥就是「片段独立」这个假设。同一作者的句法习惯、术语偏好、连接方式是贯穿全篇的共同因子,一旦某位学生的写作风格整体偏离本格基线,他的假阳片段会成簇出现。用 beta-binomial 引入组内相关 φ(片段级假阳率固定为 0.48%):

片段间组内相关 φ P(300 片段 ≥ L1) P(600 片段 ≥ L1) P(300 片段 ≥ L2)
0.000(假设成立) 0.37% 0.00% ≈0
0.002 2.08% 0.78% ≈0
0.005 4.40% 2.96% ≈0
0.010 6.60% 5.46% 0.0025%
0.020 8.06% 7.33% 0.068%
0.050 7.74% 7.40% 0.630%

失效阈值:要维持「纯人类论文落到 L1 及以上的概率 ≤1%」,φ 只能到 0.0008。这个数极小 —— 也就是说篇级 1% 这条线在片段独立假设下才成立,假设一破就立刻破。这是本方案第三轮自查发现的第二处实质问题,比第一重严重。

第四步 · 第二重失效的处置。处置办法不是放弃承诺,而是把标定目标从片段级搬到篇级:τ_格 的最终判据改成「该格纯人类论文的篇级 L1+ 观测率 ≤1%」,直接在整篇人类论文上观测,φ 与 ρ̄ 同时被吸收进观测值。片段级 0.5% 退为独立情形下的起点值与诊断指标。代价仍然是 τ:

片段间组内相关 φ 300 片段论文允许的片段级假阳 所需 τ 600 片段论文允许的片段级假阳 所需 τ
0.000 0.598% 2.43 0.909% 2.35
0.002 0.359% 2.52 0.524% 2.46
0.005 0.188% 2.64 0.263% 2.58
0.010 0.101% 2.74 0.127% 2.71
0.020 0.068% 2.81 0.076% 2.79

φ 从 0 升到 0.02,所需 τ 从 2.43 抬到 2.81 —— 抬幅有限(正态尾部很薄),所以篇级承诺守得住;真正的不确定性全部转移到召回上。本节全部数字由标书附带的 stats_check.py 第 8、9 节生成。

第五步 · 这一节改过什么,为什么要写在明处。原稿的 9.10 只算了第一重(维度间相关),并把失效阈值写成 ρ = 0.287、后果写成「L2 误报率越过 1% 红线」。第三轮自查发现两处错:①L2 的门槛是波及范围 ≥10%,纯人类论文在任何合理 τ 下都摸不到它,所以「L2 越线」这个后果本身就不成立,原稿算出的 ρ = 0.287 是在一条约束不住 τ 的线上求出来的;②完全漏掉了第二重(片段间相关),而它才是真正卡住篇级承诺的那一重。原稿的结论方向是错的:它说安全边际只有 0.29 的相关系数,实际上第一重根本不构成红线风险,而漏掉的第二重的容忍度是 0.0008。我方按第 6 章的自查条款把这次修正写在明处,不做静默替换。

修正(已写入交付物,不加价)

  1. 标定阶段强制输出两套相关量。168 格每格用留出集人类样本估计 8×8 维度相关矩阵(平均非对角元 ρ̄、最大元 ρ_max),并在该格的整篇人类论文样本上估计片段间组内相关 φ̂。三个数一并写进阈值表并对第三方审计开放。这项数据原稿不要求输出,现在是标定脚本的必选产出。
  2. τ_格 的最终判据改为篇级观测:该格纯人类论文的 L1+ 观测率 ≤1%,片段级假阳 ≤0.5% 退为起点值与诊断指标。经验分位数标定,禁止使用正态理论分位数(正态值只作搜索起点)。
  3. ρ̄ > 0.20 的格改用白化后的联合判据:不再对原始 z 值数维度个数,改用同格实测协方差的 Mahalanobis 距离 d² = zᵀΣ⁻¹z 与「白化后至少两维越界」双条件,把维度相关吸收进 Σ⁻¹ 而不是留在阈值里。白化只消除相关,不减少维度数,因此它降低的是 ρ̄ 带来的那一部分假阳,不解决第二重。
  4. φ̂ > 0.005 的格追加篇级复核门:该格的 L1 判定在发报告前必须通过一次「全篇风格整体偏移」检验(比较该篇 8 维均值与本格基线的 Mahalanobis 距离),整体偏移显著者按 9.7 的人工复核通道处理,不直接输出 L1。
  5. 验收判据:D+22 盲测报告必须列出 168 格的 ρ̄ 与 φ̂ 分布;若存在 φ̂ > 0.005 的格而该格未采用第 4 条的复核门,按缺陷处理。

谁承担:修正成本为标定脚本改动、篇级复核门开发与一次全格重标定,约 55 人天,已含在 C 项 708 人天内,不追加报价。风险的真实落点是召回:若 φ̂ 普遍偏高导致 τ 被抬到 2.8 以上、D+22 实测召回跌破 90%,按 9.4 的处置顺序办 —— 不得通过下调 τ 换召回,只能改进判别模型与改写痕迹通道;若两条通道都改不动,我方在盲测报告中如实提出「误报优先 / 召回优先」的取舍请招标方决定,并按第 6 章第 4 项承担相应违约责任,不以修改口径的方式回避。

9.11 风险预留的使用边界

风险预留 R = 940,340 元(C₀ × 5.5%),可折合约 470 人天。我方明确它只用于下表六项,不用于填补本报价中本应列明而遗漏的主要费用。若 R 耗尽,后续成本由投标人自行承担,不向甲方追加——三年总价 18,892,295 元为固定含税总价。

# 允许的用途 触发条件 额度 出处
1 算力与推理成本超预估 实际用量在预估的 ±20% 以内 按实结算 9.1
2 独立性失效导致的全格重标定 盲测发现 ρ̄ > 0.20 的格未用白化判据,或 φ̂ > 0.005 的格未用篇级复核门 约 55 人天(已含在 C 项 708 人天内,此处为备用额度) 9.10
3 阈值标定与召回未达标的额外迭代 9.3、9.4 的触发条件成立 按实结算 9.3、9.4
4 算法侧研发工作量缺口的追加人力 已发生,不是或然事件:6.1 逐组对账显示算法组负载 166%,跨组调剂后仍缺 101 人天 已定向占用 216,000 元(6 人 × 18 人天 × 2,000 元),占 R 的 23.0% 6.1
5 学科级样本补足 352 篇 招标方要求把 ≤1% 的置信上界从语言级下推到学科级(12 格各需 446 篇,共 5,352 篇) 17,600 元(352 篇 × 50 元/篇),占 R 的 1.9% 3.3
6 学校支持工单超出承载上限 连续 3 个月实际工单量 > 306 单/月,或全年 > 4,400 单 追加 1 名支持工程师,按实结算(220 人天/年 = 440,000 元/年,超出 R 单年承受力,见下方第三段 6.2
7 6.1 中标注为「估算」的模块行偏高导致的进一步缺口 第 4、5、6、7 项人天超出估算,且已用尽第 4 行的 108 人天 按实结算,上限为 R 的剩余可支配额 6.1
8 未预见的缺陷修复 验收后 30 天内发现的功能性缺陷 按实结算

R 的占用台账(这张表是定稿前补的,原稿只写允许用途、没写已经用掉多少)

金额(元) 状态
R 总额(C₀ × 5.5%) 940,340
第 4 项:算法侧缺口 108 人天(6 人 × 18 人天) −216,000 已定向占用capacity_check.py 第 4 节复算)
第 5 项:学科级样本 352 篇 −17,600 已标价、待甲方是否要求
剩余可支配 706,740 对应第 1、2、3、6、7、8 项全部或然支出

第 4 项的性质在定稿前变了,必须写明:原稿把它写成「若 6.1 的 10 人天余量被耗尽则动用 R」,是一个或然条款;6.1 补齐需求表并按组分解后,缺口已经确定存在(算法组 166% 负载),所以它变成了一笔已经花掉的钱。 R 的可支配余量因此从 940,340 元降到 706,740 元,抗风险能力下降 24.8%。我方选择把这件事写在这里,而不是悄悄抬高 C 项报价或把需求表改回 17 项。

第 6 项要单独说清:它是本表唯一一项 R 兜不住的风险。 追加 1 名支持工程师三年计 1,320,000 元,远超 R 的剩余额。因此 6.2 对这一项给的不是「由 R 承担」,而是一条前提依赖 —— 学校侧一级支持责任需写入合同附件。如果甲方不接受这条前提,我方的运维报价需要按 2 名支持工程师重算,这是我方唯一一处在投标阶段就声明「报价依赖一项甲方配合条款」的地方。

第 10 章 额外探索与创新

三条路不计入交付承诺。另有两条评估后部分采纳,不加价。

本章三项均标注为「本次不实施、不计入交付承诺」,未占用本报价任何费用(表 6 末行已说明)。列出它们是因为招标文件鼓励披露与本项目有关的额外探索,也因为它们是我方在准备阶段真实思考过、但判断不适合塞进 30 天工期的方向。

10.0 来源分级:哪些是查到的,哪些是我方自己的判断

招标文件第 2.6 条要求「如实区分 AI 提供的线索、自己的想法和拟实施内容」。我方按四级标注,下表把本方案用到的每一类材料归类一次,第 2 章、第 8 章与本章的每处引用都可按此追溯。

标注 含义
【实证】 我方取得并读过原文,可引原句,附论文编号或公开来源
【AI 线索】 由 AI 工具协助检索定位,我方核对原文后采用;未核对到原文的一律不写进方案
【我方推断】 基于上述材料的自身判断,不是文献结论,不作为达标依据
【未取得】 尝试获取但失败,如实写出失败原因与我方的替代处理
材料 级别 在本方案中的位置与用途
Liang et al. 2023(Patterns,arXiv:2304.02819):7 款检测器在 91 篇非母语 TOEFL 作文上平均误报 61.3%,88 篇母语八年级作文近 0%,18 篇被全部 7 款一致误判 【实证,但 61.3% 这一汇总值的取证边界见下方说明】 第 2 章第三条行业事实;直接决定 3.3 必须按语言分格标定,而不是把分层当优化项
Turnitin 首席产品官关于「工具学到的是更复杂的写作更可能出自人手」的公开表述 【实证】 第 2 章;用于说明误报偏向的机制,不用于任何指标
同一稿件跨系统检出率差异(知网 62.7% / 维普 9.57% / 万方 5.4%,另一组排序相反) 【实证,但为第三方测评而非官方披露】 第 2 章第二条行业事实;只用于说明现象存在,第 2 章已就此加注
「降 AI」服务的公开定价与达标率承诺(4.8 元起/千字、达标率 99.26%、不达标退款;另一家 8 元/千字) 【实证】 第 2 章第一条与第四条;决定 3.5 必须做独立的改写痕迹路径
「用中文并不很精通的人的语气撰写」这类降 AI 提示词 【实证】 第 2 章第四条;与上一条合起来说明「降 AI 提示词」和「误报率过高」是同一个漏洞的两面
539 条高校公开通知中 40% 红线 52 条、30% 红线 46 条 【实证】 第 2 章;用于说明分级口径必须替代单一百分比
Qwen2.5-1.5B 级模型的单 token 前向算力与 48GB 卡 BF16 稠密算力 【AI 线索,我方按公开规格复核】 表 6 单卡吞吐推导;已在表 6 写出 MFU 与复核算式
「真实的攻击面在反馈机制而不在模型」 【我方推断】 3.6 第二问;据此把学生端改为始终不返回连续数值。该判断不是文献结论
「波及范围按片段数计而非按字数计」 【我方推断】 3.4 三层聚合;招标文件给的是片段口径,我方把它明确写成分子分母定义
中文学术论文上的第三方独立误报率实测 【未取得】 公开渠道未见。处理:第 8.6 条如实承认我方误报率只能自证,并在 10.2 提出开放共治的设想
高校 AIGC 检测集中采购的公开中标价 【未取得】 未检索到可引用的公开记录。处理:报价不以任何市场价对标,只按招标统一单价自下而上核算
腾讯云朱雀检测服务的官方能力文档 【未取得】 页面返回不可解码内容,未取得。处理:第 2 章不引用其任何指标

关于 61.3% 这个数的取证边界(本轮自查补充):我方在本方案中七处引用了这个数值,此处一次性说明它的取证状态。该研究的公开摘要只给出定性表述(检测器对非母语写作存在系统性偏见、91 篇 TOEFL 作文被高比例误判),61.3% 是论文正文中 7 款检测器逐款误报率的平均值,不出现在摘要里;我方核对到的是正文与其后续被广泛转引的这一汇总口径,未逐款抄录 7 个分项数值,也不为它编造图表编号。因此它的级别是「实证,但汇总口径由我方按正文复述」,而不是「摘要直引」。

更要紧的是:即使这个具体数值不被采信,3.3 的分层设计也不依赖它的精确取值。分层的真正依据是两条更弱、更难被推翻的命题——一是检测器把「写作复杂度」当成了人类性的代理变量(Turnitin 首席产品官的公开表述),二是非母语写作的复杂度分布与母语写作不同。只要这两条成立,按语言分格标定就是必要的,无论偏见幅度是 61.3% 还是 20%。我方把英文单列为验收层(3.3 表 B,n=1,700)正是为了不靠文献、而靠自己的盲测数据把这块风险量到位。

算过但没有采用的更省做法:共六项,连同每一项违反了招标文件的哪一条,写在第 7.7 节;其中主动砍掉的两笔(合计 54 万元)也在同一节说明。这一部分属于招标第 2.6 条所说的「尚不成熟、最终没有采用的尝试」,为避免重复,本章不再复述。

10.1 联邦式校际人类写作基线共建 — 本次不实施、不计入交付承诺

动机:本方案的 168 格标定表由我方自建留出集支撑,样本量是它的天花板。而每一所学校手里都有大量已确认原创的历史论文,这是最理想的人类基线语料,但论文不能出校,也不应集中到任何一方手里。

设想:各校在本地计算 8 个维度的统计量(均值、方差、分位数),只上传聚合量,不上传任何正文或片段。中心侧按学科聚合成基线,再把更新后的基线分发回各校。论文始终不出校门,中心侧永远拿不到原文。

为什么本次不做:需要 500 校各自部署一个本地计算组件并建立数据治理协议,30 天工期内不可能完成;而且聚合量本身的隐私边界需要单独论证(差分隐私噪声水平与基线精度的权衡),这是一项独立课题。若未来实施,应作为单独立项。

10.2 标定表与基线的开放共治 — 本次不实施、不计入交付承诺

动机:目前没有任何中文学术论文上的第三方独立误报率基准,这是本行业最根本的空缺(我方在第 8.6 条已如实承认,我方承诺的误报率只能自证)。这个空缺不是任何单一供应商能填的。

设想:把 168 格标定表的方法、每格样本量、置信区间与复算脚本公开(不公开样本原文),邀请学术界按格挑战与复现,形成一个可持续修正的公共基准。谁测出某一格误报率高于承诺,就构成一次公开修正。

为什么本次不做:公开范围涉及知识产权归属(本项目成果归采购人教育局装备司),须由产权方决定是否开放、开放到什么程度,不是投标人可以单方承诺的事。我方在此仅表达愿意配合的立场。

10.3 写作过程留痕作为正面证据 — 本次不实施、不计入交付承诺

动机:检测的根本困境是它只能指出偏离、不能证明清白(第 8.6 条第 1 项)。学生一旦被标记就处在无法自证的位置上。这个困境在检测这条技术路线内部无法解决。

设想:在写作端记录编辑轨迹(增删改的时间分布、修订次数、粘贴长度分布),作为学生主动提供的正面证据,而不是强制采集的监控数据。被标记的学生可以选择提交轨迹来说明写作过程。

为什么本次不做:三个原因。一是它改变了系统与学生的关系,采集边界必须由教育主管部门定而不是由供应商定;二是「不提交轨迹」很容易在实践中被当作有罪推定,这个副作用比它解决的问题更大;三是它需要写作工具侧的配合,超出本项目范围。我方认为这是值得长期研究的方向,但在没有明确政策边界之前不应实施。

10.4 用「LLM 普及前的历史语料」作人类基线以消除标注偏差 — 评估后部分采纳

这一条与 10.1—10.3 不同:它是我方在方案复核阶段才补充评估的路径,原始设计中没有考虑过。 之所以写进来,是因为评估结论改变了我方的一项做法,而它本可以改变得更多。

设想:大规模生成式模型进入公众使用是 2022 年末的事。因此 2021 年 6 月之前公开发表的学位论文与期刊论文,可以在定义上被视为「纯人类写作」,不需要任何人去标注它是不是 AI 生成的。若人类基线完全建立在这批语料上,招标第 2.1.4 条要的「标注偏差处理」这道题就不再是「如何把偏差压到多小」,而是「这个偏差源在我方流程中不存在」。标注偏差的成本项与风险项同时归零。

已采纳的部分:S5 的 500,000 条训练集片段,其人类侧来源限定为 2021 年 6 月 30 日之前公开发表的文献,并在语料清单中逐条记录发表时间作为可审计字段。这一条从本次投标起生效,不增加成本,且消除了一个我方原稿未处理的污染源。原稿只写了「公开可商用语料」,没有时间下限,这意味着人类侧语料理论上可能混入 2023 年后已被 AI 参与的文本,而这类污染会把人类基线整体拉向 AI 侧,系统性压低召回。这是一个原稿的实质漏洞,由这条路径的评估发现。

未采纳的部分及理由:留出集 12,000 篇的人工双标 + κ≥0.75 + 仲裁流程保留,不用时间切分替代。三个原因:

  1. 时间切分只能生成「人类侧」标签,不能生成「参与方式」标签。 招标第 2.1.1 条要求「纯 AI 生成召回 ≥90%」与「AI 辅助润色不得判为超标」,这两条验收都必须有已知的 AI 正样本与已知的润色样本,而这两类样本在 2021 年前的语料里根本不存在,只能人工构造并标注参与方式。我方 ≤5% 的一致性承诺与 3.3 的分层标定针对的正是参与方式这一轴。
  2. 168 格的分层均衡无法从历史语料自动获得。 3.3 已算出:0 次误判下要把 Wilson 单侧 95% 上界压到 1% 以下,需该层人类样本 n ≥ 268 篇,这正是我方不在格级承诺 1% 的原因;而格级 8 维基线仍需每格上千条人类片段,其中「含古文引用的混合文本」「中英混合文本」「含代码与公式的文本」三类文体在公开发表文献里的分布极不均匀,靠筛选历史语料去填 168 格,最稀疏的格仍然要靠委托撰写补足。
  3. 误报率验收需要可追溯的标注过程本身。 招标第 3.3 条要求申诉时提供检测过程追溯记录,第 1.3 条要求算法可向第三方审计开放。κ 值、重做记录、标注员偏向检验(3.12 第 3 项)都是这套可审计性的组成部分,用时间切分替代等于取消了这部分证据。

如果完全采纳会省多少钱:留出集人类侧 6,000 篇若改用历史公开文献,S4 可从 600,000 元降至约 300,000 元,占总价 1.7%。我方选择不省这笔钱,因为省下它的代价是丧失 2.1.1-b、2.1.1-c 两条的验收依据,以及 168 格分层标定的均衡性。这两项恰是本方案「误报率 ≤1%」这一核心承诺的全部支撑。

我方对这条路径的评价:它在「消除标注偏差」这个局部问题上是比我方原方案更好的解法,我方已采纳它能采纳的那一半。它不能覆盖的那一半(参与方式标注、分层均衡、可审计性),恰好是招标文件里写得最硬的几条要求。把一道题变成不存在的题,比把题做好更省力——前提是这道题真的可以不存在。这条路径只让它的一半不存在。

10.5 为判定结果增设「拒判」状态 — 评估后采纳其约束、不采纳其状态

这一条同 10.4,也是方案复核阶段才补充评估的路径,原始设计中没有。

设想:在 L0—L3 之外增设第五种输出「拒判」(reject)。当证据不足(可分析字数过少、该格标定样本不足、双模型分歧、语种混杂度过高)时,系统不给等级,而是明确输出「本篇不作判定」,并说明缺的是哪一项证据。配套一条反作弊约束:拒判样本既不计入真负也不计入误报,且不得通过扩大拒判范围来压低误报率

不采纳「状态」的理由(两条,都是硬理由)

  1. 输出口径被招标文件写死了。 第 2.2.2 条要求「输出各等级置信度分数,而非单一标签」,第 2.3.1 条要求报告四个模块缺一不可、其中模块 1 必须给出综合等级与波及范围。增设第五种状态等于在甲方指定的输出结构外再开一个出口,报告模块 1 将无法填写,教务系统与论文平台的对接字段(3.7)也要跟着改。招标文件允许我方在等级内附加提示,不允许我方替换等级体系本身。
  2. 拒判是一条可以合法藏起误报的通道。 我方误报率承诺 ≤1%,分母是盲测集中的人类论文篇数。只要把「证据不足」的判定权留在系统内部,任何一篇险些被误判的人类论文都可以被划进拒判从而离开分母。设想的提出方自己也看到了这个问题,所以补了那条反作弊约束,但约束要靠拒判比例的上限来执行,而上限一旦写死,拒判状态本身就退化成了一个提示标签。既然如此,不如从一开始就做成提示标签。

采纳的部分(三条,已写入交付物,不加价)

  1. 证据不足一律落到 L0 并强制附加提示,不新增状态。 触发条件在投标阶段即固定为四项:可分析字数 < 800 字;不可分析内容占比 > 30%(3.2 已有);该格标定样本量低于 3.3 表 A 的下限而降级使用上级基线(3.3 已有);双模型结论不一致(3.2 已有)。前三项原稿分散在三处,本条把它们合并为报告模块 1 中一个统一的「证据充分性」字段,四项状态逐项显示为「充分 / 降级 / 不足」。
  2. 附加提示的样本仍全额计入误报率分母。 这是把设想里那条反作弊约束直接写成我方的验收规则:D+22 盲测报告中,人类论文的误报率分母为 5,000 篇整数,不因任何证据不足提示而从分母中扣除任何一篇
  3. 证据不足提示的触发比例本身成为披露项,并设上限。 盲测报告与运维期月度报告必须列出四项触发条件各自的触发篇数与比例;「因该格样本不足而降级使用上级基线」的比例上限为 5%,超过 5% 视为标定表未达交付状态,按缺陷处理。这一条原稿没有。原稿写了降级机制与降级提示,但没有给降级比例设上限,也就是说理论上可以把大量论文降级到上级基线来回避格级标定的工作量。这是一个原稿的实质缺口,由这条路径的评估发现。

我方对这条路径的评价:它提出的问题是真的(证据不足时给等级是一种虚假精确),它给出的机制不适合本项目(与甲方指定的输出结构冲突,且自带一个藏误报的出口),但它附带的那条反作弊约束比机制本身更有价值。我方把约束照抄进验收规则,并补上了它没写的那个上限。

附录 A 检测报告样例页

一份完整的报告成品。招标第 2.3.3 条列的六个不合格做法,逐条对着看。

以下为系统实际输出的报告样式(示例数据)。它同时说明我方如何满足招标文件第 2.3.1 条「四个模块缺一不可」的要求,以及如何逐条避开第 2.3.3 条列出的不合格做法。


AIGC 内容检测报告

项目 内容
报告编号 RPT-2027-0413-0000871
检测完成时间 2027-04-13 09:26(中国标准时间)
提交方式 学生自查(第 2 次)
文档标题 基于多孔介质渗流的堤基渗透破坏判别方法研究
学科门类 工学
文体判别 学术论文(含代码与公式段落)
语言 中文(含英文摘要段落)
正文字数 23,480 字(其中可分析内容 20,662 字)
引擎版本 / 基线版本 / 阈值表版本 / 模板版本 E-1.4.2 / B-2027.03 / T-2027.03-r2 / R-1.1

一、总体评估(招标文件第 2.3.1 条模块 1)

L1

AI 辅助表达

本文档
综合等级 L1 - AI 辅助表达
波及范围(异常片段数 ÷ 全篇片段数) 2% — 5%(24 段 ÷ 748 段 = 3.2%),绝对字数 620 字
特征密度(异常段落内的平均密度) 22%,最高密度段落 28% — 均低于 30%
最大偏离 2.9σ(第 1 章 1.2 节 P2)
判定说明 仅少数段落中的少量语句呈现轻度 AI 辅助痕迹,论文主体内容未见显著异常。属「表达润色」范畴,不构成学术诚信问题。
处置建议 导师留意,无需学生举证。
检测时间 / 引擎版本 2027-04-13 09:26 / E-1.4.2

各等级置信度分数(按招标文件第 2.2.2 条,不输出单一标签)

L0 L1 L2 L3
0.06 0.71 0.21 0.02

最大后验 0.71 ≥ 0.60,非等级边界样本。

级别 波及范围 密度与偏离 本文档
L0 < 2%
L1 2% — <10% 密度 < 30%,异常片段 |z| 中位数贴近阈值
L2 10% — <30% 部分段落密度 30%—60%,偏离 2—3σ
L3 ≥ 30% 多段落密度 > 60%,异常片段 |z| 中位数显著高于阈值

「密度与偏离」一列的口径见 3.2 末段:招标文件第 2.3.1 条原文写作「偏离 < 2σ / 2—3σ / > 2σ」,与同条「至少两个维度偏离超过 2σ 才算异常片段」不自洽,因此我方把这一列执行为异常片段触发维度 |z| 中位数相对本格阈值 τ_格 的位置,只作降级参考,不作判定门限。本文档 τ_格 = 2.47,异常片段 |z| 中位数 2.62。

本报告中的「波及范围」指被系统标记为需要关注的片段占全篇语义片段的比例。它不是「AI 生成文字的比例」,也不构成对 AI 参与程度的估计。 本系统不输出 AI 生成字数占比,也不以任何单一百分比作为评分定义。等级由波及范围、密度、偏离三层数据共同决定,任何一层都不单独构成结论。

论文内容构成(招标文件第 2.1.3 条)

``` 论文内容构成: 可分析自然语言:20,662 字(88%) 代码块: 1,904 字(8%)——标注「代码逻辑,AIGC 检测不可靠」 数学公式: 728 字(3%)——标注「公式内容,AIGC 检测不可靠」 古典文献引用: 186 字(1%)——已豁免,不计入分母

警告:本报告仅对 20,662 字的自然语言部分作出 AIGC 判定。 代码与公式共 2,632 字(11%)不在本系统检测能力范围内。 如论文核心贡献(代码、算法、理论推导)主要位于不可分析区域, 建议教师通过以下方式核实: - 要求学生口头解释代码逻辑与公式推导 - 检查代码仓库的 Git 提交历史与提交粒度 - 要求对关键算法做变体改写测试 ```

不可分析内容占 12%,未超过 30%,因此未触发附加提示。


二、片段级分析(招标文件第 2.3.1 条模块 2)

数值
可分析字数 20,662 字
语义片段总数 748 段
异常片段 24 段(3.2%)
含异常片段的段落 11 个

章节分布

章节 片段总数 异常片段 章节波及范围
摘要 / Abstract 100 0 0.0%
第 1 章 引言 118 9 7.6%
第 2 章 文献综述 142 6 4.2%
第 3 章 渗流判别方法 131 4 3.1%
第 4 章 实验与结果分析 168 3 1.8%
第 5 章 结论与展望 89 2 2.2%
合计 748 24 3.2%

段落密度(仅列出含异常片段的段落,密度 = 该段落异常片段数 ÷ 该段落片段数)

位置 密度 密度条 该段落偏离
第 1 章 1.2 节 P2 28% ███░░░░░░░ 最大 2.9σ
第 1 章 1.2 节 P3 21% ██░░░░░░░░ 最大 2.8σ
第 2 章 2.1 节 P4 19% ██░░░░░░░░ 最大 2.7σ
第 3 章 3.1 节 P1 18% ██░░░░░░░░ 最大 2.5σ
其余 7 个段落 9% — 17% █░░░░░░░░░ 最大 2.6σ

密度低 → 局部小范围润色的可能性大;密度高 → 整段深度依赖 AI 的可能性大。本文档所有段落密度均低于 30%,与 L1 的「个别片段经 AI 润色,非整段 AI 输出」一致。若任一段落密度超过 60%,即使波及范围仍低于 2%,本节会在首屏给出局部风险提示并列出该段落——等级不提升,提示不省略。


三、特征分析与证据链(招标文件第 2.3.1 条模块 3)

基线:工学 · 学术论文 · 中文(基线集人类片段量 2,800 条,取自 3.3 表中的 S5 训练与基线集,与校准集、盲测集物理隔离;基线版本 B-2027.03)。z 值为相对该基线的标准化偏离,|z| > τ_格 记为维度偏离;本格标定阈值 τ = 2.47(阈值表版本 T-2027.03,标定方法见 3.3)。

# 维度 本文档观测值 基线(均值 ± 标准差) z 值 是否偏离
1 分布困惑度及其方差 31.4 28.9 ± 1.8 +1.4
2 句长分布与变异系数 0.16 0.34 ± 0.07 −2.6
3 连接词与话语标记密度(每百字) 6.8 3.1 ± 1.3 +2.8
4 术语使用一致性 0.91 0.88 ± 0.04 +0.8
5 长度归一词汇丰富度 0.47 0.44 ± 0.03 +1.0
6 标点与格式习惯 0.12 0.11 ± 0.03 +0.3
7 事实锚点密度(每千字) 4.1 6.9 ± 1.6 −1.8
8 局部重写痕迹 0.21 0.17 ± 0.05 +0.8

上表每一行的 z 值都可以用前两列直接复算:z =(观测值 − 基线均值)÷ 基线标准差,例如第 2 行 (0.16 − 0.34) ÷ 0.07 = −2.571,取一位小数为 −2.6。符号有实义:句长变异系数低于人类基线(负号)与连接词密度高于人类基线(正号)是同一现象的两面——句式趋于均匀、过渡词堆叠。判定只看 |z| 是否超过本格阈值,不看方向。本表数值由标书附带的 stats_check.py 生成,正文不手写。

判定规则:至少两个维度同时 |z| > τ_格 才将片段标记为异常(本格 τ = 2.47)。单一维度偏离不构成异常。

异常片段清单(共 24 处,此处列出前 3 处,完整清单在报告内可展开)

序号 位置 原文摘录(≤30 字) 字数 触发维度 z 值 所在段落密度 所用基线格
1 第 1 章 1.2 节 P2 · 片段 3 「综上所述,已有研究普遍认为……」 78 句长分布(#2)、连接词密度(#3) −2.6 / +2.9 28% 工学 · 综述与文献回顾 · 中文
2 第 1 章 1.2 节 P2 · 片段 7 「因此,有必要进一步深入探讨……」 74 句长分布(#2)、连接词密度(#3) −2.5 / +2.7 28% 工学 · 综述与文献回顾 · 中文
3 第 3 章 3.1 节 P1 · 片段 2 「基于上述分析,可以认为该模型……」 80 连接词密度(#3)、事实锚点密度(#7) +2.6 / −2.5 18% 工学 · 学术论文 · 中文

片段 1 的判定说明(每处均提供同样详细的说明):该片段句长变异系数为 0.16,同学科同文体人类基线为 0.34(标准差 0.07);连接词与话语标记密度为每百字 6.8 个,基线为每百字 3.1 个(标准差 1.3)。两个维度的 |z| 同时超过本格标定阈值 2.47,故标记。该片段位于文献综述部分,此类章节在本基线中属于偏离容忍度较高的区域,阈值已按「工学 · 综述与文献回顾 · 中文」这一格单独标定(该格标定集人类样本量 28 篇,标定后实测片段级假阳率 0.46%,采用阈值 τ=2.47)。按 3.3 的口径,格级样本量不足以支撑 1% 量级的置信上界,因此本报告在格级只给样本量与阈值,不给上界;≤1% 的验收在全局与语言级完成。该片段所在段落密度 28%,低于 30%,属局部润色形态。

统计说明:异常基于与该学科该语言人类写作基线的偏离程度,|z| > τ_格(本格 τ = 2.47)为显著偏离。z 不是「AI 概率」,它只表示该片段的统计特征离人类基线有多远。


四、人工复核指引(招标文件第 2.3.1 条模块 4)

建议优先关注:第 1 章 1.2 节 P2(密度 28%、最大偏离 2.9σ,为本文档密度与偏离双高处)。

排序依据:密度 × 最大偏离,两项都高的段落排在前面。以下对比说明为什么这一处比那一处更值得关注:

位置 密度 最大偏离 读法
第 1 章 1.2 节 P2 28% 2.9σ 该段 18 个片段中 5 个呈现偏离,且集中在连续位置 → 可能对该段做过整体润色
第 4 章 4.3 节 P2 9% 2.1σ 该段 11 个片段中 1 个轻度偏离 → 更可能是个别句子的用词习惯,不建议作为核实重点

给教师的引导性提问(由触发维度自动生成,针对片段而非学生整体)

  1. 第 1 章 1.2 节的文献综述部分连接词密度显著高于该学科基线,可请学生说明这一段的写作过程与所依据的文献。
  2. 第 3 章 3.1 节第 1 段事实锚点偏少而推进平滑,可请学生补充该判别方法的推导来源。
  3. 本文档代码与公式共 2,632 字不在检测范围内,若论文核心贡献位于该区域,建议按第一节列出的三种方式核实。

最终判定权在导师,本报告不构成学术不端认定。系统不输出任何处置结论,不提供「建议不予答辩」「建议取消学位」一类建议。L1 说明:该部分可能使用了 AI 辅助表达。若为学生自主使用的润色工具,属合理使用范畴,建议关注表达本身而非追责。


五、古文引用与不可分析内容

类别 数量 处理
已识别古文引用 2 处(《管子·度地》1 处、《河防通议》1 处,合计 186 字) 不参与 AI 判定,不计入异常片段,不计入分母
纯代码逻辑块 5 处,合计 1,904 字 该内容类型的 AIGC 检测在统计上不可靠,不作为任何判定依据
纯公式(LaTeX) 11 处,合计 728 字 该内容类型的 AIGC 检测在统计上不可靠,不作为任何判定依据
可分析内容占比 20,662 / 23,480 = 88% 不可分析内容占 12%,未超过 30%,无需附加提示

代码段中可分析的部分(注释、docstring、命名风格、公式前后的说明文字)已按对应基线正常判定,其结果已包含在第二、三节中。

若不可分析内容超过全文 30%,本报告首屏会附加提示:「本文档超过 30% 的内容属于代码/公式等不可分析类型,检测结果仅反映可分析的自然语言部分,不宜作为单一判断依据。」


六、改写痕迹(独立信息,不并入分级)

观测项 结果 位置
逐句同义替换 未观测到 ——
话语标记密度异常均匀 观测到 第 1 章 1.2 节(与第三节片段 1、2 位置重合)
术语一致性断裂 未观测到 ——
句长序列自相关破坏 未观测到 ——
同文档内格式习惯跳变 未观测到 ——

改写痕迹不并入波及范围与密度,不触发分级。改写本身不等于学术不端,正常的语言润色、导师修改与翻译同样会留下痕迹。本节仅陈述观测到的现象与位置,判断由学校依据本校规定作出。本系统不提供、不推荐任何降低标记的服务或方法。


七、方法与版本说明

  • 本报告不能证明文档由人撰写。 检测只能指出与人类写作基线的偏离,无法反向证明清白。本报告中不会出现「确认为人工撰写」这类结论。
  • 本报告不引用任何大模型产品名称或版本号。所有判定表述均为「与同学科同语言人类写作基线的偏离」。
  • 本文档所用的三格阈值均为已标定状态,无降级使用上级基线的情形。若存在样本不足的格,本节会显示「该格样本量不足,采用上级基线,置信度下降」。
  • 一致性自查指纹f3a91c7e…d28b(= 引擎版本 + 基线版本 + 阈值表版本 + 分段结果 + 正文哈希)。同指纹必得同结果。可在学校端「一致性自查」入口重新提交本文档核验,或跨部署实例比对。
  • 论文正文将于 2027-05-13 自动物理删除(提交后 30 天)。本报告保留 3 年;报告内保留的原文摘录每处不超过 30 字、总量不超过全文 3%,不足以还原论文全文(依据招标文件第 3.2 条数据留存要求)。

本样例如何满足强制模块、避开不合格做法

招标文件第 2.3.1 条要求的模块 本样例位置
1 总体评估(等级/波及范围/特征密度/判定说明/检测时间/引擎版本) 第一节,六项齐全,另加四等级置信度与内容构成块
2 片段级分析(字数/片段总数/异常片段数/章节分布与密度) 第二节,含章节分布表与逐段密度条
3 特征分析证据链(原文/维度观测值与基线/偏离 σ/该段密度) 第三节,八维观测值对基线值 + 逐段清单 + 完整判定说明
4 人工复核指引 第四节,含排序依据、对比说明与引导性提问
招标文件第 2.3.3 条列出的不合格做法 本样例中的对应位置
只给出一个百分比 报告含七节:总体评估、片段级分析、特征分析与证据链、人工复核指引、古文与不可分析内容、改写痕迹、方法与版本
「AI率 42.73%」式虚假精确 第一节给出区间「2% — 5%」并同时给片段数 24 段、绝对字数 620 字,不出现两位小数
引用特定大模型名称或版本 全文无任何模型产品名,第七节明确声明
不说明判定原因 第三节每处片段列出触发维度、观测值与基线值、z 值、所在段落密度、基线来源,并附完整判定说明
输出格式因环境而异 页头印出引擎/基线/阈值表/模板四个版本号;单一 JSON Schema 与单一渲染模板
把「AI 生成字数占比」当评分定义 第一节引用框明确声明波及范围不是 AI 生成比例;数据结构中无此字段,分级只读片段数口径
只给总分,不区分波及范围、密度与偏离 第一节三层数据并列;第二节给段落密度,第三节给片段偏离,三者分列不合并

第 12 章 需求追溯矩阵

104 条硬要求逐条落到章节句段。覆盖率 100%,没有「部分满足」这类措辞。

本章是招标文件硬要求与本方案正文的逐条对照表,共 104 条,其中已覆盖 104 条、部分覆盖 0 条、未覆盖 0 条

这张表不是手写的。 它由标书附带的 gen_traceability.py 生成:脚本读入 coverage_check.py 中逐条招标要求的判定规则,把规则回打到各章正文,定位到「章 + 小节」后输出本表。手写的追溯矩阵会随正文改动而失真——改了正文忘了改矩阵,矩阵就变成一份过期的承诺清单;机器生成的矩阵每次重跑都与正文同步,而且「未覆盖」这一栏无法靠自觉隐藏。评审方可以直接重跑脚本复核本表。

定位到小节一级即止,不给行号:行号会随每次改稿漂移,反而不如小节标题稳定。一条要求命中多处时最多列 2 处并给出总数。

招标条款 要求 状态 本方案对应位置
1.2-1 算法研发 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 5 章 实施计划 · 5.1 里程碑总览
1.2-2 前后端开发 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 6 章 团队与服务承诺 · 6.1 前期开发团队:33 人 / 708 人天 / 1,416,000 元等 4 处
1.2-3 教务与论文平台对接 已覆盖 第 3 章 技术方案 · 3.7 平台、接口与学校接入;第 5 章 实施计划 · 阶段二:D+4 — D+12 引擎攻坚(算法 + 数据 + 后端 21 人)等 11 处
1.2-4 三年模型更新与运维 已覆盖 第 7 章 预算报价 · 表6:关键数量的估算说明;第 8 章 预期效果 · 8.3 对抗鲁棒性等 3 处全文命中
1.3-2 顶会论文≥3篇(可假设) 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设);第 3 章 技术方案 · 鲁棒性测试集设计方案(招标文件第 2.2.1 条要求提供)等 6 处
1.3-3 千万级同类项目 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)
1.3-4 算法可向第三方审计开放 已覆盖 第 3 章 技术方案 · 3.10 安全与合规;第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条)等 6 处全文命中
1.3-5 不联合体+不双重经营 已覆盖 速览 · 招标必备要件 → 本文位置;第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)等 5 处
1.3-7 不植入降AI付费服务 已覆盖 第 3 章 技术方案 · 3.5 改写痕迹检测;第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)等 4 处全文命中
2.1.1-a 人工误报率≤1% 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 3 章 技术方案 · 「误报」在本方案中的定义等 11 处全文命中
2.1.1-b AI辅助润色不得判超标 已覆盖 第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条);第 5 章 实施计划 · 阶段四:D+19 — D+22 标定与盲测(算法 + 测试 11 人)等 6 处全文命中
2.1.1-c 纯AI召回≥90% 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 5 章 实施计划 · 5.1 里程碑总览等 4 处全文命中
2.1.1-d 盲测集≥5000/2000/2000 已覆盖 第 3 章 技术方案 · 四套数据的物理隔离;第 5 章 实施计划 · 阶段四:D+19 — D+22 标定与盲测(算法 + 测试 11 人)等 7 处全文命中
2.1.2-a 7类文体独立校准 已覆盖 第 3 章 技术方案 · 标定网格;第 3 章 技术方案 · 3.4 分文体专项校准等 25 处
2.1.2-b 古文绝对禁止误判(滕王阁序/论语/史记) 已覆盖 第 3 章 技术方案 · 古文豁免:三层机制,不依赖「这段古文我们见过」;第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条)
2.1.2-c 验收用混合古文测试集(非单一已知文本) 已覆盖 第 3 章 技术方案 · 古文豁免:三层机制,不依赖「这段古文我们见过」
2.1.3-a 代码可分析部分:注释/命名/说明文字 已覆盖 第 3 章 技术方案 · 代码与公式:不可分析内容;第 11 章 附录 · 报告样例 · 五、古文引用与不可分析内容
2.1.3-b 纯代码/公式标记统计不可靠且不作判定依据 已覆盖 第 3 章 技术方案 · 代码与公式:不可分析内容;第 11 章 附录 · 报告样例 · 五、古文引用与不可分析内容等 5 处
2.1.3-c 报告显示论文内容构成(可分析/代码/公式/古文占比) 已覆盖 第 3 章 技术方案 · 报告必含的四个模块(对应招标文件第 2.3.1 条);第 3 章 技术方案 · 论文内容构成块(对应招标文件第 2.1.3 条)等 6 处全文命中
2.1.3-d 警告:仅对自然语言部分判定 已覆盖 第 3 章 技术方案 · 论文内容构成块(对应招标文件第 2.1.3 条);第 11 章 附录 · 报告样例 · 一、总体评估(招标文件第 2.3.1 条模块 1)
2.1.3-e 教师核实三法:口头解释/Git历史/变体改写 已覆盖 第 3 章 技术方案 · 论文内容构成块(对应招标文件第 2.1.3 条);第 11 章 附录 · 报告样例 · 一、总体评估(招标文件第 2.3.1 条模块 1)
2.1.3-f 不可分析>30%附加提示 已覆盖 第 8 章 预期效果 · 8.6 我们做不到的部分;第 11 章 附录 · 报告样例 · 一、总体评估(招标文件第 2.3.1 条模块 1)等 4 处全文命中
2.1.4-a 数据来源合法性 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条);第 3 章 技术方案 · 月度复标等 11 处
2.1.4-b ≥10学科门类 已覆盖 第 3 章 技术方案 · 标定网格;第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条)等 4 处全文命中
2.1.4-c 样本量统计学依据 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 3 章 技术方案 · 「误报」在本方案中的定义等 13 处全文命中
2.1.4-d 标注偏差处理 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条);第 10 章 额外探索 · 10.4 用「LLM 普及前的历史语料」作人类基线以消除标注偏差 — 评估后部分采纳等 3 处全文命中
2.2.1-a 大白话改写 已覆盖 第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对;第 3 章 技术方案 · 鲁棒性测试集设计方案(招标文件第 2.2.1 条要求提供)等 3 处全文命中
2.2.1-b 故意加错别字 已覆盖 第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对;第 8 章 预期效果 · 8.3 对抗鲁棒性
2.2.1-c 调乱语序 已覆盖 第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对;第 8 章 预期效果 · 8.3 对抗鲁棒性
2.2.1-d 同义词批量替换 已覆盖 第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对;第 3 章 技术方案 · 鲁棒性测试集设计方案(招标文件第 2.2.1 条要求提供)等 3 处全文命中
2.2.1-e 中英混杂 已覆盖 第 3 章 技术方案 · 标定网格;第 3 章 技术方案 · 3.4 分文体专项校准等 6 处全文命中
2.2.1-f 分段检测逐个击破/篇章级≥2万字 已覆盖 第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对;第 3 章 技术方案 · 结果一致性(写入违约责任)等 7 处全文命中
2.2.1-g 鲁棒性测试集设计方案+预期抵抗率 已覆盖 第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对;第 3 章 技术方案 · 鲁棒性测试集设计方案(招标文件第 2.2.1 条要求提供)等 4 处全文命中
2.2.2-a 禁二分类,语义片段为最小单元 已覆盖 第 3 章 技术方案 · 中英混合片段的语言判定(对应招标文件第 2.3.1 条);第 3 章 技术方案 · 三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围等 10 处全文命中
2.2.2-b 三层聚合 已覆盖 第 3 章 技术方案 · 三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围;第 8 章 预期效果 · 8.3 对抗鲁棒性等 3 处全文命中
2.2.2-c L0-L3阈值 已覆盖 第 3 章 技术方案 · 综合等级由三层数据共同决定;第 3 章 技术方案 · 各等级置信度分数等 4 处全文命中
2.2.2-d 输出各等级置信度分数而非单一标签 已覆盖 第 3 章 技术方案 · 各等级置信度分数;第 3 章 技术方案 · 报告必含的四个模块(对应招标文件第 2.3.1 条)等 4 处全文命中
2.2.3-a 新LLM发布时模型更新周期与流程 已覆盖 第 3 章 技术方案 · 月度复标;第 3 章 技术方案 · 一、新一代大模型发布时,模型的更新周期与流程等 11 处全文命中
2.2.3-b 防对抗样本逆向攻击 已覆盖 第 3 章 技术方案 · 二、如何防止模型被对抗样本针对性地逆向攻击;速览 · 招标必备要件 → 本文位置等 14 处
2.2.3-c 检测算法自身用AI引入的偏差及控制 已覆盖 速览 · 招标必备要件 → 本文位置
2.3.1-1 报告模块1 总体评估(等级/波及/密度/说明/时间/版本) 已覆盖 第 3 章 技术方案 · 报告必含的四个模块(对应招标文件第 2.3.1 条);第 3 章 技术方案 · 明令不合格做法的逐条回应(禁止表述清单)等 5 处全文命中
2.3.1-2 报告模块2 片段级分析(章节分布+密度) 已覆盖 第 3 章 技术方案 · 三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围;第 3 章 技术方案 · 报告必含的四个模块(对应招标文件第 2.3.1 条)等 5 处全文命中
2.3.1-3 报告模块3 特征分析证据链(原文+基线值+σ) 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 3 章 技术方案 · 三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围等 8 处全文命中
2.3.1-4 报告模块4 人工复核指引 已覆盖 第 3 章 技术方案 · 古文豁免:三层机制,不依赖「这段古文我们见过」;第 3 章 技术方案 · 报告必含的四个模块(对应招标文件第 2.3.1 条)等 8 处全文命中
2.3.1-5 拆分优先级4级+80字/40词 已覆盖 第 3 章 技术方案 · 最小分析单元 = 语义片段;第 7 章 预算报价 · 表6:关键数量的估算说明等 4 处
2.3.1-6 短片段<5字/3词合并 已覆盖 第 3 章 技术方案 · 最小分析单元 = 语义片段
2.3.1-7 语言检测模型 langdetect/fastText 已覆盖 第 3 章 技术方案 · 中英混合片段的语言判定(对应招标文件第 2.3.1 条)
2.3.1-8 混合片段按>60%字符归属选基线 已覆盖 第 3 章 技术方案 · 中英混合片段的语言判定(对应招标文件第 2.3.1 条);第 3 章 技术方案 · 招标文件第 2.2.1 条六类对抗手段的逐条应对等 3 处全文命中
2.3.1-9 至少两个维度>2σ 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 3 章 技术方案 · 三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围等 6 处全文命中
2.3.1-10 说明用哪些特征维度+阈值统计学依据 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 3 章 技术方案 · 三层聚合:片段级偏离 → 段落级密度 → 篇章级波及范围等 5 处全文命中
2.3.1-11 禁止表述6条 已覆盖 第 3 章 技术方案 · 明令不合格做法的逐条回应(禁止表述清单);第 8 章 预期效果 · 8.5 可解释性等 5 处
2.3.2-a 24小时内3次偏差≤5% 已覆盖 第 3 章 技术方案 · 结果一致性(写入违约责任);第 7 章 预算报价 · 表6:关键数量的估算说明等 6 处全文命中
2.3.2-b 不同部署实例结果一致 已覆盖 第 3 章 技术方案 · 结果一致性(写入违约责任);第 7 章 预算报价 · 表6:关键数量的估算说明等 5 处全文命中
2.3.2-c 全文与分章节合并偏差≤5% 已覆盖 第 3 章 技术方案 · 结果一致性(写入违约责任);第 5 章 实施计划 · 阶段四:D+19 — D+22 标定与盲测(算法 + 测试 11 人)等 5 处全文命中
2.3.3 六个不合格做法逐条回应 已覆盖 第 3 章 技术方案 · 综合等级由三层数据共同决定;第 3 章 技术方案 · 明令不合格做法的逐条回应(禁止表述清单)等 7 处全文命中
2.4.1 教师决策/无处罚建议/引导性提问 已覆盖 第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条);第 11 章 附录 · 报告样例 · 四、人工复核指引(招标文件第 2.3.1 条模块 4)等 5 处
2.4.2 L1/L3提示语+诚信指南模块 已覆盖 第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条)
2.4.3 统计API+学校自定义AI使用边界 已覆盖 第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条);速览 · 招标必备要件 → 本文位置
2.4.4 学生免费/不限次/即时 已覆盖 第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条);速览 · 招标必备要件 → 本文位置等 6 处
2.5.1-a ≥10000篇并发 已覆盖 第 3 章 技术方案 · 3.8 弹性与峰值保障;第 5 章 实施计划 · 阶段四:D+19 — D+22 标定与盲测(算法 + 测试 11 人)等 7 处全文命中
2.5.1-b 单篇≤3分钟含排队 已覆盖 第 3 章 技术方案 · 3.8 弹性与峰值保障;第 3 章 技术方案 · 3.11 教育价值:教师决策、系统辅助(对应招标文件第 2.4 条)等 9 处全文命中
2.5.1-c 可用性≥99.5% 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 8 章 预期效果 · 8.4 检测速度
2.5.1-d 日处理≥60000次 已覆盖 第 7 章 预算报价 · 表3:软件、数据与第三方费用;第 7 章 预算报价 · 表6:关键数量的估算说明等 3 处全文命中
2.5.1-e ≥500万条报告+正文≤30天 已覆盖 第 3 章 技术方案 · 3.6 数据治理、存储与生命周期;第 7 章 预算报价 · 表6:关键数量的估算说明等 18 处
2.5.2-a 混合云私有化部署不出域 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 3 章 技术方案 · 3.10 安全与合规等 4 处全文命中
2.5.2-b 毕业季自动扩容无需人工 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 3 章 技术方案 · 3.8 弹性与峰值保障等 5 处全文命中
2.5.2-c 两地三中心 RPO≤5min RTO≤30min 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 7 章 预算报价 · 表4:前期人天等 3 处全文命中
2.5.3-a 微服务+K8s容器化 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 7 章 预算报价 · 表4:前期人天等 8 处
2.5.3-b 主流浏览器最近两个大版本 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态
2.5.3-c 导师端移动小程序 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 3 章 技术方案 · 3.7 平台、接口与学校接入等 7 处全文命中
2.5.3-d 国产数据库适配 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 5 章 实施计划 · 阶段三:D+13 — D+18 平台与部署(后端 + 前端 + SRE + 安全 13 人)等 3 处全文命中
2.5.4-a RESTful API + SDK(Java/Python/Node) 已覆盖 第 3 章 技术方案 · 3.7 平台、接口与学校接入;第 5 章 实施计划 · 阶段三:D+13 — D+18 平台与部署(后端 + 前端 + SRE + 安全 13 人)等 4 处全文命中
2.5.4-b 知网/维普/万方数据互通 已覆盖 第 7 章 预算报价 · 我们主动砍掉的一项,以及为什么它本来就不该在表里;第 10 章 额外探索 · 10.0 来源分级:哪些是查到的,哪些是我方自己的判断等 4 处全文命中
2.5.4-c CAS/OAuth2.0/SAML 已覆盖 第 3 章 技术方案 · 3.7 平台、接口与学校接入;第 5 章 实施计划 · 阶段三:D+13 — D+18 平台与部署(后端 + 前端 + SRE + 安全 13 人)等 6 处全文命中
2.5.4-d GB/T 36351.1 数据标准 已覆盖 第 3 章 技术方案 · 3.7 平台、接口与学校接入;第 3 章 技术方案 · 数据最小化:系统采集哪些字段,以及不采集哪些(对应招标文件第 3.2 条)等 3 处全文命中
2.5.5-a 不得把服务器/接入/运维转甲方另付 已覆盖 第 3 章 技术方案 · 3.7 平台、接口与学校接入;第 3 章 技术方案 · 一、新一代大模型发布时,模型的更新周期与流程等 14 处全文命中
2.5.5-b 禁向学生收费+禁套餐升级另购模块 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设);第 3 章 技术方案 · 3.8 弹性与峰值保障等 8 处
2.6 额外探索:区分AI线索/自己想法/拟实施 已覆盖 第 10 章 额外探索 · (章首);速览 · 招标必备要件 → 本文位置等 5 处
3.1-1 知识产权归甲方 已覆盖 第 3 章 技术方案 · 3.10 安全与合规;第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)等 3 处全文命中
3.1-2 终止后完整移交 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条);第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)等 25 处
3.1-3 第三方组件逐项声明+开源许可证 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条);第 3 章 技术方案 · 双模型交叉校验等 5 处
3.2-a 数据所有权归学生与高校 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设);第 3 章 技术方案 · 3.1 总体架构与部署形态等 44 处
3.2-b 数据最小化 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条)
3.2-c 正文≤30天/脱敏报告3年 已覆盖 第 3 章 技术方案 · 3.6 数据治理、存储与生命周期;第 3 章 技术方案 · 四套数据的物理隔离等 5 处
3.2-d 严禁用学生论文训练 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条);第 7 章 预算报价 · 表3:软件、数据与第三方费用
3.2-e 等保三级认证 已覆盖 第 3 章 技术方案 · 3.1 总体架构与部署形态;第 3 章 技术方案 · 3.10 安全与合规等 6 处全文命中
3.3-1 算法技术白皮书 已覆盖 第 3 章 技术方案 · 综合等级由三层数据共同决定;第 5 章 实施计划 · 5.1 里程碑总览等 5 处全文命中
3.3-2 接受第三方审计机构审查 已覆盖 第 3 章 技术方案 · 3.10 安全与合规;第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条)等 6 处全文命中
3.3-3 申诉时提供检测过程追溯记录 已覆盖 第 3 章 技术方案 · 3.12 数据集合法性、第三方组件与申诉追溯(对应招标文件第 2.1.4、3.1、3.3 条);第 10 章 额外探索 · 10.4 用「LLM 普及前的历史语料」作人类基线以消除标注偏差 — 评估后部分采纳等 3 处全文命中
5.1-1 D+1 启动会与环境 已覆盖 第 5 章 实施计划 · 5.0 这份 30 天计划成立的三项前提(签约前即可验,不成立则计划前提不成立);第 5 章 实施计划 · 5.1 里程碑总览等 8 处全文命中
5.1-2 D+3 白皮书 已覆盖 第 3 章 技术方案 · 综合等级由三层数据共同决定;第 3 章 技术方案 · 「误报」在本方案中的定义等 10 处全文命中
5.1-3 D+12 Alpha 已覆盖 第 5 章 实施计划 · 5.0 这份 30 天计划成立的三项前提(签约前即可验,不成立则计划前提不成立);第 5 章 实施计划 · 5.1 里程碑总览等 9 处全文命中
5.1-4 D+18 Beta 已覆盖 第 5 章 实施计划 · 5.1 里程碑总览;第 5 章 实施计划 · 阶段三:D+13 — D+18 平台与部署(后端 + 前端 + SRE + 安全 13 人)等 4 处全文命中
5.1-5 D+22 盲测验收 已覆盖 第 3 章 技术方案 · 8 个特征维度与异常片段判定;第 3 章 技术方案 · 标定方法与两张输出表等 18 处全文命中
5.1-6 D+27 完整交付 已覆盖 第 5 章 实施计划 · 5.1 里程碑总览;第 5 章 实施计划 · 阶段五:D+22 — D+30 接入上线与交付(SRE + 支持 + 全员 33 人)等 3 处全文命中
5.1-7 D+28~30 验收测试 已覆盖 第 3 章 技术方案 · 3.7 平台、接口与学校接入;第 5 章 实施计划 · 5.1 里程碑总览等 6 处全文命中
5.1-9 合同终止前30天源码移交 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)
5.2 付款节奏 30/50/15/5 已覆盖 第 5 章 实施计划 · 5.1 里程碑总览;第 9 章 风险分析 · 9.10 判定式的独立性假设失效(概率:高 · 影响:τ_格 被迫抬高,召回下降)等 50 处
6-1 服务期 30天+36个月 已覆盖 第 5 章 实施计划 · 5.1 里程碑总览;第 5 章 实施计划 · 阶段五:D+22 — D+30 接入上线与交付(SRE + 支持 + 全员 33 人)
6-2 维护范围含缺陷修复/模型更新/故障处理 已覆盖 第 7 章 预算报价 · 表6:关键数量的估算说明;第 3 章 技术方案 · 古文豁免:三层机制,不依赖「这段古文我们见过」等 7 处
6-3 2小时响应/4小时恢复 已覆盖 第 6 章 团队与服务承诺 · 关于「全年连续在岗」,我们说清楚边界;第 7 章 预算报价 · 表5:三年运维人员等 5 处全文命中
6-4 违约:误报率连续两月>1.5%可解约 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设);第 8 章 预期效果 · 8.1 误报率(第一约束)等 3 处全文命中
6-5 核心研发不可转包 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)
6-6 退出机制:数据迁移工具+技术支持 已覆盖 第 6 章 团队与服务承诺 · 6.3 投标人资质(按招标文件允许的方式声明为投标假设)

关于「已覆盖」的边界:本表证明的是「招标要求在正文中有正面回应」,不证明该回应的水平足以通过验收。后者由第 8 章的承诺值与 D+22 盲测报告负责。凡我方认为做不到或证不出的,写在第 8 章「我们做不到的部分」与第 9 章,不在本表用「已覆盖」盖过去。