ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

方法章与实验设计也要双版本烟测:三列表 + A/B 验收表

方法章与实验设计也要双版本烟测:三列表 + A/B 验收表 千笔-AIWritePaper · https://www.aiwritepaper.com方法章最常见的假完成是写得像方法「本研究采用实验法将学生随机分为实验组和对照组通过前后测比较干预效果使用 SPSS 进行显著性检验。」每个词都对答辩时却经不起三个追问随机是怎么随机的每组多少人、依据是什么「显著性检验」具体是哪一个检验主要结局是哪一项这类方法段的问题不在措辞而在第三个人拿着它无法把研究重做一遍。本文沿用双版本烟测的做法先把方法章拆成三张列表作为真源再把同一项研究写成两个版本——A 是口号式方法段B 是可复现设计——各自交给一段脚本去「执行」看哪一版能跑起来、跑出来的结论能否复核。只比 A 和 B 还不够因为最危险的往往是看起来很具体的伪 B所以再加三个失败对照功效写错、多结局不校正、分配单位和分析单位不一致。所有数字来自 2026-09-27 本机实跑数据为模拟生成脚本和 CSV 留档在_w/method-ab/。图左侧三列表是方法章真源中部为 A、B 两版的可执行性与复跑结果右侧三个伪 B 的实测假阳性率与功效红色为失败。目标说明读完你应能独立完成四件事用变量表、流程表、分析表三张列表写出方法章的真源任何段落都从这三张表生成。用 12 个可执行字段检查方法段缺一个字段第三人就无法重做。对自己的设计做两项可复核验证功效计算复核、同一随机种子复跑一致。认出三类「看起来很具体」的伪设计并知道各自会把假阳性率或功效推到多离谱。适用与边界适合定量研究的方法章随机对照、准实验、组间比较、前后测设计。开题或预答辩前想确认方法段是否经得起「你怎么保证可重复」的追问。合写论文需要一份团队都认可的设计真源。不该指望定性研究访谈、民族志的方法章另有标准12 字段不适用需要换成抽样策略、编码流程、饱和判断等要素。模拟只能说明「这样设计会有什么统计后果」不能替代正式的统计咨询复杂设计多层模型、交叉设计请找统计人员复核。数字的失败含义本文的假阳性率来自零效应下的模拟反映设计缺陷的量级不是某项真实研究的结果。三列表方法章的真源列表列示例B 版变量表变量 · 角色 · 操作化 · 测量工具 · 时间点后测成绩 · 主要结局 · 百分制 · 统一试卷 · 干预后第 1 周流程表步骤 · 参数 · 执行人 · 记录物1:1 分配 · seed20260927 · 非任课教师 · 分配清单 CSV分析表假设 · 检验 · 判定规则 · 多重比较 · 缺失处理H1 两组后测差异 · Welch t 检验 · α0.05 双侧 · 次要结局 Holm 校正 · 意向治疗三张表的好处是逼你把每个名词落到可执行的值「随机」必须落到分配方法和种子「显著性检验」必须落到检验名和判定规则。从三列表生成方法段B 版全文三张表填完之后方法段只是把表逐行翻译成句子。B 版就是这样生成的全文如下示例研究为虚构两组平行随机对照主要结局为后测成绩百分制以个体为随机单位按学号用 seed20260927 的伪随机序列 1:1 分配预期效应 d0.5α0.05 双侧功效 0.80每组 64 人主要分析为独立样本 t 检验Welch次要结局 4 项用 Holm 校正缺失按意向治疗全部纳入。生成规则只有三条每句话必须回指到三列表中的一行表里没有的内容不写进段落段落改动时先改表再重新生成句子。这样做的直接收益是导师问到任何一个细节你都能指着表里那一行回答而不是临场组织语言。它也让合写更容易分工的人各自维护一张表段落最后统一生成不会出现第二章写 60 人、第四章写 64 人的前后矛盾。12 个可执行字段字段A 口号式B 可复现设计类型「实验法」两组平行随机对照随机单位未写个体分配方法「随机分组」按学号 1:1 伪随机分配随机种子未写20260927主要结局「教学效果」后测成绩百分制预期效应量未写d0.5α未写0.05 双侧功效未写0.80每组样本量未写64主要检验「显著性检验」Welch t 检验多重比较未写次要结局 4 项 Holm 校正缺失处理未写意向治疗全部纳入A 段能对应上的只有「随机」「前后测」几处模糊描述12 个字段里没有一个能直接填值B 段 12 个字段全部有值。真 A/B 实跑结果method_ab.py按上表检查可执行字段然后对 B 做功效复核和同种子复跑再对三个伪 B 做模拟。完整输出如下A 口号式 | 可执行字段 12 项 | 0/12 缺:design,unit,allocation,seed,primary_outcome…| FAIL B 可复现 | 可执行字段 12 项 | 12/12 缺: | PASS B 可复现 | 功效复核 d.5 α.05 1-β.8 | 每组 n63.77 → 取 64 | PASS B 可复现 | 同 seed 复跑 | p10.000032 p20.000032 | PASS 伪B1 | 声称每组30人功效0.8 | 实际功效0.478 | FAIL 伪B2 | 5结局不校正 假阳性率 | 未校正0.223 Holm0.047 | FAIL 伪B3 | 整班分配个体t检验 假阳性率 | 个体分析0.329 班级均值分析0.047 | FAIL读法B 的两项复核都过了。用 statsmodels 按 d0.5、α0.05 双侧、功效 0.80 求解每组 63.77 人向上取整为 64与方法段一致同一种子 20260927 复跑两次p 值逐位相同。这两项就是「可复现」最低限度的证据。伪 B1 功效写错方法段写「每组 30 人功效 0.8」按同样的 d0.5 计算实际功效只有 0.478也就是真实效应存在时有一半多的概率检验不出来。伪 B2 多结局不校正5 个结局任一显著就报告零效应下模拟 10000 次至少一项「显著」的比例是 22.3%远高于声称的 5%改用 Holm 校正后回到 4.7%。伪 B3 分配单位与分析单位不一致以班级为单位分配4 班对 4 班每班 32 人班内相关 0.10却把 256 个学生当独立个体做 t 检验零效应下假阳性率 32.9%改用班级均值分析回到 4.7%。三个伪 B 在字面上都比 A 具体得多却各自藏着一个会让结论失真的缺陷。只比 A 和 B这三类问题一个都看不出来。A/B 验收表提交前逐项勾选编号验收项通过标准失败时怎么办M1三列表齐全变量表、流程表、分析表都有方法段每句能回指到表中一行先补表再改段落M212 字段全部有值无「未写」补字段写不出就回到设计阶段M3功效可复核用相同参数重算样本量一致修正样本量或如实写出实际功效M4同种子复跑一致分配清单与主要结果逐位相同固定种子、记录软件版本M5多结局已校正写明校正方法或只设一个主要结局补校正方法或把其余结局降为探索性M6分析单位分配单位整群分配时用整群分析或多层模型改分析方法并按整群重算样本量M7缺失处理写明意向治疗或其他方法二选一写清补写并说明理由失败样本只看 A/B 会放过的三种写法功效是抄来的「参考既往研究每组 30 人可达 80% 功效」但既往研究的效应量比本研究大得多。M3 要求用本研究的参数重算。结局是后选的数据收集完才决定「以成绩和兴趣两项为主要结局」哪项显著就强调哪项。M5 要求主要结局在收集前写死。随机是整班的为了方便教学整班分到实验组分析时却按学生个体计算。M6 能发现而且整群设计需要的样本量通常比个体设计多。当天 40 分钟脚本10 分钟把现有方法段拆进三列表每句找到对应的一行找不到的句子标红。10 分钟对照 12 字段逐项填值把「未写」全部列出来。10 分钟用自己的参数跑一次功效计算固定种子复跑一次分配结果存进 CSV。10 分钟按伪 B 三类逐一自查功效是否重算、结局是否事先写死、分配与分析单位是否一致验收表逐项勾选。总结方法章的标准不是「写得像方法」而是第三个人能照着重做一遍。三列表是真源12 个字段是最低要求功效复核和同种子复跑是可复现的证据。真 A/B 能把口号式方法段筛掉而伪 B 失败对照才能抓住更危险的问题功效 0.478、假阳性 22.3%、假阳性 32.9%都藏在看起来很专业的句子里。
返回列表