跳转至

试验设计、变量控制与统计判定

试验设计的目标不是制造一张漂亮曲线,而是用最少且风险可控的运行区分竞争解释,并估计结论的不确定性。

试验设计与因果控制

从问题到假设

先判断问题类型,不是每个测试都需要原假设显著性检验:

问题类型 核心输出 典型方法
描述与估计 值、变异和置信区间 描述统计、区间估计
符合性判定 是否满足预设工程限值 测量不确定度、保护带
比较 候选间效应大小 对照设计、区间或检验
等效/非劣 是否落在预设等效界值内 等效区间或专门检验
可靠性/寿命 失效概率、寿命或下限 寿命模型、删失数据方法
探索 发现趋势和后续假设 图形、筛选设计、独立确认

统计显著性不能替代工程通过判据。符合性试验通常直接针对批准限值,不需要为了得到p<0.05另造原假设。

需要统计推断时再写:

  • 问题;
  • 原假设与备择假设;
  • 需要检测的最小实际效应;
  • 响应变量;
  • 控制因素;
  • 噪声因素;
  • 混杂因素;
  • 实验单元;
  • 判据和决策。

例如“新螺旋桨更高效”至少要定义:

  • 在什么推力、转速、电压和环境下;
  • 效率是克每瓦、牛顿每瓦还是任务能耗;
  • 多大差异才值得更换;
  • 测试的是一副桨还是设计总体;
  • 如何处理电池电压、温度和电机差异。

因素、水平和响应

对象 示例
因素 螺旋桨型号、电压、控制设置
水平 型号A/B、四串/六串、低/中/高工作点
响应 推力、功率、温升、振动
噪声因素 环境温度、电池状态、操作者
实验单元 一次独立装夹后的动力组合运行

同一日志里的多个采样点通常属于一个实验单元,不能当成独立重复。

一次一因素的限制

一次一因素(OFAT,One Factor At a Time)便于初步排查,但难以发现交互作用。例如滤波设置在低转速和高转速下可能产生不同效果。

析因设计可以同时估计:

  • 主效应;
  • 因素交互;
  • 曲率;
  • 噪声和区组影响。

高风险实物试验不应为了统计完整性无条件执行所有组合。先在模型、SITL或低能量台架筛选,再把必要组合带入高风险环境。

随机化

随机化用于降低运行顺序与未知变化混杂的风险。例如按A-A-A-B-B-B执行时,电池衰减可能被误认为型号差异。

随机化前仍要满足:

  • 每个顺序在安全上允许;
  • 设备能够恢复到一致初始状态;
  • 暖机和冷却条件明确;
  • 切换不会引入残留效应。

若安全要求必须按低载荷到高载荷递增,不能强行完全随机;应记录限制,使用区组、交叉日次或独立样件降低偏差。

区组

对已知且难以消除的变化源使用区组:

  • 电池批次;
  • 测试日期;
  • 操作者;
  • 电机个体;
  • 环境温度区间;
  • 场地;
  • 固件构建。

在同一区组内比较候选,避免把日次或样件差异混入处理效应。

对照

对照可能是:

  • 当前批准配置;
  • 未施加处理的空白;
  • 已知可检测异常的阳性对照;
  • 已知正常的参考件;
  • 中心点运行;
  • 零输入或假负载。

不同对照作用不同。没有当前批准基线时,“候选更好”可能只是在两个未知状态中选择一个。

重复与伪重复

真正重复需要独立重新建立实验条件。以下通常不构成独立重复:

  • 同一运行的多个采样点;
  • 同一文件的重复处理;
  • 同一装夹连续读取;
  • 多个算法窗口覆盖相同原始数据;
  • 多个电机通道共享同一电池和环境却被当作完全独立。

技术重复可以估计测量短期波动,但不能代替独立样件和独立运行。

样本量

样本量应在执行前依据:

  • 最小有实际意义的效应;
  • 变异估计;
  • 显著性水平(\alpha);
  • 检验功效(1-\beta);
  • 单侧或双侧;
  • 设计结构;
  • 允许的丢失和无效运行;
  • 安全与资源约束。

不能按“至少三次”作为所有试验通用规则。样本过少可能无法区分等效和证据不足;样本过多又可能把没有工程意义的微小差异判成统计显著。

置信区间优先

报告:

  • 效应估计;
  • 置信区间;
  • 单位;
  • 样本量;
  • 设计;
  • 模型假设;
  • 原始分布;
  • 缺失和异常。

只报告(p)值会隐藏效应大小和不确定性。

p<\alpha表示在模型与原假设成立时数据足够极端,支持拒绝原假设。它不表示原假设为假的概率,也不表示效应有实际价值。

p\ge\alpha只表示未能拒绝,不能证明“完全相同”。等效需要预先定义等效界值并使用相应区间或检验。

单侧和双侧

只关心“是否更高”时也不能随意使用单侧检验。必须在看数据前说明:

  • 反方向差异是否没有安全意义;
  • 为什么只需一个方向;
  • 判据与风险是否允许。

安全指标常常两个方向都重要,例如响应过慢和过快都可能有风险。

多重比较

对多个候选、指标和时间窗反复使用未校正的(\alpha=0.05),会增加至少一次假阳性的概率。

可按设计使用:

  • 预先指定少量对比;
  • Bonferroni或其他族错误率控制;
  • Tukey/Tukey-Kramer全配对;
  • 假发现率控制;
  • 同时置信区间。

全局方差分析显著只说明至少一组不同,不说明每一对都不同。

异常值

处理顺序:

  1. 标记,不立即删除;
  2. 检查原始记录、仪器、配置和操作;
  3. 判断是否为数据错误、真实极端或未知;
  4. 按预先规则处理;
  5. 同时报告包含与不包含该点的敏感性分析;
  6. 保存原值和处置理由。

异常值检验通常有分布假设。连续反复删除“最异常点”会放大错误率,并可能删除真实故障证据。

缺失数据

记录缺失原因:

  • 仪器丢样;
  • 测试中止;
  • 样件故障;
  • 文件损坏;
  • 人工漏记;
  • 判据触发后停止。

由故障导致的缺失通常不是随机缺失。只分析成功完成的运行会产生幸存者偏差。

一个受控动力比较示例

目标:比较候选A和当前基线B在三个预先批准工作点的输入功率。

设计:

  • 以电机个体和测试日期为区组;
  • 每次运行重新安装并检查;
  • 在区组内随机A/B顺序;
  • 电池使用受控电源或记录电压状态;
  • 工作点顺序按安全要求从低到高;
  • 每个工作点达到稳定条件后取预定义窗口;
  • 推力、转速、电压、电流和温度同步记录;
  • 超温、振动或工装位移立即停止;
  • 分析主效应、工作点交互和置信区间。

若A只在高工作点改善,而温升和振动越界,不能只报告平均效率更高。

预注册测试卡

问题类型:估计/符合性/比较/等效/可靠性/探索
问题与需求ID:
原假设/备择假设:适用时填写
最小实际效应:
响应及单位:
因素与水平:
实验单元:
区组:
随机化:
重复:
样本量依据:
统计模型:
异常和缺失处理:
多重比较处理:
工程通过判据:
不通过判据:
无效判据:
停止条件:

检查理解

  1. 为什么同一日志中的千个采样点不等于千次试验?
  2. 区组与随机化分别解决什么问题?
  3. p≥0.05能否证明两个方案等效?
  4. 为什么异常值不能只按数值大小删除?
  5. 安全递增加载与随机顺序冲突时如何处理?

主要参考