批号 | 编号 | 含量%(w/v) |
|---|---|---|
210261-A | 1 | 0.05333 |
210261-A | 2 | 0.05347 |
309281-A | 1 | 0.05346 |
309281-A | 2 | 0.05350 |
310041-A | 1 | 0.05379 |
310041-A | 2 | 0.05376 |
310051-A | 1 | 0.05363 |
310051-A | 2 | 0.05379 |
311221-A | 1 | 0.05373 |
311221-A | 2 | 0.05356 |
312201-A | 1 | 0.05370 |
312201-A | 2 | 0.05362 |
6 依地酸二钠容忍区间计算
6.1 原始数据
6.2 数据预处理
批号 | 编号1 | 编号2 | 差值 | 相对差值 | 均值 |
|---|---|---|---|---|---|
210261-A | 0.05333 | 0.05347 | -0.00014 | -0.0026251641 | 0.053400 |
309281-A | 0.05346 | 0.05350 | -0.00004 | -0.0007482230 | 0.053480 |
310041-A | 0.05379 | 0.05376 | 0.00003 | 0.0005577245 | 0.053775 |
310051-A | 0.05363 | 0.05379 | -0.00016 | -0.0029834048 | 0.053710 |
311221-A | 0.05373 | 0.05356 | 0.00017 | 0.0031639680 | 0.053645 |
312201-A | 0.05370 | 0.05362 | 0.00008 | 0.0014897579 | 0.053660 |
6.3 正态检验和异常值检验
Shapiro-Wilk normality test
data: df1$`含量%(w/v)`
W = 0.93653, p-value = 0.4544
p = 0.4544> 0.05. 无法拒绝原假设,数据呈正态分布。
Grubbs test for two opposite outliers
data: df1$`含量%(w/v)`
G = 3.0800, U = 0.5427, p-value = 1
alternative hypothesis: 0.05333 and 0.05379 are outliers
p = 1可得原始数据中无异常值。
6.4 容忍区间计算
设置参数如下:
置信水平:95% 或 \(\alpha=0.05\)
覆盖比例(P):99%
区间类型:单侧容忍上限(UTL)
计算可得n=6时的单侧容忍因子为5.061989
6.4.1 使用每份样品中测量编号为1的含量%(w/v)计算容忍区间
alpha | P | 均值 | 单边容忍区间上限 |
|---|---|---|---|
0.05 | 0.99 | 0.05360667 | 0.05450117 |
使用sas验证结果:
```{sas}
proc import datafile="/mnt/fnos_share/Research/依地酸二钠/Data/df.xlsx"
out=work.df1
dbms=xlsx
replace;
sheet="Sheet 1";
getnames=yes;
run;
proc capability data=df1;
intervals ID_1/ alpha=0.05 0.01 methods=3 P= 0.95 0.99 type=upper;
run;
```
6.4.2 使用每份样品中测量编号为2的含量%(w/v)计算容忍区间
alpha | P | 均值 | 单边容忍区间上限 |
|---|---|---|---|
0.05 | 0.99 | 0.05361667 | 0.05429177 |
6.4.3 使用每份样品中两次测量的均值计算容忍区间
alpha | P | 均值 | 单边容忍区间上限 |
|---|---|---|---|
0.05 | 0.99 | 0.05361167 | 0.05433443 |
6.4.4 更多不同参数的容忍区间计算
alpha | P | 均值 | 单边容忍区间上限 |
|---|---|---|---|
0.10 | 0.90 | 0.05360667 | 0.05404733 |
0.05 | 0.90 | 0.05360667 | 0.05413790 |
0.01 | 0.90 | 0.05360667 | 0.05438615 |
0.10 | 0.95 | 0.05360667 | 0.05415303 |
0.05 | 0.95 | 0.05360667 | 0.05426185 |
0.01 | 0.95 | 0.05360667 | 0.05456188 |
0.10 | 0.99 | 0.05360667 | 0.05435637 |
0.05 | 0.99 | 0.05360667 | 0.05450117 |
0.01 | 0.99 | 0.05360667 | 0.05490276 |
6.5 结论
申报产品EDTA标称值0.055%(w/v)超过已上市同类产品的容忍区间上限。
6.6 tolerance interval 容忍区间公式推导
6.6.1 置信区间 (Confidence Interval)
置信区间是对总体参数\(\theta\)的区间估计:在重复抽样下,该区间以概率\(\gamma = 1-\alpha\)覆盖真实参数值。双侧置信区间可表示为:
\[ \Pr(L \leq \theta \leq U) = 1-\alpha \]
其中\(L\)和\(U\)是样本的函数(随机变量),\(\theta\)是未知的固定参数。
6.6.2 容忍区间 (Tolerance Interval)
容忍区间回答的是另一个问题:给定置信水平\(\gamma = 1-\alpha\),总体中至少比例\(P\)的个体落在哪个区间内?
设\(X\)为来自连续分布\(f\)的随机变量,则:
单侧容忍下限 \([L, +\infty)\): \[ \Pr\bigl(1 - F_X(L) \geq P\bigr) = 1-\alpha \]
即我们有\(1-\alpha\)的把握认为总体中至少\(100P\%\)的观测值不小于\(L\)。
单侧容忍上限 \((-\infty, U]\): \[ \Pr\bigl(F_X(U) \geq P\bigr) = 1-\alpha \]
即我们有\(1-\alpha\)的把握认为总体中至少\(100P\%\)的观测值不大于\(U\)。
双侧容忍区间 \([L, U]\): \[ \Pr\bigl(F_X(U) - F_X(L) \geq P\bigr) = 1-\alpha \]
即我们有\(1-\alpha\)的把握认为总体中至少\(100P\%\)的观测值落在\([L, U]\)内。
注意:上述概率是针对\(L\)和\(U\)(作为随机变量)取的,\(F_X(\cdot)\)是总体的累积分布函数。这与置信区间的区别在于——置信区间针对参数,容忍区间针对总体的某个比例。
6.6.3 当数据服从正态分布时的单侧容忍上限
设\(X \sim \mathcal{N}(\mu, \sigma^2)\),其密度函数为:
\[ f(x) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left[-\frac{1}{2}\left(\frac{x-\mu}{\sigma}\right)^2\right] \]
取单侧容忍上限的形式为\(U = \bar{X} + kS\),其中\(\bar{X}\)为样本均值,\(S\)为样本标准差,\(k\)为待求的容忍因子(tolerance factor)。
6.6.3.1 推导过程
由单侧容忍上限的定义,\(k\)须满足:
\[ \Pr\bigl(F_X(\bar{X} + kS) \geq P\bigr) = 1-\alpha \]
由于\(X \sim \mathcal{N}(\mu, \sigma^2)\),其CDF可标准化:
\[ \begin{align} F_X(\bar{X} + kS) &= \int_{-\infty}^{\bar{X} + kS} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left[-\frac{1}{2}\left(\frac{x-\mu}{\sigma}\right)^2\right] dx \\ &= \int_{-\infty}^{(\bar{X} - \mu + kS)/\sigma} \frac{1}{\sqrt{2\pi}} e^{-z^2/2} \, dz \\ &= \Phi\left(\frac{\bar{X} - \mu + kS}{\sigma}\right) \end{align} \]
其中\(\Phi(\cdot)\)为标准正态分布的累积分布函数。因此条件\(F_X(\bar{X} + kS) \geq P\)等价于:
\[ \Phi\left(\frac{\bar{X} - \mu + kS}{\sigma}\right) \geq P \quad\Leftrightarrow\quad \frac{\bar{X} - \mu + kS}{\sigma} \geq z_P \]
其中\(z_P = \Phi^{-1}(P)\)为标准正态分布的\(P\)分位数。代入定义式:
\[ \Pr\left(\frac{\bar{X} - \mu + kS}{\sigma} \geq z_P\right) = 1-\alpha \tag{1} \]
令\(Z = \frac{\sqrt{n}(\bar{X} - \mu)}{\sigma} \sim \mathcal{N}(0,1)\),\(U = \frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)\),且\(Z\)与\(U\)相互独立。将式(1)两边乘以\(\sqrt{n}\):
\[ \Pr\left(Z + k\sqrt{n} \cdot \frac{S}{\sigma} \geq \sqrt{n}\,z_P\right) = 1-\alpha \]
由于标准正态分布是对称的(\(-Z \sim \mathcal{N}(0,1)\)),将不等式整理:
\[ \begin{align} \Pr\left(Z + k\sqrt{n}\,\frac{S}{\sigma} \geq \sqrt{n}\,z_P\right) &= 1-\alpha \\[4pt] \Pr\left(-Z \leq k\sqrt{n}\,\frac{S}{\sigma} - \sqrt{n}\,z_P\right) &= 1-\alpha \\[4pt] \Pr\left(\frac{-Z + \sqrt{n}\,z_P}{S/\sigma} \leq k\sqrt{n}\right) &= 1-\alpha \end{align} \]
定义随机变量:
\[ T = \frac{\dfrac{\sqrt{n}(\mu - \bar{X})}{\sigma} + \sqrt{n}\,z_P}{S/\sigma} = \frac{-Z + \sqrt{n}\,z_P}{\sqrt{\dfrac{U}{n-1}}} \]
则\(T\)服从非中心\(t\)分布,自由度为\(n-1\),非中心参数为\(\delta = \sqrt{n}\,z_P\) (Tolerance Intervals for Univariate Distributions - Guenther - 1972 - Naval Research Logistics Quarterly - Wiley Online Library, n.d.; Young and Cheng 2024)。记为:
\[ T \sim t\bigl(df = n-1,\; \delta = \sqrt{n}\,z_P\bigr) \]
因此,
\[ \Pr\left(T \leq k\sqrt{n}\right) = 1-\alpha \]
即\(k\sqrt{n}\)为非中心\(t\)分布的\((1-\alpha)\)分位数。由此解出容忍因子:
\[ \boxed{k = \frac{t_{\,n-1,\;1-\alpha}\bigl(\delta = \sqrt{n}\,z_P\bigr)}{\sqrt{n}}} \]
6.6.3.2 非中心t分布
非中心\(t\)分布在中心\(t\)分布的基础上引入非中心参数\(\delta\),用于刻画备择假设下检验统计量的分布。当\(\delta = 0\)时退化为中心\(t\)分布。在容忍区间问题中,\(\delta\)反映了\(P\)与\(0.5\)的偏离程度——\(P\)越接近1,\(\delta\)越大,容忍因子\(k\)也越大。