症例数設計の計算方法|サンプルサイズが足りないときの対処(Editverse Japan)

症例数設計の計算方法とG*Power|サンプルサイズが足りないときの対処

症例数設計(サンプルサイズ設計)は、研究を始める前に「検出したい差・有意水準・検出力」から必要な人数を計算し、その根拠を記録することです。計算式はデザインごとに異なります。人数が足りないときは、事後の検出力ではなく、効果の推定値と95%信頼区間で率直に示します。

この記事でわかること

  • 症例数設計とは何か、検出力・有意水準・効果量・サンプルサイズの関係
  • 2群の平均値、2群の割合、相関と回帰、生存時間、診断精度の別の計算の考え方
  • Rで計算し、二つの方法で数字を照合する手順(実際の出力つき)
  • G*Powerの入力手順と、論文のMethodsへの書き方
  • サンプルサイズが足りないときに、投稿前にできること

計算式は、研究デザイン(2群の平均値・2群の割合・相関と回帰・生存時間・診断精度)ごとに異なり、Rのpwrパッケージや G*Power で再現できます。本記事では、その計算の手順と、足りない(不足している)ときの現実的な対処を整理します。

1. 症例数設計とは|検出力(Statistical Power)の基礎

臨床の現場では「症例数設計」と呼ばれることが多く、統計の分野では「サンプルサイズ設計」「検出力分析(power analysis)」とも呼ばれます。意味は同じで、「この研究で何例集めればよいか」を、根拠をもって決める作業です。大学の生物統計の相談窓口でも、症例数設計(サンプルサイズ計算)は主要な相談内容の一つとして挙げられています[文献24]。

検出力(1-β)の定義:
効果が実際に存在するとき、それを正しく検出できる確率。

慣例的に、検出力 = 0.80(80%)を目標にすることが多く、研究によっては0.90を設定します。0.80とは、本当に効果があるとき、20%の確率で見逃す(Type II error、β = 0.20)ことを許容するという設定です。

人数が少ない研究には、二つの問題があります。第一に、本当にある効果を見逃しやすくなります。第二に、有意になった結果が真の効果を反映している確率も下がり、効果の大きさは過大に推定されやすくなります[文献4]。心理学の100件の研究を再現した大規模な検証では、再現された効果の大きさは元の研究の約半分でした[文献5]。逆に、人数が非常に多いと、臨床的には意味のない小さな差でも有意になります。人数は「多ければよい」ものではなく、「意味のある差を、必要な精度で知るのに足りる数」を目指します。

2. 4つのパラメーターの相互関係

パラメーター 記号 典型値 役割
有意水準 α 0.05(目的・分野により異なる) 第1種の過誤の許容率
検出力 1-β 0.80(0.90を設定することもある) 真の効果を検出する確率
効果量 d、f、w等 臨床的に意味のある最小の差、または先行研究から 検出したい効果の大きさ
サンプルサイズ n 計算で決定 研究参加者数
重要な原則: 4つのパラメーターのうち3つが決まれば、残り1つが自動的に決まります。通常はα、検出力、効果量を設定してnを計算します。人数が先に決まっている場合は、αと検出力を決めて「検出できる最小の効果量」を計算します(第7節)。
詳しい効果量の選択方法も参照してください。

効果量は、先行研究の推定値を借りるよりも、「臨床的に意味があると考える最小の差」から決めるほうが安全です。小さな研究から得た効果量は不正確で、そのまま使うと人数の見積もりが大きくぶれるためです[文献16]。その具体例は、学位論文の統計(解析計画の立て方と報告のしかた)の実例にあります。Cohen の目安(d = 0.2:小、0.5:中、0.8:大)は慣例にすぎません[文献3]。

3. 症例数設計の計算式|研究デザイン別の早見表

計算式は、比較したいものの種類(連続値の平均、割合、相関、生存時間、診断精度)で変わります。下の表は、両側α=0.05、検出力80%での必要数の例です。いずれもRのpwrパッケージ(pwr 1.3.0)で計算し、別の方法でも照合しました(第5節)。数字は設定の例ですので、ご自身の研究の効果量・標準偏差・割合に置き換えてください。

研究デザイン 効果量などの設定 必要な数(例) 備考
2群の平均値(独立、t検定) Cohen’s d = 0.5(中) 各群64名 d=0.3で各群176名、d=0.8で各群26名
2群の平均値(独立、t検定) Cohen’s d = 0.2(小) 各群394名 小さな差ほど人数が急に増える
3群の平均値(一元配置ANOVA) f = 0.25(中) 各群53名(計159名) 52名では検出力が0.797で、0.80にわずかに届かない
2群の割合 25% 対 40% 各群152名 第4節(実データの割合を参考にした例)
相関分析 r = 0.3(中) 約85名 計算法により84〜85名(第5節)
カイ二乗(2×2) w = 0.3(中) 計88名(87.2を切り上げ) 全体の人数
生存時間(ログランク検定) ハザード比 0.6 イベント121件 人数ではなくイベント数で決まる
診断精度(感度) 感度0.90、信頼区間の半幅0.05 疾患のある人139名(正規近似) 精度(信頼区間の幅)で決める

両側α=0.05、検出力80%。Rのpwr 1.3.0で計算(R 4.3.3)。生存時間はSchoenfeld(1983)の式[文献10]、診断精度はBuderer(1996)の考え方[文献11]による。

脱落の補正: 脱落(解析できない人)が見込まれるときは、必要数に(1+脱落率)を掛けるのではなく、「必要数 ÷(1−脱落率)」で増やします。たとえば必要数が39名で脱落が15%と見込まれるなら、39÷0.85=45.9なので、各群46名です。

4. デザイン別の計算の考え方

4-1. 2群の平均値を比べる(連続値)

必要な入力は、検出したい平均値の差(Δ)、標準偏差(σ)、α、検出力の4つです。効果量は d = Δ÷σ で、1群あたりの人数は、おおよそ 2×(z1−α/2+z1−β)²÷d² です(正規近似。実際にはt分布で少し大きくなります)。

実例(入力値の出典つき)。体重の変化(lb)を主要アウトカムにする2群比較を計画するとします。標準偏差は、実データ MASS::anorexia(神経性やせ症の女性72名、Hand ら 1993)のうち、家族療法群17名と対照群26名の体重変化から求めた統合標準偏差7.68 lb を使います[文献25]。検出したい最小の差を5 lb(ここでは仮に設定した値です)とすると、d = 5÷7.68 = 0.65 で、必要数は1群38.02名、つまり1群39名です。15%の脱落を見込むと1群46名(計92名)になります。

4-2. 2群の割合を比べる(有無・イベントの発生割合)

必要な入力は、2群それぞれの割合(p₁、p₂)、α、検出力です。同じ差でも、割合が0.5に近いほど(ばらつきが大きいほど)人数は増えます。割合の差が小さいと、人数は急に増えます。

実例。R に付属の実データ MASS::birthwt(Baystate Medical Center、1986年、189名)では、低出生体重児の割合が、非喫煙の母親で25.2%(29/115)、喫煙した母親で40.5%(30/74)でした[文献25]。この割合を丸めた「25%対40%」を新しい研究の想定とすると、必要数は各群152名です。ただし、このデータそのものの差(15.3ポイント)の95%信頼区間は1.6〜29.0ポイントと広く、1回の小さな調査の差をそのまま計画に使うと、人数の見積もりは大きく変わります。

4-3. 相関と回帰分析

相関。想定する相関係数 r と、α・検出力から人数を計算します。r=0.3 なら約85名ですが、近似の方法によって84〜85名と1名ほど差が出ます(第5節で確認)。

回帰分析。回帰では、「何名必要か」より先に「何個の説明変数を入れられるか」が問題になります。ロジスティック回帰やCox回帰では、「説明変数1個あたりイベント10件以上」(EPV=10)が目安として広く知られています。これはシミュレーション研究にもとづく経験則です[文献6、7]。ただし、10は機械的に当てはめる基準ではありません。EPVを緩めてよい状況があることがシミュレーションで示されています[文献8]。また、予測モデルをつくる場合は、EPVだけでなく、予想されるモデルの当てはまり、候補となる変数の数、アウトカムの割合から必要数を計算する方法が提案されています[文献9]。

実例(仮定にもとづく計算例)。アウトカムの割合を20%、候補となるパラメーターを10個、予想されるCox-Snell R²を0.1とします(いずれも説明のための仮の値です)。EPV=10の目安なら、イベントは100件、全体で500名です。これに対し、Rのpmsampsizeパッケージ(1.1.3)では850名(イベント170件、EPP=17)になり、手計算(shrinkage 0.9にもとづく基準1)でも849.0で、一致しました。EPV=10を満たしても、足りないことがあるということです。

あわせて読みたい:多変量解析の変数選択|何個まで入れてよいか・選び方と書き方

4-4. 生存時間(イベント数で考える)

Kaplan-MeierやCox回帰の検出力は、参加者の人数ではなく観察されるイベント(死亡・再発など)の数で決まります。2群を1:1で割り付けるログランク検定では、必要なイベント数は d = 4×(z1−α/2+z1−β)²÷(log HR)² です(Schoenfeld、1983)[文献10]。

想定するハザード比 必要なイベント数 別の方法(シミュレーション)での検出力
0.5 66件 −
0.6 121件 約79%(3,000回)
0.7 247件 約79%(3,000回)
0.8 631件 −

両側α=0.05、検出力80%、1:1割り付け。シミュレーションは、必要イベント数に達した時点で打ち切る設定でCox回帰(Wald検定)を3,000回繰り返したもので、式による値(80%)より約1〜2ポイント低くなりました。

必要な人数は、「イベント数 ÷ 研究期間中にイベントが起こる割合」で見積もります。たとえば、期間中にイベントが50%に起こると見込むなら、121件÷0.5=242名です(この50%は説明のための仮の値です)。人数だけを増やしても、追跡が短くイベントが増えなければ、検出力は上がりません。解析と報告の書き方は生存時間分析の書き方(Kaplan-Meier・Cox回帰・ハザード比)をご覧ください。

4-5. 診断精度(感度・特異度)|検出力でなく「精度」で決める

診断精度の研究では、2群を比較して有意差を出すことが目的ではないため、通常は「感度や特異度を、どれくらいの幅の信頼区間で推定したいか」から必要数を決めます(精度にもとづく設計)[文献11、12、13]。

感度についての式は、疾患のある人の必要数 = z²×Se×(1−Se)÷w² です(Se:想定する感度、w:信頼区間の半幅)。全体の必要数は、これを疾患の有病割合で割ります。特異度なら、疾患のない人の数と(1−有病割合)で同じように計算します。

実例(仮定にもとづく計算例)。感度を0.90、信頼区間の半幅を0.05にしたいとすると、疾患のある人は138.3、つまり139名(正規近似)です。有病割合が20%なら、全体で695名です。ところが、正確な(Clopper-Pearson)信頼区間で確かめると、半幅が0.05以下に安定して収まるのは疾患のある人が159名以上のときで(最初に下回るのは155名で、159名以上では下回り続けます。全体で795名)、正規近似はやや楽観的でした。感度を0.80、0.85、0.90、0.95、0.98と変えて同じ計算をしても、正確な区間のほうが18〜24名多く必要でした(計算例)。近似式で出した数字は、正確な区間でも確認することをお勧めします。

観察された感度 疾患のある人の数 正確な95%信頼区間
0.90(27/30) 30名 0.735〜0.979
0.90(45/50) 50名 0.782〜0.967
0.90(90/100) 100名 0.824〜0.951
0.90(180/200) 200名 0.850〜0.938

同じ感度0.90でも、疾患のある人の数で信頼区間の幅が変わることを示す計算例です(binom.test、Rによる)。

あわせて読みたい:ROC曲線・AUC・カットオフ値の報告のしかた

5. Rでの計算例と、二つの方法による照合

症例数設計の数字は、ソフトによって少しずつ異なります(近似式や丸め方の違いのためです)。そこで、本稿の数字はすべて、二つ以上の方法で計算して照合しました。コードと実際の出力を示します(R 4.3.3、pwr 1.3.0、MASS 7.3.60.0.1[文献25])。

library(pwr)                         # R 4.3.3、pwr 1.3.0
z <- qnorm(c(.975, .80))             # 両側α=0.05、検出力80%

# 1) 2群の平均値:差5 lb、SD 7.68 lb(MASS::anorexiaの家族療法群17名と対照群26名の統合SD)
pwr.t.test(d = 5/7.68, power = .80, sig.level = .05)$n          # 方法A
power.t.test(delta = 5, sd = 7.68, power = .80, sig.level = .05)$n  # 方法B

# 2) 2群の割合:25% 対 40%
pwr.2p.test(h = ES.h(.40, .25), power = .80, sig.level = .05)$n    # 方法A(角変換)
power.prop.test(p1 = .25, p2 = .40, power = .80, sig.level = .05)$n # 方法B(正規近似)

# 3) 相関:r = 0.3
pwr.r.test(r = .3, power = .80, sig.level = .05)$n                 # 方法A
((z[1] + z[2]) / atanh(.3))^2 + 3                                   # 方法B(Fisherのz変換の式)

# 4) 生存時間:必要イベント数(Schoenfeldの式)
ev <- function(hr) 4 * (z[1] + z[2])^2 / log(hr)^2
ceiling(sapply(c(.5, .6, .7, .8), ev))

# 5) 診断精度:感度0.90、半幅0.05
z[1]^2 * .9 * .1 / .05^2                                            # 正規近似
hw <- function(n) { ci <- binom.test(round(.9*n), n)$conf.int; (ci[2]-ci[1])/2 }
ns <- 30:400; ns[max(which(sapply(ns, hw) > .05)) + 1]              # 正確な区間

# 6) 1群26名で、検出力80%で検出できる最小のd
pwr.t.test(n = 26, power = .80)$d

実際の出力(要約):

1 2群の平均値   方法A 38.02   方法B 38.02   -> 1群 39名(脱落15%で46名)
2 2群の割合     方法A 151.17  方法B 151.87  -> 1群 152名
3 相関          方法A 84.07   方法B 84.93
  モンテカルロ(40,000回)の検出力:n=82 0.791 / n=84 0.802 / n=85 0.804
4 必要イベント数  HR 0.5: 66   HR 0.6: 121   HR 0.7: 247   HR 0.8: 631
5 診断精度       正規近似 138.3 -> 139名   正確な区間 159名(安定して半幅0.05以下になる人数)
6 検出できる最小のd(1群26名) 0.79

読み取れることは三つあります。第一に、2群の平均値では二つの方法がほぼ同じ値になりました。第二に、2群の割合と相関では、方法による差が1名未満から1名ほどあり、安全のため大きいほうを採用して切り上げます。第三に、診断精度では、正規近似(139名)と正確な区間(159名以上)で20名の差があり、近似を使うときは確認が必要です。

生存時間の照合に使ったシミュレーションのコード
# 生存時間の照合用シミュレーション(式の検算のみ。結果の提示には使っていません)
library(survival); set.seed(20261011)
sim <- function(hr, d, B = 3000, n = 2000) {
  mean(replicate(B, {
    arm <- rep(0:1, each = n/2)
    t   <- rexp(n, rate = 0.1 * ifelse(arm == 1, hr, 1))
    tc  <- sort(t)[d]                               # d番目のイベントの時点で打ち切り
    p <- summary(coxph(Surv(pmin(t, tc), t <= tc) ~ arm))$coefficients[, "Pr(>|z|)"]
    p < .05 }))
}
sim(.6, 121)   # 0.792
sim(.7, 247, n = 3000)   # 0.785

式にもとづく必要イベント数に達したとき、シミュレーションでの検出力は約79%でした(式は近似であり、1〜2ポイント低くなりました)。

左:2群の平均値比較で、検出したい効果量dと1群あたりの必要人数の関係(検出力80%と90%)。右:1群あたりの人数と、平均値の差の95%信頼区間の半幅の関係(SD7.68 lb)。
図1. 効果量と必要人数(左)、人数と推定精度(右)(タップで拡大)。左は実データを使わない計算結果です。右のSD(7.68 lb)は、MASS::anorexia(Hand ら 1993)の家族療法群17名と対照群26名の体重変化から求めた統合標準偏差です。計算:R 4.3.3、pwr 1.3.0(CRAN)。Editverse Japan作成 © editverse.com

読み方:左の図は、検出したい差が小さくなるほど(dが小さいほど)必要人数が急に増えることを示します。右の図は、「どれくらいの精度で差を知りたいか」からも人数を考えられることを示します。この例(SD=7.68 lb)で、信頼区間の半幅を±2 lb にしたければ、1群114名が必要です。1群26名では±4.3 lb で、差の推定は大まかなものにとどまります。

6. G*Powerによる計算の実践

G*Powerは、t検定・F検定・カイ二乗検定・z検定・一部の正確検定を扱える無料のソフトウェアです。公式ページでは、Windows版が3.1.9.7(2020年3月17日)、Mac版が3.1.9.6(同年2月21日)として配布されており(2026年10月11日確認)、論文でソフトウェアの版を書くときは、使った版に合わせてください[文献23]。公式ページは、Faulら(2007)またはFaulら(2009)の引用を希望しています[文献1、2]。

G*Power 3.1の操作手順(t検定の例):

  1. Test family: t testsを選択
  2. Statistical test: Means: Difference between two independent means
  3. Type of power analysis: A priori: Compute required sample size
  4. Effect size d: 先行研究またはパイロット研究から入力(例: 0.5)
  5. α err prob: 0.05
  6. Power (1-β err prob): 0.80
  7. Allocation ratio N2/N1: 1(等配置)
  8. 計算実行 → 各群n = 64
  • 3群以上の比較は F tests の ANOVA: Fixed effects, omnibus, one-way、相関は Exact の Correlation: Bivariate normal model で計算できます。画面の表記は版によって異なることがあるため、画面でご確認ください。
  • 人数が先に決まっているときは、Type of power analysis で Sensitivity: Compute required effect size を選ぶと、その人数・αで検出できる最小の効果量が求まります(第7節)。
  • 生存時間(イベント数)や診断精度(信頼区間の幅)は、本稿のように別の式やパッケージで計算します。
  • G*Powerで出した数字は、入力した効果量・α・検出力・配置比とともに記録し、必要に応じて、Rなど別の方法でも確認しておくと、査読での説明に役立ちます。

メソッドセクションへの統合

検出力分析の結果はメソッドセクションの「Statistical Analysis」サブセクションに記述します。学術英語表現集(Methods)では、この記述に使える英語フレーズを収録しています。また第1種・第2種の過誤との関連も理解しておきましょう。

7. サンプルサイズが足りない・不足しているときの対処

「計画した人数に届かなかった」「希少な疾患で、そもそも必要数を集められない」「単施設で期間が限られている」。こうした状況は、臨床研究では珍しくありません。ここでは、投稿の前にできることを、できることとできないことを分けて整理します。結果が出た後の「有意差なし」の書き方は「有意差」とは?有意差なしの意味と書き方で扱っていますので、本節は、計画と報告の段階に絞ります。

7-1. まず、人数を増やせる余地があるか

研究がまだ終わっていないなら、共同研究(多施設化)、募集期間の延長、組み入れ基準の見直し、より精度の高い測定方法への変更など、人数や精度を上げる方法を先に検討します。ただし、データを見てから人数を追加するかどうかを決めると、偽陽性が増えます[文献22]。追加する場合は、あらかじめ決めた計画に沿って、その経緯も記録してください。

7-2. 「検出力」ではなく「精度」で語る

人数が少ないとき、最も誠実で情報量の多い報告は、効果の推定値と95%信頼区間を示すことです。CONSORT 2025は、各アウトカムについて、効果量の推定値とその精度(95%信頼区間など)を報告するよう求めています(項目26、2026年10月11日確認)[文献21]。信頼区間が、臨床的に意味のある差を含むのか、除外できるのかを、本文で述べます。

実例(実データ)。MASS::anorexia の認知行動療法(CBT)群29名と対照群26名の体重変化の差は3.46 lb、95%信頼区間は−0.70〜7.62、P=0.10でした[文献25]。「有意差なし」ですが、これは「効果がない」という意味ではありません。区間には、ゼロに近い差も、臨床的に意味があるかもしれない大きな差(たとえば、事前に5 lbを最小の意味のある差と決めていた場合の5 lb以上の差)も含まれています。結論は「この研究だけでは判断できない」です。図1の右図のとおり、1群26名ほどでは、差の推定は±4 lb 前後の幅になります。

7-3. 「事後検出力」に頼らない

結果が出た後に、観察された効果から検出力を計算して「検出力が低かったので有意にならなかった」と説明する方法は、勧められていません。解釈の段階で検出力を使うことの問題は、Goodman と Berlin(1994)が論じており[文献18]、Levine と Ensom(2001)は、人数が足りなかった可能性は、事後の検出力よりも信頼区間のほうがよく伝えると述べています[文献17]。計画段階で、前提を決めて計算した検出力と混同しないでください。

7-4. 研究の位置づけを率直に書く

人数が不十分な研究は、「効果を検証した」ではなく、「探索的な解析」「仮説の生成」「実現可能性を調べるパイロット研究」と位置づけ、題名・抄録・結論の言い方をそれに合わせます。パイロット研究の目的は、募集・割り付け・継続などの実現可能性を調べることです[文献14、15]。小さな標本から得た効果量は不正確で、次の研究の計画にそのまま使うことは勧められていません[文献16]。なお、患者数が少ないことだけを理由に「パイロット研究」と呼ぶことは、Lancaster らが戒めています[文献14]。計画段階の主要アウトカムを1つに絞り、それ以外は副次的・探索的と明示します。

7-5. 「その人数で検出できた最小の効果」を示す

人数が先に決まっていた場合は、「その人数・α・検出力80%で検出できる最小の効果量」を計算して報告します(G*Powerの Sensitivity、または Rの pwr.t.test(n = 26, power = .80)$d)。1群26名なら d = 0.79 で、それより小さな差は、この研究では検出が難しかったことになります。これは計画の感度の説明であり、結果から逆算する事後検出力とは異なります。サンプルサイズの根拠には、全数調査、資源の制約、検出力による計算、精度、慣例、根拠なしの明示など、いくつかの考え方があるとされ、資源の制約が理由であることをそのまま書いてよい場合もあります[文献20]。

7-6. 論文での書き方の例

Limitations の記述例(英語、数字はご自身の値に置き換えてください):
“The study was not powered to detect small differences. With 26 participants per group, the minimum detectable standardized difference at 80% power (two-sided α = 0.05) was d = 0.79. We therefore report effect estimates with 95% confidence intervals and interpret the findings as exploratory rather than confirmatory.”

7-7. できないこと、お約束できないこと

  • 後から文章を整えても、人数そのものは増えません。人数が少ないことは、限界として明示するしかありません。
  • 雑誌や分野によっては、小規模であること自体が理由で、査読に進まないことがあります。どの記載があれば受け入れられるかは、雑誌ごとに異なり、掲載をお約束できるものではありません。
  • 人数が少ないこと自体が、直ちに非倫理的になるとは限らないという議論もあります[文献19]。ただし、研究の実施・継続の判断は、所属機関の倫理審査委員会に従ってください。

あわせて読みたい:学位論文の統計|解析計画の立て方と報告のしかた(解析計画表とサンプルサイズの考え方)/医学統計解析の外注|依頼前の準備と納品物・著者資格

8. 論文での報告方法

CONSORT 2025は、ランダム化比較試験の報告で、サンプルサイズをどのように決めたか(計算を支えたすべての前提を含む)を記載するよう求めています(項目16a、2026年10月11日確認)[文献21]。観察研究でも、同じ考え方で前提を書いておくと、査読者に伝わりやすくなります。

Methods セクションの記述例(英語、第4-1節の例に対応。数字は例ですので、ご自身の値に置き換えてください):
“Sample size was calculated a priori for the primary outcome (change in body weight). To detect a between-group difference of 5 lb (the smallest difference considered clinically meaningful), assuming a standard deviation of 7.68 lb, two-tailed α = 0.05 and 80% power, 39 participants per group were required (pwr 1.3.0 in R 4.3.3; the result was confirmed with power.t.test). To allow for 15% attrition, we aimed to recruit 46 participants per group (total n = 92).”
記載必須項目 記載例
使用ソフトウェアと版 G*Power 3.1.9.7 / R pwr 1.3.0 / nQuery / PASS など(使った版を記載)
効果量の根拠 臨床的に意味のある最小の差と、その出典(先行研究・メタ分析・パイロット研究・専門家の判断)
標準偏差・割合などの出典 先行研究・自施設の過去データなど
α水準 Two-tailed α = 0.05
設定した検出力 Power = 0.80(または0.90)
必要サンプルサイズ 各群n = 39(総数78)
脱落補正 15%の脱落を見込み、各群46名(必要数÷(1−0.15))
(足りないとき)検出できる最小の効果 1群26名で d = 0.79(80%検出力)

計画の段階で、症例数設計の前提を計画書に日付つきで記録しておくと、あとから査読や審査で説明を求められたときに、そのまま使えます。

サンプルサイズ計算・検出力分析のサポートが必要ですか?

研究計画の段階で検出力分析(症例数設計)を行い、その根拠を記録しておくことは、査読や審査で説明を求められたときの備えになります。Editverse Japanの統計専門家が、あなたの研究デザインに合ったサンプルサイズ計算と、論文への記述方法をサポートします。結果や採択をお約束するものではありません。

統計解析サポートを見る →

研究計画段階からの統計サポート
「このサンプルサイズで十分ですか?」という疑問を研究開始前に解決しましょう。Editverse Japan統計解析サービスでは、研究計画書段階からのコンサルテーションも承っています。臨床研究全般のご案内は臨床研究サポートをご覧ください。

関連サービス:医学統計解析サポート

サンプルサイズの根拠は、査読で問われることがあります

「サンプルサイズの根拠を示してください」という指摘を受けることは珍しくありません。研究計画の段階での算出から、査読で根拠を求められたときの説明の整理まで対応します。解析の実施と図表作成を含めて定額¥79,800、再現可能なRスクリプト付き。執筆まで含む「データから論文へ」パッケージは定額¥238,000です。

統計解析サポートを見る →

査読で統計手法を指摘されたら

統計担当が再解析・追加解析を行い、修正版のMethods・Resultsと査読者への回答を作成します。論文1本定額、採択まで対応。

査読対応+統計再解析を見る →

統計解析の見積もりを依頼する(医学統計解析サポート)→

本記事は一般的な統計情報であり、個別の研究の最終判断(症例数、倫理審査の要否、研究の実施可否など)は、所属機関の倫理審査委員会・研究支援部門・統計担当者にご確認ください。

まとめ

症例数設計は、「検出したい最小の差」「標準偏差や割合」「α」「検出力」を決め、デザインに合った式で計算し、その前提を記録することです。平均値・割合・相関はpwrなどで、生存時間はイベント数で、診断精度は信頼区間の幅(精度)で考えます。数字は二つの方法で確認し、大きいほうを採用します。サンプルサイズが足りないときは、事後検出力に頼らず、効果の推定値と95%信頼区間、検出できる最小の効果、探索的という位置づけを率直に示します。それでも、掲載をお約束することはできません。

関連記事

よくある質問

症例数設計とは何ですか。

症例数設計とは、研究を始める前に、検出したい差・有意水準・検出力などから必要な参加者数(症例数)を計算し、その根拠を計画書と論文に記録することです。サンプルサイズ設計と同じ意味で使われます。計算の前提が変われば必要な人数も変わるため、前提(効果量の根拠、標準偏差、脱落の見込みなど)をあわせて書き残しておきます。

症例数設計の計算式はありますか。

研究デザインごとに計算式があります。2群の平均値を比べる場合、1群あたりの人数はおおよそ 2×(z(1−α/2)+z(1−β))²÷d² です(d は平均値の差を標準偏差で割った効果量)。両側α=0.05、検出力80%、d=0.5 では、この近似式で約63名、t分布を使った計算(R の pwr と power.t.test、いずれも63.77)では切り上げて64名になります。手計算よりも、ソフトで計算して入力値と結果を記録しておくほうが確実です。

サンプルサイズが足りない(不足している)ときは、どうすればよいですか。

研究が始まる前であれば、共同研究や期間の延長など、人数を増やす方法を先に検討します。すでに人数が決まっている場合は、結果が出た後で検出力を計算するのではなく、効果の推定値と95%信頼区間を示し、研究の位置づけ(探索的・パイロットなど)を率直に書き、その人数で検出できた最小の効果を報告します。査読での受け止め方は雑誌や分野によって異なり、掲載をお約束できるものではありません。

結果が出た後に「事後検出力」を計算して書いてもよいですか。

お勧めしません。結果から逆算した検出力は、人数が足りなかったかどうかの判断に向かないとされ、95%信頼区間のほうが適しています。詳しくは「有意差」とは?有意差なしの意味と書き方をご覧ください。

効果量は、どのように決めればよいですか。

先行研究の推定値は、小さな研究ほど過大で不正確になりやすいため、そのまま使うのは慎重にしてください。臨床的に意味があると考える最小の差を基準にするのが基本で、その差と標準偏差の出典を記録します。Cohen の目安(d=0.2、0.5、0.8)は慣例であり、ご自身の研究の臨床的な意味と置き換えて考えます。

参考文献と公式情報

文献はすべてPubMed(またはCrossRef)で、著者・年・雑誌・PMID/DOIを確認済みです(確認日:2026年10月11日)。

  1. Faul F, Erdfelder E, Lang AG, Buchner A. G*Power 3: a flexible statistical power analysis program for the social, behavioral, and biomedical sciences. Behav Res Methods. 2007;39(2):175-191. PMID 17695343. doi:10.3758/bf03193146
  2. Faul F, Erdfelder E, Buchner A, Lang AG. Statistical power analyses using G*Power 3.1: tests for correlation and regression analyses. Behav Res Methods. 2009;41(4):1149-1160. PMID 19897823. doi:10.3758/BRM.41.4.1149
  3. Cohen J. Statistical Power Analysis for the Behavioral Sciences. 2nd ed. Lawrence Erlbaum Associates; 1988(書籍。PubMed収載なし)。
  4. Button KS, Ioannidis JPA, Mokrysz C, et al. Power failure: why small sample size undermines the reliability of neuroscience. Nat Rev Neurosci. 2013;14(5):365-376. PMID 23571845. doi:10.1038/nrn3475
  5. Open Science Collaboration. Estimating the reproducibility of psychological science. Science. 2015;349(6251):aac4716. PMID 26315443. doi:10.1126/science.aac4716
  6. Peduzzi P, Concato J, Kemper E, Holford TR, Feinstein AR. A simulation study of the number of events per variable in logistic regression analysis. J Clin Epidemiol. 1996;49(12):1373-1379. PMID 8970487. doi:10.1016/s0895-4356(96)00236-3
  7. Peduzzi P, Concato J, Feinstein AR, Holford TR. Importance of events per independent variable in proportional hazards regression analysis. II. Accuracy and precision of regression estimates. J Clin Epidemiol. 1995;48(12):1503-1510. PMID 8543964. doi:10.1016/0895-4356(95)00048-8
  8. Vittinghoff E, McCulloch CE. Relaxing the rule of ten events per variable in logistic and Cox regression. Am J Epidemiol. 2007;165(6):710-718. PMID 17182981. doi:10.1093/aje/kwk052
  9. Riley RD, Ensor J, Snell KIE, et al. Calculating the sample size required for developing a clinical prediction model. BMJ. 2020;368:m441. PMID 32188600. doi:10.1136/bmj.m441
  10. Schoenfeld DA. Sample-size formula for the proportional-hazards regression model. Biometrics. 1983;39(2):499-503. PMID 6354290
  11. Buderer NM. Statistical methodology: I. Incorporating the prevalence of disease into the sample size calculation for sensitivity and specificity. Acad Emerg Med. 1996;3(9):895-900. PMID 8870764. doi:10.1111/j.1553-2712.1996.tb03538.x
  12. Flahault A, Cadilhac M, Thomas G. Sample size calculation should be performed for design accuracy in diagnostic test studies. J Clin Epidemiol. 2005;58(8):859-862. PMID 16018921. doi:10.1016/j.jclinepi.2004.12.009
  13. Hajian-Tilaki K. Sample size estimation in diagnostic test studies of biomedical informatics. J Biomed Inform. 2014;48:193-204. PMID 24582925. doi:10.1016/j.jbi.2014.02.013
  14. Lancaster GA, Dodd S, Williamson PR. Design and analysis of pilot studies: recommendations for good practice. J Eval Clin Pract. 2004;10(2):307-312. PMID 15189396
  15. Thabane L, Ma J, Chu R, et al. A tutorial on pilot studies: the what, why and how. BMC Med Res Methodol. 2010;10:1. PMID 20053272. doi:10.1186/1471-2288-10-1
  16. Leon AC, Davis LL, Kraemer HC. The role and interpretation of pilot studies in clinical research. J Psychiatr Res. 2011;45(5):626-629. PMID 21035130. doi:10.1016/j.jpsychires.2010.10.008
  17. Levine M, Ensom MHH. Post hoc power analysis: an idea whose time has passed? Pharmacotherapy. 2001;21(4):405-409. PMID 11310512. doi:10.1592/phco.21.5.405.34503
  18. Goodman SN, Berlin JA. The use of predicted confidence intervals when planning experiments and the misuse of power when interpreting results. Ann Intern Med. 1994;121(3):200-206. PMID 8017747. doi:10.7326/0003-4819-121-3-199408010-00008
  19. Bacchetti P, Wolf LE, Segal MR, McCulloch CE. Ethics and sample size. Am J Epidemiol. 2005;161(2):105-110. PMID 15632258. doi:10.1093/aje/kwi014
  20. Lakens D. Sample size justification. Collabra: Psychology. 2022;8(1):33267. doi:10.1525/collabra.33267(PubMed収載なし、CrossRefで確認)
  21. Hopewell S, Chan AW, Collins GS, et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123. PMID 40228833. doi:10.1136/bmj-2024-081123。チェックリストの項目16a(サンプルサイズ)と項目26(効果量の推定値と精度)は、公式の編集可能なチェックリスト(consort-spirit.org)で確認(2026年10月11日閲覧)。
  22. Simmons JP, Nelson LD, Simonsohn U. False-positive psychology: undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychol Sci. 2011;22(11):1359-1366. PMID 22006061. doi:10.1177/0956797611417632
  23. G*Power 公式ページ(ハインリッヒ・ハイネ大学デュッセルドルフ):psychologie.hhu.de(2026年10月11日閲覧。版・配布日・引用の希望を確認)
  24. 大学の相談窓口の例:慶應義塾大学 生物統計部門 統計相談(2026年10月11日閲覧。「症例数設計(サンプルサイズ計算)」が相談の種類として挙げられ、研究の早い段階での相談が勧められている。方針は機関ごとに異なります)
  25. R 4.3.3(2024-02-29)、pwr 1.3.0(Champely S. pwr: Basic Functions for Power Analysis. CRAN)、pmsampsize 1.1.3、MASS 7.3.60.0.1、survival。データ:MASS::anorexia(Hand DJ, Daly F, McConway K, Lunn D, Ostrowski E, eds. A Handbook of Small Data Sets. Chapman & Hall; 1993。72名)、MASS::birthwt(Hosmer DW, Lemeshow S. Applied Logistic Regression. Wiley; 1989。189名)。Venables WN, Ripley BD. Modern Applied Statistics with S. 4th ed. Springer; 2002。

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です