オンライン試験マガジン

IRT(項目反応理論)とは?IRTスコアの見方と活用をわかりやすく解説

IRT項目反応理論とは?と表示されたバナー画像

「このテスト、本当に公平なのかな?」「AさんとBさん、点数は同じだけど、本当に同じ実力なんだろうか?」

オンラインテストが当たり前になった今、テストの点数だけでは測れない「真の実力」をどう評価するかが、教育現場や企業の人材育成において大きな課題となっています。

本記事では、IRT(項目反応理論:Item Response Theory)とは何かを、IRTスコアの見方や素点・偏差値との違いから解説します。あわせて、問題の良し悪しを見抜く項目特性曲線の考え方、等化やCATでの活用、自社の試験にIRTを取り入れるときの要件までを整理します。

【この記事の概要】

  • IRTスコアの見方と、素点・偏差値との違いがわかる
  • 項目特性曲線を使った良問・悪問の見分け方を理解できる
  • 自社の試験にIRTを導入するために必要なデータと体制を確認できる

wisdombase

目次

IRT(項目反応理論)とは

IRT(項目反応理論、または項目応答理論とも呼ばれます)とは、一言でいうと「テストの各問題(項目)への解答(応答)パターンから、受験者一人ひとりの能力と、問題ごとの特性(難しさや識別力)を同時に測定する理論」です。

評価項目群への応答に基づいて、被験者の特性(認識能力、物理的能力、技術、知識、態度、人格特徴等)や、評価項目の難易度・識別力を測定するための試験理論である。

Wikipedia: 項目応答理論

ポイントは「項目(問題)への応答を見る」ことです。

正解か不正解かという結果に加えて、「どのくらいの能力を持った人が、どの問題に正解し、どの問題で間違えたか」というパターンを分析します。これにより、次の2つを、お互いを参照しながら高い精度で推定できます。

  • 問題ごとの特性:その問題が「どのくらいの能力レベルの人にとって難しいのか(難易度)」「実力のある人とない人を見分けるのに適しているか(識別力)」
  • 受験者の能力:テスト全体の点数に左右されない、その人の「潜在的な能力(特性値)」

まるで、一人ひとりにオーダーメイドの「能力ものさし」を当てがうようなイメージですね。

IRTスコアとは

IRTスコアとは、IRTによって推定された受験者の能力値を、受験者や採用担当者が読み取りやすい尺度に変換した得点です。「尺度得点」「スケールドスコア」と呼ばれることもあります。

IRTスコアは、正解した問題の難易度と識別力を反映して決まります。同じ正答数でも、難しい問題に正解した人のスコアが高くなるのが特徴です。

IRTスコアの見方

IRTスコアを読むときは、次の3点を押さえておくと解釈を誤りません。

  • 実施回が違っても比較できる:問題セットが入れ替わっても同じ尺度上で算出されるため、前回600点・今回650点であれば、実力が伸びたと解釈できます
  • 正答数とスコアは一致しない:やさしい問題を多く正解するよりも、難しい問題に正解するほうがスコアは高くなります。満点を取らなくても最高点に近いスコアが出る場合があるのはこのためです
  • スコアには誤差の幅がある:推定値である以上、標準誤差が伴います。数点の差は同じ水準とみなし、幅を持って読むのが適切です

身近な例では、TOEICのスコア(10点から990点、5点刻み)や、日本語能力試験(JLPT)の尺度得点がIRTの考え方にもとづいて算出されています。「全問正解しなくても満点になることがある」「まぐれ当たりでは大きくスコアが伸びない」と言われるのは、この仕組みによるものです。

素点・偏差値との違い

素点、偏差値、IRTスコアは、それぞれ何の影響を受けるかが異なります。

指標 何を表すか 影響を受けるもの
素点(合計点) 正解した問題の配点の合計 出題された問題の難易度
偏差値 受験した集団の中での相対的な位置 その回の受験者の顔ぶれ
IRTスコア 受験者本人の能力の推定値 問題の難易度と受験集団の影響を取り除いた値

素点は、やさしい回に受ければ高く出ます。偏差値は、優秀な受験者が多い回では低く出ます。IRTスコアは、この2つの影響を取り除いた尺度で能力を表すため、回をまたいだ比較や、継続的な能力測定に向いています。

IRT方式とは

IRT方式とは、試験の出題設計と採点にIRTを用いる方式のことです。従来の方式(古典的テスト理論)との違いは、次の点にあります。

項目 従来の方式 IRT方式
出題 全員に同じ問題セットを出す 特性値が既知の項目プールから出題する
採点 配点の合計で算出する 解答パターンから能力値を推定する
回をまたいだ比較 難易度が違うと比較しにくい 等化により同じ尺度で比較できる
必要なデータ 合計点 1問ごとの正誤データ(大規模)

資格試験や語学試験でIRT方式が採用されるのは、複数回実施しても合格基準を一定に保てるためです。CBT(コンピュータを使った試験)と組み合わせることで、実施日を分散しながら公平性を保つ運用が可能になります。

なぜIRTが必要なのか?テスト評価の進化に見る、従来の限界

IRTの重要性を理解するために、テスト評価がどのように進化してきたかを見てみましょう。

評価1.0:テストの「スコア」だけを見る時代

あなたのお子さんが100点のテストを持って帰ってきたら、手放しで褒めますか?

もしそのテストの問題が「自分の名前をひらがなで書きましょう」の1問だけだったらどうでしょう。

100点で当たり前ですよね。

逆に0点のテストの場合は?

もし問題が「ゴールドバッハ予想を証明しなさい」(2026年現在も数学上の未解決問題です)だったら、0点でも叱るわけにはいきません。

このように、テストのスコアだけを見ても、問題の難易度が分からなければ、その点数が本当に高いのか低いのか、適切に評価することはできません。これが評価1.0の限界です。

評価2.0:「偏差値」による相対評価の登場

次に登場したのが「偏差値」です。全体の平均点や点数のばらつきを考慮して、集団の中でどのくらいの位置にいるかを示す指標ですね。

全員が100点を取るような簡単なテストなら、100点を取っても偏差値は50。逆に全員が0点の超難問テストでも、0点なら偏差値50。スコアだけを見るよりは、集団内での相対的な位置が分かり、評価方法として進化したと言えます(評価2.0)。

評価3.0:IRTによる「質の高い評価」へ

では、偏差値を使えば完璧でしょうか?

ここに落とし穴があります。

例えば、全20問・100点満点の世界史のテストに、こんな問題が紛れ込んでいたらどうでしょう。

問13. 郷 ひろみの本名を答えよ。(配点30点)

この問題だけ間違えて70点だったAさんと、運良く(?)正解して100点だったBさん。偏差値で見れば当然Bさんの方が高くなります。

しかし、世界史の能力という観点から見て、本当にBさんの方が高いと言い切れるでしょうか?(ちなみに正解は「原武 裕美」さんだそうです)

ここに、IRT(評価3.0)が登場する意味があります。IRTは、このような「テストの目的(測りたい能力)と関係のない問題」や「難易度が不適切な問題」が、全体の評価に与える影響を最小限に抑えようとします。

どうやって? それが「項目特性曲線(ICC: Item Characteristic Curve)」という考え方です。

IRTの心臓部!「項目特性曲線」で問題の良し悪しを見抜く

IRTでは、問題1問1問について、その「質」を評価するために「項目特性曲線」というグラフを描きます。難しそうに聞こえますが、考え方はシンプルです。

  • 横軸:受験者の能力(例えば世界史の能力。これはIRTによって推定されます)
  • 縦軸:その問題に正解する確率

空っぽのグラフ

このグラフを、たくさんの受験者の解答データをもとに作成します。

例えば、「問5. フランス革命が起きたのは何年か?」という世界史の問題があったとしましょう。

  • 世界史の能力が低い受験者は、この問題に正解できる確率は低いでしょう(グラフの左下の方)。
  • 世界史の能力が平均的な受験者は、そこそこの確率で正解できるかもしれません(グラフの真ん中あたり)。
  • 世界史の能力が非常に高い受験者は、ほぼ確実に正解できるでしょう(グラフの右上の方)。

これらの点を結んでいくと、多くの場合、下図のような滑らかなS字カーブを描きます。

一般的な項目特性曲線のグラフ

このS字カーブの「形」が、問題の質を教えてくれます。

  • S字カーブの傾き:カーブの真ん中あたりの傾きが急であるほど、ある能力値を境に正答できるかどうかが明確に分かれることを意味します。つまり、能力を正確に見分ける力(識別力)が高い良問である可能性が高いです。
  • S字カーブの位置:S字カーブ全体がグラフの右側にあれば、高い能力がないと正解できない難しい問題。左側にあれば、比較的低い能力でも正解できる易しい問題だと判断できます。

では、先ほどの「郷ひろみの本名」問題の項目特性曲線はどうなるでしょうか?
世界史の能力が高い人も低い人も、正答率はあまり変わらないはずです(世界史の知識とは直接関係ないので)。そのため、グラフはS字にならず、横軸(世界史の能力)に関わらず、ほぼ一定の低い正答率を示す、水平に近い線になるでしょう。

郷ひろみの問題の項目特性曲線

このように、IRTと項目特性曲線を使えば、

  • その問題が、測りたい能力をきちんと測れているか?(識別力)
  • その問題の難易度は適切か?

といったことを客観的に評価し、「郷ひろみ問題」のような不適切な問題(悪問)を見つけ出し、修正したり、配点を調整したりすることが可能になるのです。

IRTでテストはどう変わる?主なメリットと活用法

IRTをテスト作成や評価に導入することで、具体的にどのようなメリットがあるのでしょうか?代表的なものを2つ紹介します。

1. 等化(Equating):異なるテストの結果を公平に比較

IRTの最大のメリットの一つが「等化」です。これは、実施時期や問題セットが異なるテストであっても、共通の尺度(ものさし)でスコアを比較できるようにする技術です。

例えば、

  • 資格試験の第1回と第2回で、問題の難易度が違った場合
  • Aさんが受けたテストとBさんが受けたテストの問題が一部異なっていた場合
  • 採点者によって甘い・辛いがある場合(面接や小論文など)

従来の方法では、単純な点数比較は不公平でした。しかし、IRTを使えば、各テストや問題の特性(難易度など)を考慮して、受験者の能力値を共通の尺度上で算出できます。

これにより、「今回のテストは難しかったから、70点でも前回テストの80点に相当する」といった調整が可能になり、公平な比較や継続的な能力測定が実現します。

2. CAT(コンピュータ適応型テスト):一人ひとりに最適なテストを提供

IRTを活用することで、CAT(Computer Adaptive Testing / Computerized Adaptive Test)と呼ばれる、より効率的で精度の高いテスト形式が実現できます。

CATは、受験者の解答状況(正解・不正解)に応じて、次に出題する問題の難易度をリアルタイムで変えていくテストです。

  • 正解が続けば、より難しい問題を出題
  • 不正解が続けば、より易しい問題を出題

これにより、

  • 受験者の能力レベルに合った問題が重点的に出題されるため、短い時間で効率的に能力を測定できる。
  • 簡単すぎる問題や難しすぎる問題を解く必要がなくなり、受験者の負担やストレスを軽減できる。
  • 一人ひとりに出題される問題が異なるため、カンニングなどの不正行為を防止しやすい。

まさに、IRTの「個々の能力と問題特性を分離して捉える」という考え方を最大限に活かしたテスト形式と言えるでしょう。

関連記事:

【初心者向け】CAT (Computerized Adaptive Testing) とは?【オンラインテストの新常識】

IRTが実際に使われている試験の例

IRTは欧米では古くから活用され、学校現場にも浸透しています。日本でも最近になってIRTを活用したテストが増えています。

みなさんも「TOEICのテストは全問正解しなくても満点の990点になることがあるらしい」とか「まぐれで正解しても大したスコアにならないらしい」ということを耳にしたことがあるかもしれません。

実際TOEICのスコアリングにも、IRTは活用されています。

その他にもTOEFL、GTEC、CASECと言った英語の民間試験や、ITパスポート試験、また、弊社システムでもオンライン講座を取り扱いしている、日本語能力試験(JLPT: Japanese Language Proficiency Test)、BJTビジネス日本語能力テスト、などにもIRTが活用されています。

IRT導入のポイントと注意点

項目応答理論(IRT)は、従来の合計点方式のテストが抱える問題点を解決し、受検者の能力をより正確に、かつ異なるテスト間で比較可能な形で測定できる可能性を持つテスト理論です。

そのメリットを最大限に活かし、適切に運用するためには、いくつかの重要なポイントと注意点があります。

1.大規模かつ質の高いデータの確保

IRTでは、項目の難易度や識別力といった特性値や、受検者の能力値を統計的に精度高く推定することが不可欠です。そのため、最低でも千人規模の受検者データが必要とされ、継続的に大規模なデータを収集できる体制が成功の鍵となります。

2.項目プールの構築と維持管理

幅広い能力層の受検者を正確に測定するためには、易しい問題から難しい問題まで、多様な特性を持つ項目を大量にストックしておく「項目プール」の構築が必要です。テストの規模によっては数千から数万項目が必要となる場合もあります。また、項目は繰り返し使うことで特性値が変化する可能性があるため、定期的に新しい項目を追加し、古い項目を更新・管理していく体制が求められます。

3.厳格な項目非開示の徹底

IRTで用いる項目の特性値は、問題が事前に公開されると変化してしまいます(例:対策問題集への掲載など)。そのため、一度使用した項目や、これから使用する予定の項目(予備調査項目)は、原則として非開示にする必要があります。特に重要な試験ほど漏洩リスクが高まるため、厳格な情報管理体制が不可欠です。

4.テスト設計における「局所独立性」の担保

IRTでは、「ある項目に正答するかどうかは、他の項目の正誤に影響されない」という仮定(局所独立性の仮定)を前提としています。したがって、前の問題の答えを使って次の問題を解く形式や、一つの題材に複数の設問がぶら下がる大問形式などは、この仮定を損なう可能性があるため、設計段階で注意が必要です。各設問が独立して解答できるような構成が求められます。

注意点

  • IRTが適さないケースの理解:受験者数が少ないテスト、臨時で作成された小テスト、特定の集団のみを対象としたテストなど、モデルの仮定を満たしにくい場合や、従来のテスト理論で十分な情報が得られる場合には、必ずしもIRTを適用する必要はありません。導入の目的とテストの特性をよく吟味する必要があります。
  • 導入・運用コスト:大規模データの収集、多数の項目作成とプール管理、専門的な知識を持つ人材の確保など、IRTの導入と継続的な運用には相応のリソースとコストがかかる点を理解しておく必要があります。
  • 問題形式の制約:IRTでは、計算の容易さやデータ収集・採点の効率性から、多くの場合、正答か誤答かの2値で評定できる択一式の多肢選択問題が中心となります。部分点を考慮する多値反応モデルも存在しますが、計算が複雑になり、さらに多くのデータが必要となるため、導入のハードルが上がります。

自社の試験でIRTを使うには

自社で実施している資格試験や社内試験にIRTを取り入れる場合、統計モデルの前に、データを取れる状態を整えることから始まります。実務上の手順は次の4段階です。

ステップ1:1問ごとの解答データを取れるようにする

IRTの計算には、受験者ごと・問題ごとの正誤データが必要です。合計点しか残らない運用では、そもそも項目パラメータを推定できません。使用している試験システムに、受験者IDと設問IDを紐づけた解答ログをCSVなどで出力する機能があるかを最初に確認します。

ステップ2:予備調査で項目パラメータを推定する

本番の合否判定に使う前に、十分な人数に解いてもらい、各問題の難易度と識別力を推定します。ここで識別力の低い問題を洗い出して差し替えると、本番の測定精度が上がります。

ステップ3:項目プールを作り、非開示で運用する

推定済みの項目を難易度別にストックし、実施回ごとに組み合わせて出題します。過去問として公開すると特性値が変わってしまうため、公開する問題と項目プールに入れる問題は分けて管理します。

ステップ4:等化の設計を決める

実施回をまたいでスコアを比較するには、回と回をつなぐ共通項目(アンカー項目)をあらかじめ配置しておく必要があります。何問を共通にするか、どの難易度帯から選ぶかを、試験の設計段階で決めておきます。

受験者数が数百人規模にとどまる社内試験では、IRTの本格導入は負担が大きくなります。その場合でも、1問ごとの解答データを蓄積しておけば、正答率と識別力(上位群と下位群の正答率の差)を確認するだけで、悪問の発見には十分役立ちます。

まとめ:IRTでテスト評価を次のステージへ

今回は、テスト評価の新しい常識となりつつあるIRT(項目反応理論)について、IRTスコアの見方から項目特性曲線、活用事例、導入のポイントまでを解説しました。

IRTのポイント

  • 問題への解答パターンから、受験者の能力と問題の特性を同時に測定する。
  • IRTスコアは、問題の難易度と受験集団の影響を取り除いた尺度で能力を表す。
  • 項目特性曲線により、問題の質(難易度、識別力)を客観的に評価できる。
  • 等化により、異なるテストの結果を公平に比較できる。
  • CATにより、効率的で精度の高い個別最適化テストが実現できる。
  • 導入には十分なデータ、項目プール、専門知識などが必要。

オンラインテストが普及し、多様な能力を正確に測る必要性が高まる中で、IRTはますます重要な役割を担っていくでしょう。まずは1問ごとの解答データを残すところから、自社の試験の見直しを始めてみてください。

WisdomBase(ウィズダムベース)でもIRTの実践が可能

wisdombase

WisdomBaseなら、LMS・オンラインテストのデータを統合管理。

WisdomBaseのCBT機能では、各受験者1問1問の解答データ出力が可能です。本記事のステップ1にあたる「1問ごとの解答ログを取れる状態」をそのまま満たせるため、解答データを元にした項目特性曲線の作成など、専門理論を具現化するデータ活用が自由に行えます。ITスタートアップ企業ならではの柔軟性・スピード感で、ご希望に応じたカスタマイズ対応も可能です。

決済機能も充実、自社運用もかんたんにできるのも特徴です。試験の設計段階からご相談いただけますので、資料のご確認やお問い合わせからお気軽にご連絡ください。

WisdomBase製品資料(試験)DL - 【公式】WisdomBase eラーニングシステム | 教材販売やテスト・学習管理に

お問い合わせ - 【公式】WisdomBase eラーニングシステム | 教材販売やテスト・学習管理に