GPT-5.6 SolのMediumとHighはどちらがいい?実測で分かった選び方

GPT-5.6 SolでSEO記事を書くとき、MediumとHighのどちらを選ぶべきか迷う人は多いでしょう。
名前だけを見るとHighの方が良さそうですが、思考量を上げれば、必ず読みやすく正確な記事になるとは限りません。
そこで、同じSEO記事をMediumとHighで各3回生成し、回答時間、文章の品質、指定文字数や形式の守り方まで比較しました。
さらに、Extra HighとMaxへ上げるべき条件も含め、迷わず選べる判断基準をまとめます。
先に結論を書くと、通常のSEO記事はMediumがベストです。
Mediumで不足した理由がプロンプトではなく検討の浅さにある場合はHigh、公開前の修正を減らしたい重要記事はExtra High、最難関の問題だけMaxを選びます。
結論:SEO記事はMediumから始めるのがベスト
今回の実測では、Mediumの品質平均が96.17点、回答時間が53.892秒でした。
Highは96.00点、67.814秒だったため、一般的なSEO記事では、約14秒長く待っても明確な品質向上を確認できませんでした。
| 思考量 | 平均時間 | AI品質点 | 選ぶ基準 |
|---|---|---|---|
| Medium | 53.892秒 | 96.17点 | 通常の記事作成、構成案、リライト |
| High | 67.814秒 | 96.00点 | 論点、比較、検証が浅いとき |
| Extra High | 144.662秒 | 97.67点 | 重要記事の完成度と指示遵守を優先 |
| Max | 103.606秒 | 96.50点 | 最も難しい設計、判断、厳密な検証 |
ただし、MediumがHighより賢いと証明されたわけではありません。
0.17点の差は採点の揺れより小さく、実用上は同等品質と考え、待ち時間と修正のしやすさでMediumを選ぶのが妥当です。
OpenAIのモデル案内でも、標準のMediumから始め、深い計画や分析が必要な場合に思考量を上げる考え方が示されています。
つまり、設定名の強さではなく、その仕事に必要な最低限の思考量を選ぶのが基本です。
MediumとHighを同じ条件で比較した方法
比較には、個人ブログ運営者へ「ブログ記事のリライト方法」を解説する共通プロンプトを使いました。
本文1,400〜1,700字、WordPress用HTML、1段落80〜140字前後など、実際の入稿を想定した条件も同じです。
2026年8月31日時点のChatGPT Workで、各設定を新しいチャットから3回ずつ実行しました。
送信直前から回答終了までを200ミリ秒間隔で計測し、Web検索や外部ファイルは使わず、生成文にも手を加えていません。
品質評価では設定名をA01〜A15へ置き換え、GPT-5.6 Sol Maxに同じ採点基準で2回判定させました。
5段階すべての条件と15本の結果は、GPT-5.6 Solの思考量を比較した実測記事で公開しています。
速度はMediumが平均13.922秒短かった
Mediumの3回は44.508秒、50.540秒、66.628秒で、平均53.892秒でした。
Highは51.421秒、88.106秒、63.916秒で、平均67.814秒となり、Mediumより25.8%ほど長くかかっています。
| 思考量 | 1回目 | 2回目 | 3回目 | 平均 | 中央値 |
|---|---|---|---|---|---|
| Medium | 44.508秒 | 50.540秒 | 66.628秒 | 53.892秒 | 50.540秒 |
| High | 51.421秒 | 88.106秒 | 63.916秒 | 67.814秒 | 63.916秒 |
ただし、Highが毎回必ず遅いわけではなく、3回目はHighの方が2.712秒早く終わりました。
回答時間は思考量だけでなく、出力内容や処理状況でも変わるため、1回の秒数を固定の性能差として扱えません。
それでも平均と中央値はどちらもMediumが短く、日常的に記事を何本も作るほど差が積み重なります。
品質が同等なら、待ち時間の少ないMediumを普段使いにする方が作業を進めやすいでしょう。
品質点はほぼ同じでも得意な部分が違う
総合点はMediumが96.17点、Highが96.00点で、差はわずか0.17点でした。
検索意図、構成、SEOとタイトルは同点でしたが、正確性と慎重さはHigh、読みやすさと指示遵守はMediumが上回っています。
| 評価項目 | Medium | High | 差が表れた傾向 |
|---|---|---|---|
| 検索意図/25 | 25.00 | 25.00 | 同じ |
| 実行可能性/20 | 18.83 | 19.00 | Highが具体策をわずかに補強 |
| 正確性・慎重さ/15 | 13.83 | 14.50 | Highが条件や例外を補足 |
| 構成/15 | 15.00 | 15.00 | 同じ |
| 読みやすさ/10 | 9.33 | 9.17 | Mediumが簡潔 |
| SEO・タイトル/10 | 10.00 | 10.00 | 同じ |
| 指示遵守/5 | 4.17 | 3.33 | Mediumが文字数や形式を守りやすい |
Highの長所は、判断条件や注意点を増やし、説明を少し堅くできることです。
一方で、その補足が文章量の増加や重複につながり、読者に必要な結論へ到達するまでが長くなる場合があります。
Mediumの長所は、必要な論点をそろえながら、説明を比較的コンパクトに収めやすいことです。
ただし、前提が曖昧なテーマや複数の資料が食い違う課題では、確認が足りず、Highの深さが役立つ可能性があります。
0.17点差でMediumの勝ち!とは一概に断定できないが、
AI採点は、同じ記事でも1回目と2回目で平均1.73点、最大3点ずれました。
MediumとHighの差は0.17点なので、採点の揺れに埋もれる大きさであり、統計的な性能差を示す結果ではありません。
また、15記事の得点は93〜99点へ集中し、評価モデルも生成モデルと同じSol系統です。
この結果は「Highの品質が低い」ではなく、「今回の明確なSEOプロンプトでは、Highによる上積みを測れなかった」と読むべきです。
そのため、本記事の結論は点数の小差だけではなく、平均13.922秒の時間差と形式遵守も合わせて判断しています。
読者自身でも確認できるよう、Mediumの生成文3本とHighの生成文3本は全文を公開しています。
Highで文章が長くなったのは悪いこと?
Highの可視文字数は1,910字、1,702字、2,170字で、平均1,927字でした。
Mediumは1,716字、1,838字、1,928字で平均1,827字となり、Highの方が平均約100字長くなっています。
文章が長いこと自体は欠点ではなく、追加した情報が読者の疑問を解決するなら価値があります。
しかし、指定文字数を超えた補足が同じ内容の言い換えなら、読みやすさを下げ、編集時の削除作業も増やします。
今回のHighは正確性と慎重さが上がった反面、1本でHTMLコードフェンスが付き、3本目は指定上限を470字超えました。
深く考えた結果が、必ず簡潔さや入稿しやすさまで改善するわけではないことが分かります。
MediumとHighを選ぶ具体的な基準
設定を選ぶときは、記事の長さよりも、答えるために必要な判断の数を見ます。
読者、結論、構成、参照情報が決まっている記事はMedium、複数の条件を比較して結論を組み立てる記事はHighが候補です。
| 確認すること | Mediumを選ぶ | Highを選ぶ |
|---|---|---|
| 検索意図 | 答える疑問と結論が明確 | 複数の意図が重なり優先順位が必要 |
| 資料 | 少数で内容が一致している | 複数資料の食い違いを整理する |
| 比較条件 | 比較軸が決まっている | 例外やトレードオフが多い |
| 仕上げ方 | 人が確認して調整する | 見落としを減らす再検討に使う |
| 優先事項 | 速度と品質のバランス | 待ち時間より検討の深さ |
普段の記事作成、見出し構成、導入文、要約、既存記事のリライトは、まずMediumで十分です。
回答に必要な条件をプロンプトへ具体的に書けるほど、Highへ上げる必要は小さくなります。
Highが向くのは、競合や一次情報の主張が一致しない比較記事、条件分岐が多い解説、抜け漏れを再点検したい場面です。
「もっと詳しく」ではなく、「どの論点を深く検討させたいか」が説明できるときに選びましょう。
Mediumが浅いと感じたら先にプロンプトを見直す
Mediumの回答が浅いとき、すぐHighへ上げれば解決するとは限りません。
必要な読者像、結論、比較項目、除外条件を伝えていなければ、Highも曖昧な前提を使って長い文章を作るだけになる可能性があります。
まず、「誰の何の疑問に答えるか」「必ず扱う論点」「不要な話」「完成形式」が書かれているか確認します。
不足していればプロンプトを直してMediumを再実行する方が、設定だけを上げるより狙った改善を得やすくなります。
条件を十分に伝えたのに、因果関係が弱い、比較が表面的、例外の検討がない場合はHighの出番です。
この区別をすると、指示不足を計算量で補おうとして待ち時間だけが増える失敗を避けられます。
最初からHighを選んだ方がよい場合
毎回Mediumから段階的に試す必要はありません。
過去に同種の課題でMediumの見落としが分かっている場合や、最初から多段階の比較と検証が必要な場合は、Highから始めた方が手戻りを減らせます。
- 複数の一次情報を照合し、食い違う条件を整理する
- 選択肢ごとのメリット、デメリット、例外を同時に比較する
- 長い資料から根拠を拾い、結論との矛盾を点検する
- 構成案ではなく、構成の妥当性そのものを再検討する
- 公開後の影響が大きく、見落としを減らす価値が高い
反対に、単純な言い換え、表の整形、決まった形式への変換なら、Highは過剰です。
このような作業はMediumより低いLightや、別モデルのTerra、Lunaまで含めて選ぶ方が効率的です。
Extra Highを選ぶべき基準
Extra Highは、難しさだけでなく、完成条件を外したときの修正負担が大きい仕事に向きます。
今回の実験では品質97.67点で1位となり、指定した1,400〜1,700字も3本すべて守った唯一の設定でした。
特に、見出し数、段落長、禁止事項、表の項目など、守る条件が多い重要記事では候補になります。
人が最終確認する時間を短くできるなら、Mediumより平均90.770秒長い待ち時間にも意味が出ます。
- サイトの柱になる記事で、公開前の完成度を優先したい
- 複数の資料、条件、読者層を一つの記事へまとめる
- 文字数やHTML形式など、細かな指定を同時に守らせたい
- 初稿の修正にかかる人の時間が、生成待ち時間より高い
- MediumやHighで抜けた論点を含め、全体を作り直したい
一方、Extra Highは平均144.662秒で、Mediumの約2.68倍かかりました。
品質差は1.50点なので、日常的な記事へ固定するより、修正コストの高い原稿だけに絞る方がコスパは良くなります。
得点だけでなく文章の違いも確認したい場合は、Extra Highで生成した3記事の全文を掲載しています。
指定文字数を守りながら、構成と注意点をどのようにまとめたかをMediumやHighと比較できます。
Maxを選ぶべき基準
Maxは文章を上手にするための設定ではなく、一つの難問へ最も深い検討を割り当てたいときの設定です。
OpenAIも、速度や利用量より深さを優先する最難関の問題向けと説明しています。
例えば、大規模なサイト移行計画の欠陥を洗い出す、複雑な仕様の矛盾を検証する、複数案の長期的な影響を比較する作業です。
正解が見えず、前提を疑い、何段階も戻って確認する必要がある課題で価値が出ます。
- 問題そのものが曖昧で、前提から整理する必要がある
- 多くの条件が依存し、一つの変更が全体へ影響する
- 反例や失敗経路まで含めた厳密な検証が必要になる
- 速度や利用量より、一度の回答で得られる深さを優先する
- HighやExtra Highでも重要な矛盾や抜けが残った
今回のSEO記事ではMaxが96.50点、平均103.606秒で、Mediumより0.33点高いだけでした。
しかも指定文字数は3本とも超えたため、通常の記事作成でMaxを選べば最高品質になるとはいえません。
また、今回はMaxがExtra Highより平均41.056秒早く、思考量の順に待ち時間が増える結果にもなりませんでした。
モデルは課題に応じて処理量を調整するため、設定の段階と実際の秒数は単純には比例しません。
Maxで生成した3記事の全文も公開しており、具体策の多さと文字数超過を同時に確認できます。
思考量の最大設定が、完成稿として常に最適とは限らない理由が分かりやすいでしょう。
Extra HighとMaxはどう使い分ける?
Extra Highは、複雑な仕事を高い完成度でまとめ、指定された形へ収めたい場合に向きます。
Maxは、形を整えることよりも、難しい問題を長く探索し、検証の深さを最大化したい場合に向きます。
| 迷うポイント | Extra High | Max |
|---|---|---|
| 主な目的 | 完成度と条件遵守 | 最難関の検討と検証 |
| 課題の状態 | 目的と完成形は決まっている | 前提や解き方から不明 |
| SEO記事での用途 | 重要な完成稿、複雑な統合記事 | 記事を書く前の難しい設計判断 |
| 注意点 | 待ち時間が長い | 過剰な説明や形式逸脱が起こり得る |
迷ったら、完成形が決まっているかで分けると簡単です。
完成形へ正確に近づけたいならExtra High、完成形を決めるための難しい判断から任せたいならMaxを選びます。
思考量を上げるとトークンと利用量はどうなる?
OpenAIのReasoning modelsの公式説明では、思考量を上げるほど一般に待ち時間とトークン使用量が増えるとされています。
ただし処理量は課題に応じて変わるため、Mediumは何トークン、Highは何トークンという固定値ではありません。
GPT-5.6 Solの公式仕様は、コンテキストウィンドウ105万トークン、最大出力12万8,000トークンです。
これはモデルの技術的な上限であり、MediumやHighごとに別の上限が用意されているという意味ではありません。
APIでは表に出ない推論トークンも出力トークンとして扱われ、コンテキストを使い、料金にも反映されます。
ChatGPT Workの利用枠やクレジット消費は契約や機能で異なるため、各思考量の固定消費数が公表されていない限り、正確な回数へ換算できません。
したがってコスパは、単純な点数割る秒数だけではなく、生成待ち時間、利用量、修正時間を合わせて判断します。
Mediumの初稿を2分直すより、Extra Highを90秒余分に待つ方が修正を大きく減らせるなら、重要記事ではExtra Highが得になる場合もあります。
迷ったときの選び方を4段階で整理
毎回細かな数値を見比べなくても、次の順番で判断すれば十分です。
大切なのは、思考量を上げること自体を目的にせず、今の出力で不足している部分を先に特定することです。
- 通常の記事はMediumで作る:検索意図、構成、結論、形式を具体的に指定します。
- 浅ければ原因を分ける:指示不足ならプロンプトを直し、検討不足ならHighへ上げます。
- 重要記事はExtra Highを検討する:複数条件の遵守と入稿前の完成度を優先します。
- 最難関だけMaxを使う:前提整理や厳密な検証が必要で、速度より深さを選ぶ場合です。
この基準なら、Mediumで十分な仕事に余計な待ち時間を使わず、難しい仕事だけ上位設定へ回せます。
同じ種類の作業を繰り返す場合は、最初に各設定を数回比べ、自分の修正時間まで記録すると判断が安定します。
MediumとHighに関するよくある質問
HighはMediumより文章力が高い?
複雑な課題ではHighの深い検討が品質へつながる可能性がありますが、文章力が常に上がるわけではありません。
今回のSEO記事では、検索意図、構成、SEOは同点で、総合品質も実用上は同等でした。
Mediumで十分かどうかは何を見ればよい?
読者の疑問へ結論が出ており、根拠、手順、注意点がそろい、指定形式も守れていればMediumで十分です。
設定名ではなく、公開前のチェック項目を満たしたかで判断してください。
Highへ上げると文字数も増える?
増えると決まってはいませんが、補足、条件、例外を多く検討するため、長くなる可能性はあります。
今回もHighはMediumより平均約100字長く、最大で指定上限を470字超えました。
Highは必ずMediumより遅い?
必ずではありません。
今回も3回目はHighの方が早かった一方、3回平均と中央値ではMediumが短く、複数回ではHighの待ち時間が増える傾向を確認しました。
MediumとHighの0.17点差に意味はある?
今回の採点だけで優劣を決める意味はほとんどありません。
同じ記事の採点差が平均1.73点あったため、0.17点は誤差や評価の揺れに含まれる可能性が高いからです。
長文記事なら最初からHighがよい?
長さだけではHighを選ぶ理由になりません。
長くても構成と材料が決まっていればMediumで対応でき、短くても条件が衝突し、難しい判断が必要ならHighが向きます。
競合調査やWeb検索を使う記事はHighがよい?
検索件数ではなく、集めた情報をどう判断するかで決めます。
資料が一致して要約するだけならMedium、情報が食い違い、信頼性や例外を比較するならHighが有力です。
Extra HighとMaxのどちらが高品質?
すべての課題で一方が上になるわけではなく、今回のSEO記事ではExtra Highが97.67点でMaxの96.50点を上回りました。
完成稿の条件遵守はExtra High、解き方自体が難しい課題の探索はMaxという目的の違いで選びます。
Maxなら事実確認も自動で完璧になる?
Maxでも、与えた情報や参照した資料に誤りがあれば、結論が正しいとは限りません。
重要な事実は一次情報を示し、出典と主張が対応しているかを人が確認する必要があります。
AIによる品質点数は信用できる?
絶対的な点数としてではなく、同じ条件の文章を同じ基準で比べる補助材料として使うのが適切です。
今回は匿名化と逆順の2回採点で偏りを減らしましたが、最終判断は全文、形式違反、回答時間も合わせています。
この結論はSEO記事以外にも当てはまる?
「低い思考量から始め、測れた不足があるときだけ上げる」という考え方は他の作業にも使えます。
ただし今回の順位は一つのSEOテーマによる小規模実験なので、プログラミングや長文分析で同じ順位になるとは限りません。
まとめ
GPT-5.6 Solで通常のSEO記事を書くなら、Mediumを標準にするのがベストです。
Highと品質は実用上ほぼ同じでしたが、Mediumは平均13.922秒短く、読みやすさと指示遵守でもわずかに上回りました。
Mediumが浅いときは、まずプロンプトの不足を直し、それでも比較や検証が浅い場合だけHighへ上げます。
完成条件の多い重要記事はExtra High、前提から解く最難関の問題はMaxと、目的を分けて選びましょう。
思考量は高いほど得をする設定ではなく、必要な結果を得られる最低の段階が最もコスパの良い設定です。
生成時間だけでなく、利用量と人が直す時間まで含め、自分の作業で上位設定の価値を測ることが大切です。


ディスカッション
コメント一覧
まだ、コメントがありません