Lilith.
⌕

LLMガイド

モデル比較

用途・価格・制約から選べる実用的な一覧です。条件を絞り、目の前の仕事に合うモデルの詳細を確認できます。

更新日 2026-10-08 次回確認 2026-10-09 変更履歴 →
モデルを絞り込む
16モデル
用途
予算
カテゴリ

複数の条件を組み合わせられます。すべての条件を満たすモデルだけが残ります。

おすすめの候補

仕事の種類に応じた3つの出発点です。優劣のランキングではありません。

Claude Fable 5.1

おすすめ
Anthropic

概要

プログラミングに。検証済みデータで判断。

Claude Fable 5.1の出典に記載された数値はIQ 53.4、入力 $10/Mです。プログラミング, AIエージェントでの利用を検討できますが、低コストの大量処理, 厳しい応答時間の要件に使う前には追加の評価を行ってください。

+向いている用途プログラミング · AIエージェント · 社内知識の活用
−向いていない用途低コストの大量処理 · 厳しい応答時間の要件
53.4知能指数 $10.0入力 / 100万 $50.0出力 / 100万

失敗の代償が大きい仕事向けの高予算 · 最も難しい仕事 · 外部データで検証済み

最も難しい仕事 失敗の代償が大きい仕事向けの高予算 プログラミングAIエージェント
モデルの詳細

DeepSeek V4.1 Flash

おすすめ
DeepSeek

概要

バッチ処理に。検証済みデータで判断。

DeepSeek V4.1 Flashの出典に記載された数値はIQ 39.5、入力 $0.3/Mです。バッチ処理, 素早い応答での利用を検討できますが、最高難度の推論, 最高難度のプログラミングに使う前には追加の評価を行ってください。

+向いている用途バッチ処理 · 素早い応答 · 自社運用
−向いていない用途最高難度の推論 · 最高難度のプログラミング
39.5知能指数 $0.3入力 / 100万 $1.2出力 / 100万

公開モデル・自社運用 · 専門用途 · 外部データで検証済み

専門用途 公開モデル・自社運用 バッチ処理素早い応答
モデルの詳細

GLM-5.3

おすすめ
Z.AI/Zhipu

概要

自社運用に。検証済みデータで判断。

GLM-5.3の出典に記載された数値はIQ 44.8、入力 $1.4/Mです。自社運用, 規制への対応が必要な環境での利用を検討できますが、高度なエージェント処理, 最高難度のプログラミングに使う前には追加の評価を行ってください。

+向いている用途自社運用 · 規制への対応が必要な環境 · バッチ処理
−向いていない用途高度なエージェント処理 · 最高難度のプログラミング
44.8知能指数 $1.4入力 / 100万 $4.4出力 / 100万

公開モデル・自社運用 · 専門用途 · 外部データで検証済み

専門用途 公開モデル・自社運用 自社運用規制への対応が必要な環境
モデルの詳細

モデル一覧

概要を簡潔に示します。詳しい数値・出典・判断理由は各モデルの詳細ページにあります。

Claude Fable 5.1

Anthropic

概要

プログラミングに。検証済みデータで判断。

Claude Fable 5.1の出典に記載された数値はIQ 53.4、入力 $10/Mです。プログラミング, AIエージェントでの利用を検討できますが、低コストの大量処理, 厳しい応答時間の要件に使う前には追加の評価を行ってください。

+向いている用途プログラミング · AIエージェント · 社内知識の活用
−向いていない用途低コストの大量処理 · 厳しい応答時間の要件
53.4知能指数 $10.0入力 / 100万 $50.0出力 / 100万

失敗の代償が大きい仕事向けの高予算 · 最も難しい仕事 · 外部データで検証済み

最も難しい仕事 失敗の代償が大きい仕事向けの高予算 プログラミングAIエージェント
モデルの詳細

GPT-6 Astra

OpenAI

概要

プログラミングに。検証済みデータで判断。

GPT-6 Astraの出典に記載された数値はIQ 52.7、入力 $10/Mです。プログラミング, AIエージェントでの利用を検討できますが、低コストの大量処理, 自社運用に使う前には追加の評価を行ってください。

+向いている用途プログラミング · AIエージェント · 画像・マルチモーダル処理
−向いていない用途低コストの大量処理 · 自社運用 · 厳しい応答時間の要件
52.7知能指数 $10.0入力 / 100万 $50.0出力 / 100万

失敗の代償が大きい仕事向けの高予算 · 最も難しい仕事 · 外部データで検証済み

最も難しい仕事 失敗の代償が大きい仕事向けの高予算 プログラミングAIエージェント
モデルの詳細

Claude Opus 5.5

Anthropic

概要

プログラミングに。検証済みデータで判断。

Claude Opus 5.5の出典に記載された数値はIQ 51.2、入力 $4/Mです。プログラミング, AIエージェントでの利用を検討できますが、低コストの大量処理, 厳しい応答時間の要件に使う前には追加の評価を行ってください。

+向いている用途プログラミング · AIエージェント · 社内知識の活用
−向いていない用途低コストの大量処理 · 厳しい応答時間の要件
51.2知能指数 $4.0入力 / 100万 $20.0出力 / 100万

中程度の予算 · 最も難しい仕事 · 外部データで検証済み

最も難しい仕事 中程度の予算 プログラミングAIエージェント
モデルの詳細

GPT-5.6 Sol

OpenAI

概要

プログラミングに。検証済みデータで判断。

GPT-5.6 Solの出典に記載された数値はIQ 47、入力 $4/Mです。プログラミング, AIエージェントでの利用を検討できますが、自社運用, 厳しい応答時間の要件に使う前には追加の評価を行ってください。

+向いている用途プログラミング · AIエージェント · 文書からの情報抽出
−向いていない用途自社運用 · 厳しい応答時間の要件
47.0知能指数 $4.0入力 / 100万 $20.0出力 / 100万

中程度の予算 · 最も難しい仕事 · 外部データで検証済み

最も難しい仕事 中程度の予算 プログラミングAIエージェント
モデルの詳細

Grok 4.7

xAI

概要

プログラミングに。検証済みデータで判断。

Grok 4.7の出典に記載された数値はIQ 46.3、入力 $2/Mです。プログラミング, 素早い応答での利用を検討できますが、自社運用, 規制への対応が必要な環境に使う前には追加の評価を行ってください。

+向いている用途プログラミング · 素早い応答 · 文書からの情報抽出
−向いていない用途自社運用 · 規制への対応が必要な環境
46.3知能指数 $2.0入力 / 100万 $6.0出力 / 100万

中程度の予算 · 最も難しい仕事 · 外部データで検証済み

最も難しい仕事 中程度の予算 プログラミング素早い応答
モデルの詳細

Qwen3.8 Max

Alibaba

概要

多言語コンテンツに。検証済みデータで判断。

Qwen3.8 Maxの出典に記載された数値はIQ 45.4、入力 $2/Mです。多言語コンテンツ, プログラミングでの利用を検討できますが、自社運用, 高度なエージェント処理に使う前には追加の評価を行ってください。

+向いている用途多言語コンテンツ · プログラミング · バッチ処理
−向いていない用途自社運用 · 高度なエージェント処理
45.4知能指数 $2.0入力 / 100万 $6.0出力 / 100万

中程度の予算 · 専門用途 · 外部データで検証済み

専門用途 中程度の予算 多言語コンテンツプログラミング
モデルの詳細

GLM-5.3

Z.AI/Zhipu

概要

自社運用に。検証済みデータで判断。

GLM-5.3の出典に記載された数値はIQ 44.8、入力 $1.4/Mです。自社運用, 規制への対応が必要な環境での利用を検討できますが、高度なエージェント処理, 最高難度のプログラミングに使う前には追加の評価を行ってください。

+向いている用途自社運用 · 規制への対応が必要な環境 · バッチ処理
−向いていない用途高度なエージェント処理 · 最高難度のプログラミング
44.8知能指数 $1.4入力 / 100万 $4.4出力 / 100万

公開モデル・自社運用 · 専門用途 · 外部データで検証済み

専門用途 公開モデル・自社運用 自社運用規制への対応が必要な環境
モデルの詳細

DeepSeek V4.1 Flash

DeepSeek

概要

バッチ処理に。検証済みデータで判断。

DeepSeek V4.1 Flashの出典に記載された数値はIQ 39.5、入力 $0.3/Mです。バッチ処理, 素早い応答での利用を検討できますが、最高難度の推論, 最高難度のプログラミングに使う前には追加の評価を行ってください。

+向いている用途バッチ処理 · 素早い応答 · 自社運用
−向いていない用途最高難度の推論 · 最高難度のプログラミング
39.5知能指数 $0.3入力 / 100万 $1.2出力 / 100万

公開モデル・自社運用 · 専門用途 · 外部データで検証済み

専門用途 公開モデル・自社運用 バッチ処理素早い応答
モデルの詳細

Gemini 3.6 Flash

Google

概要

バッチ処理に。検証済みデータで判断。

Gemini 3.6 Flashの出典に記載された数値はIQ 34、入力 $0.75/Mです。バッチ処理, 社内知識の活用での利用を検討できますが、複雑な開発, 厳しい応答時間の要件に使う前には追加の評価を行ってください。

+向いている用途バッチ処理 · 社内知識の活用 · 素早い応答
−向いていない用途複雑な開発 · 厳しい応答時間の要件
34.0知能指数 $0.75入力 / 100万 $3.75出力 / 100万

大量処理を低コストで · 専門用途 · 外部データで検証済み

専門用途 大量処理を低コストで バッチ処理社内知識の活用
モデルの詳細

DeepSeek V4 Pro 0813

DeepSeek

概要

バッチ処理に。検証済みデータで判断。

DeepSeek V4 Pro 0813の出典に記載された数値はIQ 36、入力 $1.32/Mです。バッチ処理, プログラミングでの利用を検討できますが、社内統制と監査, 高度なエージェント処理に使う前には追加の評価を行ってください。

+向いている用途バッチ処理 · プログラミング · 自社運用
−向いていない用途社内統制と監査 · 高度なエージェント処理
36.0知能指数 $1.32入力 / 100万 $3.96出力 / 100万

公開モデル・自社運用 · 専門用途 · 外部データで検証済み

専門用途 公開モデル・自社運用 バッチ処理プログラミング
モデルの詳細

Command A+

Cohere

概要

社内知識の活用に。検証済みデータで判断。

Command A Plusの出典に記載された数値はIQ 13.1、入力 $0/Mです。社内知識の活用, 文書からの情報抽出での利用を検討できますが、最高難度のプログラミング, 最高難度の推論に使う前には追加の評価を行ってください。

+向いている用途社内知識の活用 · 文書からの情報抽出 · 規制への対応が必要な環境
−向いていない用途最高難度のプログラミング · 最高難度の推論
13.1知能指数 $0.0入力 / 100万 $0.0出力 / 100万

大量処理を低コストで · 専門用途 · 外部データで検証済み

専門用途 大量処理を低コストで 社内知識の活用文書からの情報抽出
モデルの詳細

Llama 4 Maverick

Meta

概要

自社運用に。検証済みデータで判断。

Llama 4 Maverickの出典に記載された数値はIQ 10、入力 $0.25/Mです。自社運用, 規制への対応が必要な環境での利用を検討できますが、マネージドAPIの手軽さ, 最高難度の推論に使う前には追加の評価を行ってください。

+向いている用途自社運用 · 規制への対応が必要な環境 · 社内知識の活用
−向いていない用途マネージドAPIの手軽さ · 最高難度の推論
10.0知能指数 $0.25入力 / 100万 $0.87出力 / 100万

公開モデル・自社運用 · 専門用途 · 外部データで検証済み

専門用途 公開モデル・自社運用 自社運用規制への対応が必要な環境
モデルの詳細

Kimi K3

Moonshot

概要

プログラミングに。検証済みデータで判断。

Kimi K3の出典に記載された数値はIQ 43.6、入力 $3/Mです。プログラミング, バッチ処理での利用を検討できますが、社内統制と監査, 確実なツール利用に使う前には追加の評価を行ってください。

+向いている用途プログラミング · バッチ処理 · 社内知識の活用
−向いていない用途社内統制と監査 · 確実なツール利用
43.6知能指数 $3.0入力 / 100万 $15.0出力 / 100万

中程度の予算 · 専門用途 · 外部データで検証済み

専門用途 中程度の予算 プログラミングバッチ処理
モデルの詳細

Claude Sonnet 5.5

Anthropic

概要

プログラミングに。検証済みデータで判断。

Claude Sonnet 5.5の出典に記載された数値はIQ 40.8、入力 $2/Mです。プログラミング, AIエージェントでの利用を検討できますが、自社運用, 低コストの大量処理に使う前には追加の評価を行ってください。

+向いている用途プログラミング · AIエージェント · 社内知識の活用
−向いていない用途自社運用 · 低コストの大量処理
40.8知能指数 $2.0入力 / 100万 $10.0出力 / 100万

中程度の予算 · 専門用途 · 外部データで検証済み

専門用途 中程度の予算 プログラミングAIエージェント
モデルの詳細

Gemini 3.1 Pro Preview

Google

概要

社内知識の活用に。検証済みデータで判断。

Gemini 3.1 Pro Previewの出典に記載された数値はIQ 29.7、入力 $2/Mです。社内知識の活用, 画像・マルチモーダル処理での利用を検討できますが、厳しい応答時間の要件, 自社運用に使う前には追加の評価を行ってください。

+向いている用途社内知識の活用 · 画像・マルチモーダル処理 · 多言語コンテンツ
−向いていない用途厳しい応答時間の要件 · 自社運用
29.7知能指数 $2.0入力 / 100万 $12.0出力 / 100万

中程度の予算 · 専門用途 · 外部データで検証済み

専門用途 中程度の予算 社内知識の活用画像・マルチモーダル処理
モデルの詳細

Mistral Medium 3.5

Mistral AI

概要

規制への対応が必要な環境に。検証済みデータで判断。

Mistral Medium 3.5の出典に記載された数値はIQ 14.2、入力 $1.5/Mです。規制への対応が必要な環境, 社内知識の活用での利用を検討できますが、最高難度の推論, 最高難度のプログラミングに使う前には追加の評価を行ってください。

+向いている用途規制への対応が必要な環境 · 社内知識の活用 · 文書からの情報抽出
−向いていない用途最高難度の推論 · 最高難度のプログラミング
14.2知能指数 $1.5入力 / 100万 $7.5出力 / 100万

中程度の予算 · 専門用途 · 外部データで検証済み

専門用途 中程度の予算 規制への対応が必要な環境社内知識の活用
モデルの詳細
データのまとめ方

毎日更新するモデルの厳選リストです。価格とIntelligence IndexはArtificial Analysisの最新データと照合し、その他のベンチマークには個別の出典を示します。評価方法が変わると、モデル自体が変わらなくてもスコアが変動するため、異なる時点の指数を直接比較できるとは限りません。検証に失敗した場合は、最後に検証できたデータを元の日付のまま表示します。