GPT-6.1 Sol
OpenAIAA 指数はトップ(Opus 5.5)の約 9 割なのに、AA の 1 タスク単価は Opus 5.5 の約 1/8。“ほぼフロンティア”を中価格帯で使える。 詳細カード↓
バッジはビルド時刻(2026-10-07 01:11 JST)基準: NEW = 公開から 24 時間未満、昨日 = 24〜48 時間。公開時刻が分からない項目は公開日の 0:00 JST とみなす(=日付が今日なら NEW、昨日なら 昨日)。
出典: Artificial Analysis(2026-10-07 取得・独立計測)/LMArena Text(2026-10-02 スナップショット・style control)/Vals SWE-bench Verified(2026-09-01 更新停止)。各モデルは最大の reasoning effort 設定(AA の既定バリアント)で比較。LMArena は同モデルの最上位バリアントの行を採用。値が取得できない項目は空欄(推定しない)。
Artificial Analysis Intelligence Index(AA 指数)あたりの価格・1タスク単価が特に低いモデル。日常のコーディング補助・バッチ処理・エージェントの下位ステップ向け。
AA 指数はトップ(Opus 5.5)の約 9 割なのに、AA の 1 タスク単価は Opus 5.5 の約 1/8。“ほぼフロンティア”を中価格帯で使える。 詳細カード↓
オープンウェイト(MIT)で AA 指数トップ。API 価格は $0.435/$0.87 と GPT-6.1 Sol の 1/5〜1/10 で、1 タスク単価も比較モデル中で最安級。
$0.15/$0.50 で AA 指数 40 台・Arena 1470 台。SWE-bench Verified(Vals)も 90% 超。ZDR 対応プロバイダが最も多く、提供先を選びやすい。
LMArena で上位 10 位以内(人間の好み評価が非常に高い)なのに $0.75/$3.75。出力 240 tok/s 前後と高速。
AA 指数 39 を $0.30/$1.20 で。出力 200 tok/s 超と比較モデル中トップクラスの速さで、MIT ライセンス・提供プロバイダ多数。 詳細カード↓
$0.10/$0.50 と最安クラスで、AA の 1 タスク単価は 1 セント未満〜数セント。分類・要約・ツール呼び出し前処理などの大量実行向け。 詳細カード↓
AA 指数・LMArena・Terminal-Bench 4.0 などで最上位のモデル。価格は高いが難しい設計判断・長時間エージェント・レビュー向け。
AA 指数で単独 1 位、HLE・SciCode も最上位。LMArena でも上位。価格は $4/$20 で前世代 Opus より安い。 詳細カード↓
AA 指数 2 位、Terminal-Bench 4.0(エージェント型コーディング)は比較モデル中で最高。単価は Opus の半額だが、max 設定はトークンを多く使うため 1 タスク単価は高め。 詳細カード↓
AA 指数・HLE ともに上位で LMArena もトップ 10。長時間推論向けの最上位ラインだが $10/$50 と最も高価な部類。 詳細カード↓
OpenAI の最上位。GPQA Diamond(AA 計測)は比較モデル中で最高水準、Terminal-Bench 4.0 も上位。$10/$50 と高価。 詳細カード↓
LMArena Text で 1 位(暫定・票数少なめ)。AA 指数も上位で、導入価格 $2/$10 はトップ群で最安。現在は限定提供。 詳細カード↓
性能トップ コスパ重視 データなし = 出典に値がない(推定しない)
左上ほどコスパが良い。1タスク単価は価格×実際に使ったトークン量(推論が長いモデルは高くなる)。
Arena は各モデルの最上位バリアント。
各モデルの最大 effort 設定。
軸は 1420 起点(差を見やすくするため)。2026-10-02 スナップショット。暫定 = LMArena の pre_release 表記。
各モデル上段 = 入力、下段 = 出力(薄い色が入力)。価格は Artificial Analysis 掲載のファーストパーティ API 標準価格。
AA は現行指数(v4.3)から GPQA を外しており、新しいモデルは未計測が多い。
Vals は 2026-09-01 で更新停止(飽和のためアーカイブ)。新しいモデルは未計測。
| モデル | グループ | AA指数 | Arena | TB 4.0 | SciCode | HLE | GPQA | SWE-V | 入力/出力 | 1タスク | 出力速度 | コンテキスト |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-6.1 Sol | コスパ重視 | 51.8 | 1483 ±11 | 56.1 | 54.2 | 52.9 | — | — | $2.00 / $10 | $0.724 | 58 t/s | 1M |
| MiMo-V2.6-Pro | コスパ重視 | 46.3 | 1480 ±9 | 34.8 | 60.9 | 49.4 | — | — | $0.435 / $0.87 | $0.133 | 47 t/s | 1M |
| GLM-5.3-Flash | コスパ重視 | 41.8 | 1473 ±5 | 32.8 | 51.6 | 39.9 | 91.2 | 92.0 | $0.15 / $0.50 | $0.253 | 53 t/s | 1M |
| Gemini 3.8 Flash | コスパ重視 | 40.9 | 1495 ±5 | 19.7 | 56.6 | 47.8 | 95.3 | 80.0 | $0.75 / $3.75 | $1.243 | 242 t/s | 1M |
| DeepSeek-V4.1-Flash | コスパ重視 | 39.5 | 1474 ±7 | 26.8 | 51.9 | 39.2 | — | — | $0.30 / $1.20 | $0.265 | 227 t/s | 1M |
| GPT-6 Luna | コスパ重視 | 38.1 | 1443 ±7 | 12.6 | 54.6 | 38.5 | — | — | $0.10 / $0.50 | $0.068 | 135 t/s | 1M |
| Claude Opus 5.5 | 性能トップ | 57.6 | 1504 ±9 | 59.6 | 66.9 | 61.4 | — | — | $4.00 / $20 | $5.982 | 97 t/s | 1M |
| Claude Sonnet 5.5 | 性能トップ | 56.0 | 1471 ±10 | 63.6 | 61.0 | 55.0 | — | — | $2.00 / $10 | $7.667 | 127 t/s | 1M |
| Claude Fable 5.1 | 性能トップ | 53.4 | 1501 ±6 | 52.0 | 63.1 | 59.1 | 93.7 | — | $10 / $50 | $7.63 | 62 t/s | 1M |
| GPT-6 Astra | 性能トップ | 52.7 | 1477 ±7 | 59.1 | 56.5 | 54.7 | 96.1 | — | $10 / $50 | $3.257 | 63 t/s | 1M |
| Gemini 4 Argon | 性能トップ | 52.6 | 1525 ±9 | 57.1 | 61.8 | 57.1 | — | — | $2.00 / $10 | $1.99 | — | 1M |
判定ルール: 該当 = OpenRouter の ZDR エンドポイント一覧(/api/v1/endpoints/zdr)に載っている かつ プロバイダ既定ポリシーで「プロンプトで学習しない」(docs の Provider Logging 表=all-providers の dataPolicy.training=false)。該当プロバイダ数は提供元のユニーク数。おすすめ 3 件は該当かつ稼働中のエンドポイントをブレンド価格(入力3:出力1)の安い順に、同一プロバイダ重複を除いて選出。
throughput / latency は公開 endpoints API では null のことが多く、その場合は「—」表示(推定しない)。quantization が unknown のものはプロバイダが未申告。 取得: 2026-10-07 01:07 JST。
コスパ上位 3(ブレンド価格順)
| プロバイダ | 量子化 | 入力/出力 (USD/1M) | コンテキスト | 稼働率(1日) |
|---|---|---|---|---|
| DeepInfra | fp8 | $0.43 / $0.87 | 1.05M | 99.9% |
| Novita | fp8 | $0.435 / $0.87 | 1.05M | 99.0% |
速度・遅延: OpenRouter の公開 API に値なし(—)
DeepInfra、Novita
コスパ上位 3(ブレンド価格順)
| プロバイダ | 量子化 | 入力/出力 (USD/1M) | コンテキスト | 稼働率(1日) |
|---|---|---|---|---|
| DeepInfra | fp4 | $0.075 / $0.25 | 1.05M | 99.2% |
| Novita | fp8 | $0.084 / $0.28 | 1.05M | 92.1% |
| Decart | fp4 | $0.087 / $0.29 | 1.05M | 98.9% |
速度・遅延: OpenRouter の公開 API に値なし(—)
BaseTen、CoreWeave、Crusoe、Decart、DeepInfra、DekaLLM、DigitalOcean、Fireworks、Inceptron、InferenceNet、Modal、Morph、Near AI、NextBit、Novita、OpenInference、Parasail、Phala、Reka、Relace、Sail Research、SiliconFlow、Together、Venice、Wafer、Z.AI
コスパ上位 3(ブレンド価格順)
| プロバイダ | 量子化 | 入力/出力 (USD/1M) | コンテキスト | 稼働率(1日) |
|---|---|---|---|---|
| Decart | fp4 | $0.09 / $0.18 | 1.05M | 98.8% |
| InferenceNet | unknown | $0.07 / $0.30 | 1.04M | 99.6% |
| Sail Research | fp4 | $0.08 / $0.40 | 1.05M | 99.5% |
速度・遅延: OpenRouter の公開 API に値なし(—)
BaseTen、CoreWeave、Decart、DeepInfra、DekaLLM、DigitalOcean、Fireworks、InferenceNet、Ionstream、Makora、Modal、Morph、NextBit、Novita、OpenInference、Parasail、Phala、Reka、Relace、Sail Research、SiliconFlow、Together、Venice、Wafer
チャートに載せていないモデル。AA指数の高い順。TB 4.0 = Terminal-Bench 4.0、SWE-V = SWE-bench Verified(Vals・Mini-SWE-agent、9/1 で更新停止)、% 表記省略。* = AA の推定値(一部評価のみ)。「ZDR・学習なし提供元数」は該当数 / OpenRouter 上の全提供元数(オープンウェイトのみ)。空欄 = 出典に値なし。
| モデル | 開発元 | リリース | 重み | アーキテクチャ / パラメータ | コンテキスト | 価格 入力/出力 (USD/1M) | AA指数 | TB 4.0 | HLE | GPQA | SWE-V | Arena | ZDR・学習なし 提供元数 | 出典 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5 | Anthropic | 2026-07-24 | — | 非公開 | 1M | $5.00 / $25 | 50.8 | 49.0 | 54.9 | 93.2 | 97.0 | 1489 #14 | クローズド | AA ・ Arena ・ Vals ・ OR |
| Muse Spark 1.3 | Meta | 2026-09-02 | — | 非公開 | 1M | $1.25 / $4.25 | 48.1 | 33.3 | 48.7 | 93.5 | — | 1494 #9 | クローズド | AA ・ Arena ・ OR |
| GPT-6 Sol GPT-6.1 Sol に置き換え(AA では deprecated 扱い) | OpenAI | 2026-09-22 | — | 非公開 | 1.05M | $2.00 / $10 | 47.6 | 43.9 | 47.9 | — | — | 1457 #64 | クローズド | AA ・ Arena ・ OR ・ カード |
| Grok 4.7 | SpaceXAI(xAI) | 2026-09-21 | — | 非公開 | 500K | $2.00 / $6.00 | 46.4 | 25.8 | 43.1 | — | — | 1442 #91 | クローズド | AA ・ Arena ・ OR ・ カード |
| Qwen3.8 Max(0902) Arena の qwen3.8-max はバージョン表記なし | Alibaba | 2026-09-02 | — | 非公開 | 984K | $2.00 / $6.00 | 45.4 | 38.9 | 43.1 | 92.8 | — | 1482 #23 | クローズド | AA ・ Arena ・ OR |
| GLM-5.3 | Z.ai | 2026-08-18 | ✓ 公開 | MoE 総 753B / アクティブ 40B | 1M | $1.40 / $4.40 | 44.8 | 41.9 | 42.3 | 91.7 | 95.4 | 1478 #27 | 26 / 32 | AA ・ Arena ・ Vals ・ OR |
| Step 5 Preview | StepFun | 2026-09-18 | — | MoE 総 600B / アクティブ 27B | 1M | $1.00 / $2.70 | 43.7 | 33.3 | 46.5 | — | — | 1454 #74 | クローズド | AA ・ Arena |
| Kimi K3 | Moonshot AI | 2026-07-16 | ✓ 公開 | MoE 総 2800B / アクティブ 104B | 1.05M | $3.00 / $15 | 43.6 | 12.6 | 46.9 | 93.5 | 93.4 | 1488 #16 | 18 / 20 | AA ・ Arena ・ Vals ・ OR ・ カード |
| GPT-5.6 Terra | OpenAI | 2026-07-09 | — | 非公開 | 1M | $2.00 / $12 | 42.1 | 35.4 | 42.9 | 92.5 | 95.4 | 1465 #51 | クローズド | AA ・ Arena ・ Vals ・ OR |
| Ling 3.1 Flash OpenRouter では価格 $0(無料提供中)表示 | InclusionAI | 2026-10-01 | — | MoE 総 560B / アクティブ 25B | 1M | $0.30 / $0.90 | 41.1 | 33.3 | 39.4 | — | — | — | クローズド | AA ・ OR |
| Qwen3.8 2.4T A95B | Alibaba | 2026-08-12 | ✓ 公開 | MoE 総 2400B / アクティブ 95B | 262K | $2.00 / $6.00 | 39.9 | 11.1 | 42.4 | 93.5 | — | — | 6 / 7 | AA ・ OR |
| Qwen3.8-Flash-Next | Alibaba | 2026-08-26 | ✓ 公開 | MoE 総 180B / アクティブ 6B | 256K | $0.15 / $0.47 | 39.8 | 25.3 | 38.0 | 92.3 | — | — | 0 / 1 | AA ・ OR |
| Mistral Large 4(Preview) 重みは 2026-10 末公開予定。公開後 2 週間は API 50% 引き | Mistral AI | 2026-10-06 | 予定 | MoE 総 1000B / アクティブ 49B | 524K | $1.36 / $4.18 | 38.4 | 26.8 | 35.0 | — | — | — | 重み未公開 | AA ・ OR ・ カード |
| MiMo-V2.6-Flash | Xiaomi | 2026-09-21 | ✓ 公開 | MoE 総 309B / アクティブ 15B | 1M | $0.14 / $0.28 | 37.9 | 22.7 | 35.1 | — | — | 1452 #77 | 4 / 7 | AA ・ Arena ・ OR |
| DeepSeek-V4-Pro-0813 | DeepSeek | 2026-08-13 | ✓ 公開 | MoE 総 1600B / アクティブ 49B | 1M | $1.32 / $3.96 | 36.0 | 14.1 | 41.0 | 92.8 | 96.4 | 1464 #56 | 15 / 22 | AA ・ Arena ・ Vals ・ OR |
| Qwen3.8 27B | Alibaba | 2026-08-14 | ✓ 公開 | 27B | 256K | $0.50 / $3.00 | 33.7 | 5.6 | 33.9 | 90.5 | 86.0 | 1438 #99 | 14 / 18 | AA ・ Arena ・ Vals ・ OR |
| MiniMax-M3 | MiniMax | 2026-06-01 | ✓ 公開 | MoE 総 428B / アクティブ 23B | 1M | $0.30 / $1.20 | 29.2 | 2.0 | 39.0 | 92.9 | 75.0 | 1440 #96 | 9 / 13 | AA ・ Arena ・ Vals ・ OR |
| Inkling Small | Thinking Machines | 2026-07-30 | ✓ 公開 | MoE 総 266B / アクティブ 12B | 1M | $0.30 / $1.20 | 25.7 | 1.0 | 33.3 | 89.5 | 82.2 | 1405 #152 | 1 / 1 | AA ・ Arena ・ Vals ・ OR |
| Hy3 | Tencent | 2026-07-06 | ✓ 公開 | MoE 総 299B / アクティブ 21B | 256K | $0.136 / $0.555 | 25.3 | 0.5 | 33.5 | 89.7 | — | 1456 #67 | 4 / 6 | AA ・ Arena ・ OR |
| Inkling | Thinking Machines | 2026-07-15 | ✓ 公開 | MoE 総 975B / アクティブ 41B | 1M | $1.00 / $4.05 | 25.0 | 1.0 | 31.9 | 87.2 | 77.6 | 1441 #95 | 2 / 2 | AA ・ Arena ・ Vals ・ OR |
| Nemotron 3 Ultra 550B A55B | NVIDIA | 2026-06-04 | ✓ 公開 | MoE 総 550B / アクティブ 55B | 262K | $0.60 / $2.50 | 22.9 | 0.5 | 28.4 | 86.7 | — | 1426 #118 | 3 / 3 | AA ・ Arena ・ OR |
| Gemini 3.5 Flash-Lite | 2026-07-21 | — | 非公開 | 1M | $0.30 / $2.50 | 22.2 | 1.0 | 18.8 | 83.8 | 75.0 | 1455 #71 | クローズド | AA ・ Arena ・ Vals ・ OR | |
| LongCat 2.0 | Meituan | 2026-06-29 | ✓ 公開 | MoE 総 1600B / アクティブ 48B | 1M | $0.30 / $1.20 | 19.1 | 0.0 | 33.7 | 78.0 | — | — | 0 / 1 | AA ・ OR |
| Gemma 4 31B | 2026-04-02 | ✓ 公開 | Dense 30.7B | 256K | $0.09 / $0.34 (OR) | 14.7 | 0.0 | 23.6 | 85.7 | — | 1453 #76 | 10 / 12 | AA ・ Arena ・ OR | |
| Mistral Medium 3.5 | Mistral AI | 2026-04-29 | ✓ 公開 | 128B | 256K | $1.50 / $7.50 | 14.2 | 0.0 | 13.8 | 74.8 | — | 1427 #115 | 1 / 1 | AA ・ Arena ・ OR |
| Command A+ | Cohere | 2026-05-20 | ✓ 公開 | MoE 総 218B / アクティブ 25B | 192K | $0.30 / $1.50 (OR) | 13.1 | 0.5 | 12.0 | 76.1 | — | — | 1 / 1 | AA ・ OR |
| Nemotron 3.5 Lightning | NVIDIA | 2026-08-11 | ✓ 公開 | MoE 総 31.6B / アクティブ 3.6B | 1M | $0.06 / $0.20 | 12.9 | 0.5 | 10.6 | 74.3 | 52.8 | 1350 #214 | 4 / 5 | AA ・ Arena ・ Vals ・ OR |
| Mercury 2.5 | Inception | 2026-09-08 | — | 拡散型 LLM(詳細非公開) | 260K | $0.25 / $0.75 | 12.3 | 0.0 | 11.8 | — | — | — | クローズド | AA ・ OR |
| gpt-oss-120b | OpenAI | 2025-08-05 | ✓ 公開 | MoE 総 117B / アクティブ 5.1B | 131K | $0.15 / $0.595 | 11.6 | 0.0 | 19.6 | 78.2 | 33.6 | 1352 #212 | 20 / 20 | AA ・ Arena ・ Vals ・ OR |
| Reflection Beam 第三者評価・API 価格・OpenRouter 掲載なし(自己申告ベンチはカード参照) | Reflection AI | 2026-10-05 | 予定 | MoE 総 501B / アクティブ 23B | 1M | — / — | — | — | — | — | — | — | 重み未公開 | カード |
| Kolibri-1 第三者評価・OpenRouter 掲載なし(自己申告ベンチはカード参照)。独英のみ対応 | Aleph Alpha | 2026-10-03 | ✓ 公開 | MoE 総 78.1B / アクティブ 3.46B(FP8 重み) | 262K | — / — | — | — | — | — | — | — | OR 未掲載 | カード |
各社発表ベースの詳細。ベンチマークは公式発表値(条件・effort は注記参照)。Arena 欄はカード作成時のスナップショット。
Mistral の新フラッグシップ(愛称「Le Chonk」)。2026-10-06(日本時間夕方)に API パブリックプレビューで公開。オープンウェイトは2026年10月末に公開予定(VentureBeat によれば Mistral 独自ライセンス)。テキスト+画像入力、テキスト出力。
| DeepSWE v1.1 | 62% | Mistral 発表値(GLM-5.3 61%、DeepSeek V4 Pro 0813 57%、Qwen 3.8 Max 51%、Reflection Beam 44%) |
| Finch | 67% | Mistral 発表値 |
| Artificial Analysis Intelligence Index | 38 | GPT-6 Luna max(38)、DeepSeek V4.1 Flash max(39)と同等 |
| Artificial Analysis Cyber Index | 50 | |
| Vals Index | 48.05% | 44モデル中32位。最高は Harvey Legal Agent Benchmark で75モデル中6位 |
※ 欧州発オープンウェイトの上位だが、同等知能の中国系オープンモデルよりタスク単価4倍以上。10月末の重み公開後に第三者評価とLMArenaを再確認。LMArena は未掲載(不明)。
米 Reflection AI 初のオープンウェイトモデル(2026-10-05 米国時間に発表)。コーディング・エージェント用途に特化。現時点は waitlist による早期アクセスのみで、重み(Apache 2.0)・技術レポート・モデルカードは「10月中」に公開予定。売りは推論効率で、GLM-5.2 と同等の推論性能を 3〜4 分の 1 の推論計算量で出すと主張(自社推定)。
| SWE-bench Verified | 80.9 | Reflection 発表値 |
| Terminal Bench v2.1 | 80.1 | GLM 5.2 81.0 / Kimi K3 88.3 / DeepSeek V4.1 Flash 90.6(同表) |
| DeepSWE v1.1 | 44.4 | GLM 5.3 61.0 / Kimi K3 68.0 / DeepSeek V4.1 Flash 74.2(同表) |
| SWE Bench Pro v1 | 65.5 | GLM 5.2 62.1 / Qwen 3.8 Max 67.7 |
| GPQA Diamond | 90.5 | Kimi K3 93.5 / GLM 5.3 91.7 |
| HLE(ツールなし) | 36.2 | Kimi K3 46.9 / GLM 5.3 42.3 |
| AIME 2026 | 97.8 | |
| MCP Atlas | 78.7 | Qwen 3.8 Max 84.5 / GLM 5.3 84.2 |
※ 絶対性能では Kimi K3・GLM 5.3・DeepSeek V4.1 Flash に全項目で及ばない(Reflection 自身の表)。強みは「アクティブ 23B でこの水準」という推論コスト効率と、米国発・Apache 2.0 という点。数値はすべて自己申告で第三者検証前。重み公開(10月中)後に再確認。
独 Aleph Alpha の英語・ドイツ語特化オープンウェイト推論モデル(2026-10-03 公開、Apache 2.0)。アクティブ 3.46B と非常に小さく、推論コストを抑えつつ同クラス(3〜4B アクティブ)の MoE より高いスコアを出す。reasoning effort(none / low / medium / high)とツール呼び出しに対応。
| Overall(EN) | 75.5 | Aleph Alpha 集計。Qwen3.5 35B-A3B 74.7 / GPT-OSS 120B 72.3 / Qwen3.8 27B(dense)80.2 |
| GPQA Diamond(EN) | 84.3 | reasoning effort high |
| AIME 2026(EN) | 96.0 | |
| LiveCodeBench v6 | 85.9 | GPT-OSS 120B 87.5 |
| SWE-Bench Verified | 66.4 | Qwen3.6 35B-A3B 73.8 / Qwen3.8 27B 72.6 |
| TerminalBench 2.1 | 27.7 | エージェント系は弱め(Qwen3.5 35B-A3B 39.7) |
| Humanity's Last Exam(EN) | 21.5 |
※ フロンティア級ではなく「小さなアクティブ数で欧州主権・自社運用」を狙うモデル。日本語は対象外(独英のみ)なので、みねさんの用途では参考情報。ベンチマークは自社評価。Aleph Alpha は Cohere との統合で合意済み(規制承認待ち)。
Google の新フロンティアモデル。まず信頼できるサイバー防御者(Fairwind Program)向けに限定提供し、段階的に API・Ultra へ拡大予定。出力上限を 64K → 1M トークンへ拡大。
| DeepSWE v1.1 | 77.9% | 公式発表で SOTA |
| AutomationBench | 51.3% | #1(公式発表) |
| LVBench | 91.7% | 長尺動画理解 SOTA |
| CWE-bench v1 | 68% | 首位タイ |
| Vals Index | 1位 | 数値は未記載 |
GPT-6 Sol の改良版。Astra の 1/5 の価格で、エージェント的コーディング・コンピュータ操作・専門業務で Astra に迫ると主張。API は gpt-6.1-sol。
| DeepSWE v1.1 | GPT-6 Astra と同等(GPT-6 Sol 比 +6.4pt) | 公式は相対値のみ |
| AutomationBench(medium) | Opus 5.5 比 +2.2pt | 公式は相対値のみ |
| OSWorld 2.0 offline(max) | Astra との差 2.1pt 以内 | 公式は相対値のみ |
| Terminal-Bench Science 0.1 | GPT-6 Sol の 2 倍超 | 公式は相対値のみ |
※ リリース日は GPT-6 Sol/Astra 記事の「Update on September 29, 2026」表記による。WebDev Arena では #4(Max)。
Claude 5.5 ファミリー第 2 弾。Sonnet 5 と同価格で 30% 以上高速、タスクあたりコスト最大 30% 減。Terminal-Bench 4.0 では Opus 5.5 を上回る。
| Terminal-Bench 4.0 | 70.6% | 公式(Sonnet 5 は 10.3%) |
| FrontierCode 1.1 Main | 52.1%(xhigh)/ 46.2%(max) | 公式 |
| CursorBench 4.0 | 55.5% | 公式 |
| GDPval-AA v2.1 | 1844 | 公式 |
| Humanity's Last Exam(ツールあり) | 64.5% | 公式 |
| OSWorld 2.1(partial) | 80.1% | 公式 |
GPT-6 世代の中位モデル。Astra と同様の手法で学習し、GPT-5.6 Sol から API 価格を 50% 値下げ。API は gpt-6-sol。
| DeepSWE v1.1(max) | 68.8% | 公式 |
| AutomationBench(xhigh) | 33.2% | 公式 |
| Agents' Last Exam(max) | 56.4% | 公式 |
| OSWorld 2.0 offline(xhigh) | 60.5% | 公式 |
GPT-6 世代の軽量・高速モデル。API は gpt-6-luna。Free / Go ユーザーもデスクトップアプリで利用可。
| DeepSWE v1.1(max) | 66.6% | 公式 |
Claude 5.5 ファミリー第 1 弾。多くの作業で Fable 5.1 並みとしつつ、Opus 5 比で実行コスト約 40% 減(単価 20% 減 + トークン効率)。
| Terminal-Bench 4.0(xhigh) | 66.4% | 公式 |
| FrontierCode v1.1 Main | 54.4% | 公式 |
| CursorBench 4.0 | 57.8% | 公式 |
| GDPval-AA v2.1 | 1846 | 公式 |
| Humanity's Last Exam(ツールあり) | 67.7% | 公式 |
| OSWorld 2.1(partial) | 81.8% | 公式 |
| AutomationBench | 40.0% | Zapier 実施、フォールバックなし |
コーディングと知識労働向けの Grok 最上位。Grok 4.6 と同価格・同速度で提供。Cursor / Grok Build / Grok API で利用可。
| CursorBench 4.0(xHigh) | 46.3% | 公式 |
| DeepSWE v1.1 | 71.0%(high effort) | 公式 |
| Terminal-Bench 4.0 | 37.6% | 公式 |
| EEBench | 64.0% | 公式 |
| AA Briefcase v1.1 | 1,657 | 公式 |
| HealthBench Professional | 56.7% | 公式 |
新アーキテクチャ系列の最小モデル(オープンウェイト、MIT)。ネイティブ画像理解。V4-Pro を置き換え、deepseek-v4-pro へのリクエストも V4.1-Flash に転送。
| 公式ベンチマーク | 不明 | 発表記事に数値記載なし(技術レポート未確認) |
OpenAI の最上位モデル。コンピュータ操作・ブラウズ・SWE・サイバー・科学・専門業務で SOTA を主張。API は gpt-6-astra。
| FrontierMath Tier 4 | 98% | 公式 |
| OSWorld 2.0(offline, partial) | 72.6% | 公式 |
| ARC-AGI-3 | 96% のレベルで人間の行動効率ベースラインを上回る | ARC Prize 側コメントとして掲載 |
| AutomationBench | 41.4% | Anthropic/OpenAI 両資料で一致 |
| ExploitBench | 100% | 安全策なしでの評価 |
| SRE-Bench | 88.0%(1 回)/ 99.2%(4 回) | 公式 |
Anthropic の最上位モデル。Mythos 5.1 は同一モデルを信頼アクセス向けに安全策を変えて提供。Fable 5 と同価格でキャッシュ読み取りが 1/4 に。
| Terminal-Bench 4.0 | 55.8%(Mythos 5.1: 60.9%) | 公式 |
| Terminal-Bench-Science 0.1 | 52.6% | 公式 |
| GDPval-AA v2 | 1853 | 公式 |
| OSWorld 2.0 | 77.9%(partial)/ 41.7%(strict) | 公式 |
| Humanity's Last Exam(ツールなし) | 60.9% | 公式 |
※ Arena の Agents(Best Overall)では 1 位(14.31%)。
初のオープンな 3T 級モデル(2.8T パラメータ)。ネイティブ視覚・1M コンテキスト。重みは 2026-07-27 までに公開と告知。
| DeepSWE v1.1 | 67.3 | 公式リーダーボード(mini-SWE-agent ハーネス) |
| その他 | 不明 | ブログ本文は図表中心で数値を未取得 |
※ 正確なリリース日は未確認(約2.5か月前)。直近2か月より少し前だが Arena 上位のオープンモデルとして掲載。
直近1週間の流れは「何でも汎用 LLM に生成させる」から、①判定だけを1回のフォワードパスで返す意思決定モデル、②エージェントのトレースを監視・診断する専用モデル、③エージェント用の検索可能な長期メモリ、という“汎用 LLM の周辺を安く速く固める専用部品”へ分化しつつあること。並行して、オープンウェイトは「総パラメータは巨大・アクティブは小さい」MoE で推論効率を競う段階に入り、モダリティ(テキスト・画像・動画・ロボット動作)を1モデルに畳み込む omni モデルも研究段階で出てきた。
更新: 2026-10-07 00:23 JST。性能・価格の数値は各社の自己申告(第三者検証前)を含みます。
例: Liquid AI d1(2026-10-05 正式発表・画像対応)、Superagent Security-One 27B(HF 公開 2026-09-25 頃、Apache 2.0)
文章を生成せず、状態(テキスト/画像)と型付きの質問(Yes/No・選択・スコア)を入力すると、各選択肢の確率を1回のフォワードパスで返すモデル。出力トークンが 0 なので速く安く、閾値で機械的に分岐できる。TypeSafe AI の Jev(System One Models)が先行し、d1 と Security-One が追随。
例: Laminar flow-1(2026-10-05 発表)
本番エージェントの実行トレース(LLM 呼び出し・ツール呼び出しのスパン)を読み、失敗や根本原因を構造化して報告する専用モデル。flow-1 は SFT + Laminar の Signals エージェントハーネス内での強化学習で訓練され、トレース検索・スパン取得などのツールを使って調査する。
例: Leviathan(2026-10-05 公開、Rust 製・Apache 2.0、crates.io: leviathan-index 0.1.0)
大量のレコード(JSONL / JSON / CSV・TSV / SQLite / DB の CLI エクスポート)を一度インデックス化し、エージェントの質問に「数件の順位付き・出典付きレコード(約 500 トークン)」だけを返す単一バイナリ。生データを何十万行もコンテキストに流し込む代わりに使う。
例: Reka Rho-1(2026-10-05 リサーチプレビュー、19B)
テキスト・画像・動画の理解と生成、さらにロボットの動作出力までを、1つのネットワーク・1つのコンテキスト(共有 KV キャッシュ)で扱うモデル。中心モデルが専門モデルに仕事を投げる“エージェント・パイプライン”の継ぎ目(遅延・文脈の欠落)をなくすのが狙い。
例: Mistral Large 4(1.05T / 49B アクティブ、10/6)、Reflection Beam(501B / 23B、10/5)、Aleph Alpha Kolibri-1(78B / 3.46B、10/3)
中国勢(Kimi K3・GLM 5.x・DeepSeek V4.x・Qwen 3.8)が先行するオープンウェイト領域に、米欧のラボが「総パラメータは大きく、トークンあたりのアクティブは小さい」細粒度 MoE で参入。競争軸は絶対性能より“アクティブパラメータあたりの性能=推論コスト効率”とライセンス(Apache 2.0 / 主権 AI)。
🔗 = みねさんのリポジトリでの利用状況(GitHub 依存解析より)。⚡ = 効率化ポイント。
rmcp は 3.x 系で高頻度リリース(8/17〜10/5 で 7 リリース)。3.4.0 で ServerConfig/ClientConfig とライフサイクルベースのキャンセル、3.5.0 でプロトコル最新版定数更新や Origin 検証の改善。
🔗 agent-transcript は rmcp 3(server, transport-io)、docsrs-mcp は rmcp 0.1.5 のまま — 大幅に古い。
※ 3.4.0 / 3.5.0 の内容は GitHub Releases のミラー(newreleases.io)経由で確認。
tokio 1.53 系。1.53.0(07-17)で File 変換トレイト・タスクのスケジュール遅延メトリクス等を追加、1.53.2(10-03)は mpsc/timer/JoinSet 等のロック周り修正中心のパッチ。
🔗 8 リポジトリで使用(vrchat_osc, agent-transcript 等)。
Rust 1.99.0 リリース。C-ABI の可変長引数関数を Rust 側で定義できるようになった(extern "C" variadics)。1.98.0(2026-08-20)では文字列/スライスの範囲取得や整数フォーマット系 API が安定化。
🔗 agent-transcript は rust-version 1.96 指定。edition 2024 利用 4 リポジトリ(topcoat-native-poc, LocalVPM, rust_ascension, docsrs-mcp)。Tauri 2.12 も edition 2024 へ移行済み。
※ 今回の2リリースでは edition 関連の変更はなし(edition 2024 は既に安定版)。
Tauri 2.12 と同時期(09-26)に主要プラグインがマイナー更新。3.0.0-alpha.2 系も並行公開。個別の変更内容は今回未確認(不明)。
🔗 opener 4 / log 3 / dialog 3 / window-state 2 / single-instance 2 リポジトリで使用。
Tauri 2.12(09-26)は「2.x 最大のアップデート」。Windows 7 サポート終了と MSRV 1.90 への引き上げ、アプリ終了 API・ディレクトリ上書き設定など多数の新機能。並行して Tauri 3.0.0-alpha(alpha.4 が 10-01)も始動。
🔗 Tauri v2 は LocalVPM(tauri 2.8 指定), TauriTemplate, vrchat-profile-selector, VRCYawnTime で使用。VRCYawnTime は windows 0.61 を直接依存しており、Tauri 2.12 の windows 0.62 と重複する可能性あり。
※ Tauri 3.0 alpha の詳細な変更点(公式ブログ)は今回未確認。
thiserror 2.0.21:display 式内のジェネリックなユニットバリアントのパース修正。2.0.19〜2.0.21 と小刻みにパッチ。
🔗 8 リポジトリで使用(v2 は 5 件、v1 が sppade_test / docsrs-mcp / vrchat-profile-selector に残存)。
ureq 3.4 系。3.4.0(08-08)で HTTPS CONNECT プロキシ経由の TLS 確立など、3.4.1/3.4.2 でタイムアウト予算や接続プールの不具合修正、`read_json` 高速化。
🔗 agent-transcript(ureq 3)で使用。
reqwest 0.13.5:`Error::is_dns()`、HTTP/1 最大ヘッダ数設定、TlsInfo に TLS バージョン追加。複数プロキシ時の認証情報取り違えを修正。
🔗 docsrs-mcp で使用。
serde_json 1.0.151:`RawValue::from_string_unchecked` を追加。
🔗 10 リポジトリで使用。
serde 1.0.229:derive の依存を syn 3 へ更新。直近2か月の新リリースはなし。
🔗 11 リポジトリで使用(最多)。
axum は 0.8.9(2026-04-14)が最新。直近2か月の新リリースなし。
🔗 vrchat_osc(axum 0.8)で使用。
rosc は 0.11.4(2025-03-23)以降リリースなし。
🔗 vrchat_osc / VRCYawnTime で使用。
Vite 8.3 系。8.3.0(09-10)で root tsconfig 対応・インライン CSS 最小化・devtools 連携など。Vite 8 は Rolldown バンドル(8.0.12 が stable rolldown 1.0 を同梱した最初の版)。
🔗 8 リポジトリで使用(Vite 5〜7)。10-06 の 7.3.7 / 6.4.4 は既存プロジェクト向けのバックポート。
Svelte 5.57.2(2026-10-06 23:20 JST 公開)はパッチのみ・23 件の修正。中心はトップレベル await(async モード)とハイドレーション周りの不具合修正、`sv migrate` のハング修正。新機能・破壊的変更はなし。5.57.0 の機能(createContext の has、SvelteMap.getOrInsert 等)はそのまま。
🔗 Svelte 5: TauriTemplate, vrchat-profile-selector, VRCYawnTime, kakioki admin-ui。
※ パッチリリースのため既存プロジェクトはそのまま更新可。SvelteKit 3 の要求(5.57.1 以上)も満たす。
SvelteKit 3.0(10-01)リリース。設定が svelte.config.js から vite.config.ts へ移動、`$lib` → `#lib`、環境変数の新方式など。`npx sv migrate sveltekit-3` で大半を自動移行。
🔗 SvelteKit 2 を TauriTemplate / VRCYawnTime / kakioki admin-ui(adapter-cloudflare)で使用。TauriTemplate 系は adapter-static。移行には Vite 8 / TS 6 への同時更新が必要。
※ Remote functions はまだ experimental(Async Svelte が必要)。
Hono 4.13(08-03)で HTTP QUERY メソッド対応と methodNotAllowed ミドルウェア。以後 4.13.13 までほぼ週次でパッチ。
🔗 kakioki-server(Cloudflare Workers)で使用。
pnpm 12(08-26)は Rust による書き換え版の安定リリース。コマンド・設定・lockfile 形式は 11 と互換。現在 npm の latest タグは 12.9.1、11 系も 11.28.x で並行保守。
🔗 LocalVPM は packageManager: pnpm@11.9.0、discord-ticket-bot は pnpm@9.15.9。2026 年の新規 JS は pnpm 回帰傾向 → pnpm も Rust 化した点は Bun と並ぶトピック。
daisyUI 5.7 系でほぼ毎週パッチ(9月だけで 12 リリース)。5.7.47 は btn-disabled 時の btn-link 色修正。5.7.5 では Tailwind 4.3.3 の CSS レイヤー入れ子問題を修正。
🔗 5 リポジトリで使用。Tailwind 4.3.3 と組み合わせるなら 5.7.5 以上推奨。
Vitest 5.0(09-03)リリース。VM プール・Browser Mode・大規模 isolated スイートの性能改善が中心。`vi.when`、Trace View、`vitest doctor` など。
🔗 Vitest 3 を LocalVPM / booth-quick-preview で使用(4 を飛ばして 5 へ上げる場合は移行ガイド必読)。Bun 1.4 でも vitest が動作するようになった。
Prettier 3.9 系のパッチ(3.9.7〜3.9.9 が 9 月)。3.9.0 は 2026-06-27。個別の変更内容は今回未確認。
🔗 8 リポジトリで使用。
Zod 4.6(09-09):高速な真偽判定 `.validate()`、`z.iban()`、`z.withParser()` など。CommonJS 性能改善と再帰スキーマのメモリ保持修正。
🔗 kakioki-server は zod 3 — 4 系への移行が前提。
React 19.3.0:View Transitions と Fragment Refs を安定化。`use` と browser、Trusted Types 対応、Server Component の Context レンダリングなど。
🔗 React 19: LocalVPM, booth-quick-preview。
Bun 1.4.0(08-20)は Zig→Rust 書き換え後の初リリース。Node.js 互換テスト +1,517、アイドル CPU 1/5、メモリ最大 35% 減、Linux 起動 2 倍速。1.4.1(09-04)でもアイドル時メモリ削減や bundler の大幅改善。
🔗 Bun を 10 リポジトリで使用(TauriTemplate は bunfig.toml あり → 1.4 の TOML 厳格化に注意。kakioki-server は `bun test`)。
※ Zig→Rust 書き換えは PR #30412(2026-05-14 マージ)。経緯の詳細は公式ブログ「Rewriting Bun in Rust」参照。
svelte-check 4.7.6(08-13)が最新。以降の更新なし。TypeScript 7 は安定 API が 7.1 待ちのため、svelte-check の TS 7 対応は未確認(不明)。
🔗 5 リポジトリで使用。
Tailwind CSS 4.3 系が最新(4.3.0: 2026-05-08、4.3.3: 07-16)。直近2か月の新リリースはなし。4.3 でスクロールバー用ユーティリティ等を追加。
🔗 v4: TauriTemplate, vrchat-profile-selector, VRCYawnTime, kakioki admin-ui, ArcLikeExtension。
discord.js 14.27.0(07-15):ボイスメッセージ送信、ロールのメンバー数取得、コレクティブル等。以降の新リリースなし。
🔗 discord-ticket-bot, ShuffleTalk で使用。
TypeScript 7.0(Go によるネイティブ移植版、通称 Project Corsa)が GA。型チェックの挙動は TS 6 を維持しつつフルビルドが概ね 8〜12 倍高速に。ただし安定したプログラマブル API は 7.1 待ちで、Svelte 等の API 依存ツールはまだ移行できない。
🔗 12 リポジトリで使用(多くは 5.7〜5.9)。svelte-check を使う Svelte 系 5 リポジトリは TS 7 の API 待ちに注意。SvelteKit 3 は TS 6 以上必須。
※ TypeScript 7.1(安定 API: Content Mapper / Emit / Language Service API、`es2026` target、Union 型の高速化など)は未リリース。Beta が数日遅延中。Stable 予定は 2026-11-24(Beta 遅延により後ろ倒しの可能性)。リリースされ次第トップで特集。
D1 が 2026-09-01 から Free プランの日次行読み書き上限を強制(超過時は UTC 0 時までエラー)。Workers では PR ごとの隔離プレビュー(Worker Previews)や Cache の invalidate() が追加。wrangler はほぼ毎日リリース。
🔗 kakioki-server(Workers + D1 + R2、wrangler 4)。Free プランなら D1 上限の強制に注意。agent-transcript は R2 を利用。
※ wrangler 4.135.0 の正確な日付は未確認。
VRChat SDK 3.10.5(09-04):多数の修正とワークフロー改善、Toon Standard の AudioLink 対応、Udon から Realtime Reflection Probe / Shadowmask Mode へアクセス。3.10.4(06-17)は VRCTween・箱型 Contacts・グローバル PhysBone コライダー。
🔗 vpm-repos(com.vrchat.base >=3.4.0 依存の Editor 拡張)。
Go 1.27(08-19)でジェネリックメソッドが解禁。encoding/json が v2 実装ベースになり Unmarshal 高速化、uuid パッケージ追加など。1.27.1 は 09-01。
🔗 discord-auto-translator は go 1.24 指定。`go test -race` の CI あり。
VCC 2.5.0-beta.2(06-25, プレリリース)。リポジトリキャッシュ刷新で多数リポジトリ利用時に高速化、VPM CLI が Unity 不要になり非 Windows でも利用可、`list packages` 等の新コマンド。
🔗 vpm-repos / basis-vpm の配布リスティングで `changelogUrl` を付けると VCC 上に Changelog ボタンが出る。CI で VPM CLI を使う余地あり。
※ 直近2か月の新リリースではないが、VPM 運用に直結するため掲載。
discordgo は v0.29.0(2025-05-24)以降タグ付きリリースなし。
🔗 discord-auto-translator(v0.29)で使用 — 最新版を使用中。