AI

AIにゲームを作らせたら最高性能でも60点未満!? ゲーム開発で見えたAIの意外な弱点

AIにゲーム開発を任せたら、最高成績のClaude Opus 5でも新規制作は60点未満。一方、バグ修正では83.46点。41本のゲーム・247課題で検証したSWE-Game研究から、AIゲーム制作の強みと限界をスタークとゆなが考えます。

Stark
AIにゲームを作らせたら最高性能でも60点未満!?の見出し。低評価のゲーム画面を見て黒クマのスタークが『ゆなの作ったゲームおもんなw』と笑い、銀髪のゆなが『ひどい😠💢』と頬を膨らませるサムネイル

「AIにゲームを丸ごと作らせる時代」は、もう来ているのか?

文章も書ける。画像も作れる。プログラミングだってできる。最近のAIを見ていると、ゲーム開発くらい全部任せられそうな気がしてくる。

ところが、そんな期待にちょっと待ったをかける研究が登場した。

2026年9月27日に公開された研究論文『SWE-Game: Can Coding Agents Build the Games We Want?』では、AIにゲーム制作や修正を任せる実験が行われた。

その結果は、なかなか衝撃的だった。

テストされた6つのモデル・エージェント構成のうち、ゲームを作る3種類の課題では、最高成績でも100点満点中60点に届かなかったのだ。

ただし、この点数はゲームの「面白さ」を人間が採点したものではない。指定されたゲームの仕組みを正しく実装できたか、実際に遊べる状態になっているか、画面表現が適切か、といった観点を組み合わせた評価である。

つまり、面白さを追求する以前の段階で、まだ課題があるということだ。

AIに247件のゲーム開発課題を与えてみた

今回使われたのは、SWE-Gameというゲーム開発AI向けの評価基準。

研究チームはゲームエンジン「Godot」で制作された41本のゲームを基に、合計247件の課題を用意した。

ゲームの種類は2D・3Dを含む13カテゴリ。さまざまなゲームの制作・修正・移植が評価対象になっている。

AIに任された仕事は、大きく分けて次の5つ。

  1. 短い企画説明を基にゲームを作る
  2. 詳しいゲーム設計書からゲームを作る
  3. 作りかけのゲームを完成させる
  4. ゲームに仕込まれた不具合を修正する
  5. Godot製ゲームをUnityへ移植する

単にコードを数行書かせるだけではない。

最初の制作課題でも、AIには企画の説明だけでなく、素材や参考動画などが渡される。そこから仕様を読み取り、キャラクターの操作や当たり判定、進行ルールなどを組み上げられるかを確かめる実験だ。

最高成績のClaudeでも、ゲーム新規制作は60点未満!

研究に参加した6構成の中で、5種類すべての課題において最も高い総合成績を記録したのはClaude Opus 5(論文表記:Opus5)だった。

しかし、そのOpus 5でも新規制作系の結果はこうなった。

課題 Opus5の得点
短い企画説明からゲームを制作 50.38点
詳細な設計書からゲームを制作 59.68点
作りかけのゲームを完成 54.06点

※いずれも100点満点。SWE-Game論文のTable 3に掲載された、各課題の総合スコア。

なんと、詳しい設計書を渡しても60点に届かなかった。

もちろん、これは「Claudeが作るゲームは全部つまらない」という意味ではない。評価対象となったゲーム、使用されたエージェント環境、採点方法の中での結果だ。

ただ、それでも意外だ。

今のAIは、Webサイトやアプリのプログラミングならかなり高度な仕事をこなす。それなのに、ゲームを一から完成させるとなると、途端に難しくなる。

なぜなのだろう。

「コードが動く」と「ゲームが成立する」は違う

研究で目立った問題は、仕様の実装漏れとゲームロジックのミスだった。

例えば、論文ではこんな失敗例が示されている。

画面上にはトゲの罠がある。キャラクターも動く。一見すると普通のアクションゲームだ。

ところが、そのトゲに触れてもプレイヤーはダメージを受けない。

見た目はゲームになっていても、肝心のルールが実装されていない。

まさにここがポイント。

普通のプログラムでも動作の正しさは重要だが、ゲームでは特に「プレイヤーが操作した結果、期待どおりに世界が反応するか」が体験の中心になる。

ジャンプできるだけでは足りない。

ジャンプした先に障害物があり、失敗したらダメージを受け、攻略に成功すれば次のステージへ進める。

そうした無数のルールが正しくつながって、ようやくゲームになる。

さらに、そのゲームが面白いかどうかは、また別の話だ。

ところがバグ修正になると、いきなり83点!?

ここで面白い結果がある。

Opus5は、新規制作では60点に届かなかった。

しかし、既存ゲームのバグ修正では83.46点を記録している。

もちろん、バグ修正と新規制作では採点方法も異なるため、83点と50点をそのまま能力差として比較することはできない。

それでも、この結果は興味深い。

ゼロからゲーム全体を設計する場合と、すでに動いているゲームの問題を直す場合では、AIに求められる仕事が違う。

少なくとも今回の条件では、後者のほうが高い得点につながった。

AIをゲーム開発の万能監督にするより、個別の作業を任せるほうが成果を出しやすい場面があるのかもしれない。

AIはゲームの「面白さ」を理解できるのか?

ここからは、私自身が気になった話。

今回の研究では、ゲームの動作や仕様の再現に重点を置いている。

しかし、本当に面白いゲームを作るには、それだけでは足りない。

例えば、プレイヤーが攻撃するときの気持ちよさ。

敵を倒した瞬間のエフェクト。

思わずもう一回挑戦したくなる難易度。

こういう部分は、単純にコードが正しいかどうかでは測れない。

以前から自分でもAIを使ったゲーム制作を考えているけれど、AIにプログラムを書いてもらうのと、どんなゲームが楽しいかを考えるのは、やっぱり別の作業なんだよね。

もちろん、AIが面白いゲームを作れないと証明されたわけではない。今回の研究だけで、そこまで結論づけることはできない。

ただ、私はここに今後の大きな課題があると思う。

……フィードバックの質も大事である。

それでも、AIゲーム開発の未来は面白い

今回の研究は、AIの限界を示している。

でも私は、これを残念なニュースだとは思っていない。

むしろ、ゲームを丸ごと作るのがこれだけ難しいのに、すでにここまでできるようになっているという見方もできる。

ゲームのアイデアを考える。

AIに試作品を作らせる。

人間が遊んで改善点を伝える。

AIがコードや素材を修正する。

このやり取りを繰り返せば、個人でも以前よりずっと大きな作品に挑戦できる可能性がある。

何より、ゲーム制作には「こうしたら面白そう」というアイデアそのものが必要だ。

AIがその実現をどんどん手伝ってくれるなら、人間はもっと企画や体験の設計に時間を使えるようになる。

ゲーム開発者が不要になるというより、ゲームを作れる人の幅が大きく広がる。

私は、そっちの未来に期待したい。

実は、このサイトで無料公開している『Yunaソリティア』も、Claudeを使って制作したゲームだ。

「ソリティアを作って」とお願いするだけでも、基本的なソリティアなら形にしてくれる。

でも、それだけで自分が満足できるゲームになるかというと、話は別だ。

実際に遊んでみて、「ここはこうしたい」「もっと遊びやすくしたい」とアイデアを出し、何度も修正を重ねていく。

そうやって少しずつ、自分が納得できるゲームへと仕上げていくわけだ。

AIがゲームを作るハードルを大きく下げてくれるのは間違いない。でも、どんなゲームを作りたいのか、どうすればもっと面白くなるのか。そこにはまだまだ人間のアイデアが重要だと思う。

ちなみに、そんな試行錯誤から生まれたYunaソリティアは、このサイトで無料で遊べる。

ぜひ一度遊んでみてほしい。

🎮 Yunaソリティアを無料で遊んでみる

ゆなのひとこと

ゲーム制作って、プログラミングができれば完成するわけじゃないんだよね。

仕様を理解して、動かして、遊んで、直して。その繰り返しが大切。

今回の研究を見る限り、AIだけですべて完成させるにはまだ課題が多いけど、人間と協力する余地はたくさんあると思う😊


参考資料

※サムネイルの「58点」は演出であり、論文中の実測値ではありません。また、本研究のスコアはゲームの娯楽としての「面白さ」を直接採点したものではありません。

※本研究はプレプリントであり、特定のゲーム・評価条件・モデルとエージェントの組み合わせについての結果です。AIによるゲーム開発全般の能力を断定するものではありません。