LINELINEで新着マガジン通知を受け取る
▶ 動画でも見る(YouTube)
AIモデル比較

【徹底検証】Fable 5とOpus 4.8に同じ課題を与えて費用と出来を比べてみた

「最上位の Fable 5 と、既定の Opus 4.8。結局どっちを使えばいいの?」——ベンチマークの数字を眺めても、自分の仕事で倍の料金を払う価値があるかは分かりません。そこで、まったく同じお題『マリオカート風の3Dゲームを作って』を同条件で両モデルに投げ、進め方・かかった時間とお金・出来た見た目まで、一部始終を並べて実測しました。

📑 目次
  1. Fable5 vs Opus4.8
  2. 検証の前提条件
  3. 参考:指示は簡潔に
  4. 検証の前提条件
  5. 検証の前提条件
  6. 実演
  7. Claudeに聞かれた内容
  8. 進め方の違い
  9. 結果
  10. Opusの出力
  11. Fableの出力
  12. 数字の違い
  13. 費用の違い
  14. Opusのcourt バグ
  15. Opusのcourt バグ
  16. 費用の違い(バグ考慮)
  17. サブスク内での利用%
  18. 表での比較
  19. 実際にFableはよくなったのか?
  20. まとめ
  21. まとめ

Fable5 vs Opus4.8

Fable5 vs Opus4.8(動画で実際に使った画面)
こまりさんこまりさん
オート博士。Claude Codeに、Fable 5っていう最新のモデルが出たんですよね。
オート博士オート博士
はい、今いちばん賢いモデルです。現時点では、サブスクの範囲内で使えますが、これは期間限定でして、7月8日以降は、別料金になるんです
こまりさんこまりさん
え、そうなんですか?じゃあ、なかなか使えないですね。。
オート博士オート博士
そこなんです。なかなか使えないですし、カタログのベンチマークを眺めても、結局どのくらい賢くなっているのかわからない。
オート博士オート博士
だから今日は、FableとOpusそれぞれに同じ指示を出して、進め方から出来上がりまで、一部始終を並べてお見せしたいと思います。
こまりさんこまりさん
同じお題で、そんなに違うんですか?
オート博士オート博士
それが、びっくりするくらい違ったんです。時間もお金も、作り方もすべて

検証の前提条件

検証の前提条件(動画で実際に使った画面)
オート博士オート博士
では、始めます。今回は参考にマリオカートを作ってみましょう。
オート博士オート博士
前提条件ですが、各モデルにまったく同じプロンプトと、同じ参考画像を同時に投げました。
オート博士オート博士
スクリプトは「添付画像のような、マリオカート8デラックス風の3Dレースゲームをブラウザで動く形で作ってください。わからないことがあれば、聞いて」です。

参考:指示は簡潔に

参考:指示は簡潔に(動画で実際に使った画面)
オート博士オート博士
Fable 5はドキュメントにもあるのですが、複雑な指示より簡潔に伝えるほうが良いということでしたので、シンプルにしました。ただ、opusのほうがいろいろ聞きたいことがあるかもしれないので、「わからないことがあればきいて」というのを入れています。

検証の前提条件

検証の前提条件(動画で実際に使った画面)
オート博士オート博士
そして、参考ゲームの画面を2枚渡しています。これをベースにUIを考えてもらうことにします。

検証の前提条件

検証の前提条件(動画で実際に使った画面)
オート博士オート博士
また、モデルのエフォートレベルはどちらもextra-highです。これもFableのドキュメントに、だいたいはextra-highで足りるということでしたので、MAXは選びませんでした。

実演

実演(動画で実際に使った画面)
オート博士オート博士
以上をベースに同時に別々でプロジェクトフォルダを用意して、同じ指示を出して始めました。
オート博士オート博士
左側がFable、右側がopusです。まずは先ほどのプロンプトを入力します。
オート博士オート博士
すると、それぞれ私に質問をしてくれました。

Claudeに聞かれた内容

Claudeに聞かれた内容(動画で実際に使った画面)
オート博士オート博士
質問された内容についてですが、Fableは今回の実装のスコープや機能に関すること、Opusはそれに加え、素材の調達の深掘りという違いが出ました。
オート博士オート博士
最初の質問の回数ですが、どちらも5回で、差は出なかったですね。

進め方の違い

進め方の違い(動画で実際に使った画面)
オート博士オート博士
次に進め方ですが、Opusの場合は、質問への回答をまとめた内容の承認で一度、その後計画書を作成して一度、最後にUIを作成した後の承認に1度の3回承認依頼を飛ばしてきました。先にUIから作成、その後バックエンド、という進め方です
オート博士オート博士
逆にFableのほうは、承認依頼は一度で、その後は終わるまでに一度もこちらへの承認依頼はなかったですね。Claudeのドキュメントにも書いていましたが、自分で進めていく力というのは、確かに強くなっているのかもしれませんね。
こまりさんこまりさん
え、こんなに違うんですか。でも、どっちが、正解なんですか?
オート博士オート博士
どっちも、正解なんです。モデルの性格が出たのかと思います。
オート博士オート博士
これ以外にも、Fableを使っているのですが、FableはOpusに比べてあまりこちらにいろいろと聞かずに、どんどん進めていく、という感じでした。
こまりさんこまりさん
なるほど!

結果

結果(動画で実際に使った画面)
オート博士オート博士
さて、結果です。まず、両方とも、ちゃんと完成しました。あのあとは、どちらも自律して進めていました。
オート博士オート博士
スタート画面、終了画面、コースを1周走れて、アイテムも使えて、順位とラップも出る。合格ライン、両方ともクリアです。

Opusの出力

Opusの出力(動画で実際に使った画面)
オート博士オート博士
まずOpusですが、こんな感じですね。まあまあいいんじゃないでしょうか。
こまりさんこまりさん
ちゃんとできてはいますね
オート博士オート博士
Opusのほうは、既存の3Dアセットを使っていいか聞いてきたので、もっとリッチな感じになるのかなと思っていたのですが、そうでもないですね。
オート博士オート博士
あと、音がついて無かったのと、操作がっ少し難しかったという感じです。

Fableの出力

Fableの出力(動画で実際に使った画面)
オート博士オート博士
次にFableがこちらです。こんな感じですね。こちらもまあまあいいんじゃないでしょうか。
こまりさんこまりさん
こちらのほうが、UIがちょっといいですね。
オート博士オート博士
そうですね。まあ、今回一度しかやっていないのでわかりませんが、性能の違いかもしれませんね。
オート博士オート博士
使われている3Dモデルはこっちのほうがしっかりしているようにも見えますね。

数字の違い

数字の違い(動画で実際に使った画面)
オート博士オート博士
どれだけ違うか、数字でも見てみましょう。今回は、各セッションを右側のパネルのように監視しておいて、グラフで表示していました。トークン数や、費用などを見ています。

費用の違い

費用の違い(動画で実際に使った画面)
オート博士オート博士
さあ、見てみましょう。まずは金額です。緑の線がFableですが、やはり、Fableのほうが常に高いですね。最終的にはOpusのほうが11.76ドル高くなってしまいました。

Opusのcourt バグ

Opusのcourt バグ(動画で実際に使った画面)
オート博士オート博士
これは、途中でcourtバグという既知のバグが起きてしまったからです。20分くらいこのエラーがおきてしまっていました。

Opusのcourt バグ

Opusのcourt バグ(動画で実際に使った画面)
オート博士オート博士
このグラフは、各作業でどのくらいの費用が掛かっているかを見ているグラフですが、1時間19分以降の赤く飛び出て長い部分。ここでバグにより時間とトークンを無駄にしてしまいました。
こまりさんこまりさん
そうだったんですね。

費用の違い(バグ考慮)

費用の違い(バグ考慮)(動画で実際に使った画面)
オート博士オート博士
ということで、こちらがそのバグでかかってしまった費用を除いたバージョンになります。
オート博士オート博士
ただこれでも、結局opusのほうが高くついてしまいましたね。おそらくですが、セッションをまたいでしまったため、その分トークンを消費してしまったのだと思います。

サブスク内での利用%

サブスク内での利用%(動画で実際に使った画面)
オート博士オート博士
また、私のサブスクプランでの利用割合も見てみましょう。わたしはMAX20プランに入っています。週の枠をどれだけ使ったかで見ると、Opusが3パーセントと、fableが4パーセント。現在Fableは購入しているサブスクの50%分が別枠で使えるということですが、今の環境だと、週間制限の中で同じくらい使ったという結果になりました。
オート博士オート博士
マリオカートを1本作っても、思ったよりも変わらなかったですね。

表での比較

表での比較(動画で実際に使った画面)
オート博士オート博士
テーブルでも見てみましょう。Fable 5は、実装前の承認依頼を一度した後はノンストップで実施した一方で、Opusのほうで、承認依頼を3回していました。また、実装にかかった時間も、Fableは62分で、Opusは、90分です。サブスク内での利用としてはどちらも同じくらいでした。
こまりさんこまりさん
え、待ってください。消費した割合はほとんど同じで、時間も早かったってことですか?
オート博士オート博士
今回の場合はそうだったといえますね。ただ、Opusのほうはバグがあったり、実装の仕方も違ったりしたので、公平な方法では結果は変わっていたと思います

実際にFableはよくなったのか?

実際にFableはよくなったのか?(動画で実際に使った画面)
オート博士オート博士
また、Fableでよくなったといわれる部分についても比べてみました。
オート博士オート博士
1つ目、コーディング力。Fableは、3千行以上を、一発で書き上げた。Opusは、色の調整を3回やり直し、ロジックの書き直し、壁にぶつかるバグなど11回修正を繰り返していました。
オート博士オート博士
2つ目、自律性。Fableは、最初の9分だけ質問して、あとは62分、相談ゼロで完走。Opusは、途中で何度も確認しながら。これも、評判どおりです。
こまりさんこまりさん
なるほど!
オート博士オート博士
しかし、今回は、たった1回の検証。だから、傾向は合っていた、という暗いでしょうか。

まとめ

まとめ(動画で実際に使った画面)
オート博士オート博士
以上が今回の検証結果となります。
こまりさんこまりさん
だいぶ、わかってきました!
オート博士オート博士
よかったです。ただ、今回おきたバグはどちらのモデルでも起こる可能性がありました。また、Fableは8日以降は別途料金がかかってしまうため、私もOpusを使うつもりです

まとめ

まとめ(動画で実際に使った画面)
オート博士オート博士
お金が許すのであればFableを使いたいというのが、今回使った感想です。
オート博士オート博士
特に、自律性、という部分ではOpusとは結構違うなと感じており、寝る前やお風呂、ご飯の前に重めのタスクをFableに依頼しておけば、こちらに何も聞かずに良しなにやってくれる、というのも結構ありました。
オート博士オート博士
逆に通常使いだと、Fableのタスクが終わるのが結構長く感じることもあり、その場合はエフォートレベルを下げたり、Opusに切り替えたり、という使い方をしています。
オート博士オート博士
今後、またサブスク内で使える、ということになれば、どんどん私も使っていきたいと思います。
オート博士
【こまり】のAI駆け込み寺

事業者のための「AIで困りごとを解決する」実演マガジン。オート博士(専門家)×こまりさん(事業者)の対話で、AI活用の全工程を実写ゼロで公開しています。