特集

爆増するトークン消費と従量制へのシフトが進む中で、企業に求められる「AI FinOps」とは

Google Cloud APAC ハルシャ・コンドリ氏インタビュー

 これまではAIというと、大規模AIモデルの学習など、どちらかというと学習の方に焦点が当たってきた。しかし、すでにフロンティアAIモデルがほぼ完成の域に近づきつつあり業界の注目も、推論と呼ばれるそのAIモデルを利用した活用事例に移りつつある。

 そうした中で、トークノミクス(Tokenomics)という言葉が、ITのカンファレンスで盛んに使われるようになっている。日本語にすると「トークン経済」という意味合いだが、現在では、AI推論時の内部処理の単位であるトークンの消費量が“爆増”しており、今後エンタープライズのITコストの増大を招くと懸念されている。

 実際、MicrosoftやGoogleなどのエンタープライズ向けのSaaSは、従来は1ユーザーあたりの月額ないしは年額の固定課金で提供されてきたが、フロンティアモデルと呼ばれる最先端のAIモデルを利用したサービスでは、従量制課金へと移行しつつある。

 このため、バイブコーディング(Vibe coding)のようにトークンを大量消費するAIエージェントを利用した時には、これまででは考えられないぐらいの課金がされる事例が出ており、IT管理者の頭を悩ませつつある。

 Google Cloud APAC AI 市場開発 マネージングダイレクター ハルシャ・コンドリ氏は「エンタープライズのIT管理者にとって重要なことは、ROIやコストを正確に測定できるようにすることだ。コストがどこから発生しているのかを正確に理解するために、それを測定できる能力を持つことが非常に重要だ」と述べ、エンタープライズ自身がAIのコストを正確に把握し、正しく評価することがそれに対処する方法だと指摘した。

Google Cloud APAC AI 市場開発 マネージングダイレクター ハルシャ・コンドリ氏

トークン爆増の主因はバイブコーディング、今後はホワイトカラー全般へ拡大か

 現在のエンタープライズ企業においては、トークンの利用量が爆発的に増加している。AMDが今年7月に開催したAIイベント「Advancing AI 2026」の中で、同社 CEOのリサ・スー氏は「過去2年で月間のトークン利用量は158倍になっている」と述べた。

Advancing AI 2026でAMD CEO リサ・スー氏が示したスライド。過去2年間で月間のトークン利用量が158倍に

 Google Cloud APAC AI 市場開発 マネージングダイレクターのハルシャ・コンドリ氏は「最先端モデルを利用したコーディングなどで、特にトークンのコストが増えている。従来のAIモデルは、人間の意図を理解して有益なコードを書くことは難しかった。しかし生成AI以降に登場した最先端のモデルでは、それができるようになった。そのため、トークン数の増加と同時にコストが増大している。トークン消費量が増えているのは、人間の効率が増大しているからで、普及が進んでいるからだ」と述べ、トークンの使用量やコストの増大は、特にソフトウェア開発者が利用している、いわゆるフロンティアAIモデルなどと呼ばれる最先端のAIモデルにおいて起きていると説明した。

 現在、ソフトウェア開発の現場ではバイブコーディングと呼ばれる、ソフトウェアのコード生成をAIエージェントに任せるという開発手法が一般的になっている。人間が仕様書(どのようなソフトウェアで、どのような機能を持ち、どのOSで動くかなど)を書き、それをAIエージェントにわたすと、AIエージェントが日夜稼働し、ソフトウェアのコードを生成し続け、環境を用意すれば実機上でのデバッグまで行うことができる。この間、AIエージェントが活用しているフロンティアAIモデルは動き続け、大量のトークンを消費することになる。これが、現在のトークン使用量が爆発的に増加している背景だ。

 現在は、ほとんどがソフトウェア開発者のバイブコーディングに活用されているような状況だが、今後はそうしたフロンティアAIモデルの利活用がホワイトカラーのビジネスパーソンに広がっていく可能性がある。

 すでにホワイトカラーのビジネスパーソンにおいても、最近の流行語で言えば「ハーネス」(Harness、手綱の意)と呼ばれる、OpenClawやNemoClawといったエージェント型AIを利用するユーザーが増えている。今後、ホワイトカラーの業務においてもそうしたエージェント型AIの普及が進めば、トークンの利用量はさらに増えていくことになる。

トークン増大で変わる課金体系――「定額制」から「従量制」へのシフト

 Google Cloudのコンドリ氏が言うとおり、ソフトウェアを開発する企業にとって有益だから利用が進み、さらにトークン数が増えているという構図だ。

 ただ、そのコストが企業の予想を上回るペースで増えているという側面も指摘されている。Dell Technologiesが今年の5月に開催したDell Technologies Worldにおいて、Dell Technologies COO ジェフ・クラーク氏は「現在、ソフトウェア開発者は10個のエージェントを回し続けており、そのコストは1日で3400ドル(1ドル157円換算で約53.3万円)にも達している事例がある」と紹介した。

 国税庁の令和6年分 民間給与実態統計調査によれば、日本の給与所得者(平たく言えば会社員)の平均年収は478万円であるので、月収に直すと39.8万円となり、1日で日本の会社員の月収を超えるコストが費やされている計算になる。

Dell Technologiesが紹介した、1日で3400ドル相当のトークンを利用するプログラマーの事例。クラウドではなくオンプレミスで演算すればランニングコストは0になるというのがDellの主張だ。

 なぜトークン数の増加がコストの増加になっているのかと言えば、シンプルにトークンが増えると、トークンを処理する演算コストが増えるからだ。トークンの処理はGPUを利用して演算されている。トークン数が増えれば増えるほど、GPUの数を増やす、つまりAIデータセンター(NVIDIA的な言い方をすればAIファクトリー)を増やしていく必要があるが、それには莫大な建設コストがかかり、同時にランニングコストもかかる。

 こうしたコストの増加に伴い、これまでシート制(米国ではUSL:User Subscription License)と呼ばれてきた、1ユーザーあたりの月額あるいは年額料金という固定料金制のサブスクリプションでサービスを提供してきたSaaSベンダーも軌道修正を強いられている。

 Microsoft 365などのSaaSはシート制の料金プランで提供されてきたが、フロンティアAIモデルを採用しているサービスに関しては、従量制課金(米国ではUBB:Usage-Based Billing)へと変更している。同社は9月25日に新しいCopilotを発表し、GitHub Copilotをベースにしたコーディング機能「Code」、さらに6月のBuildで発表していたハーネスとなる「Autopilot」は、いずれも従量制課金の料金体系となっている。

 Google Cloudも同様で、同社は「Gemini Enterprise」というエンタープライズ向けの総合サービスを提供している。Gemini Enterpriseでは従来の「Google Workspace」やAI機能に相当する「Gemini Enterprise app」などが統合的に提供されており、基本的なAI機能であるGemini Enterprise appは固定料金制だが、同時に「Pay-as-you-go」と呼ばれる従量制のプランも用意されている。固定料金と従量制課金の両方を提供することで、固定料金の限定されたリソースでは足りず、より大規模に利用したいエンタープライズや、まずは少ない料金で試してみたいと考える企業の両方に配慮した料金制になっている。

予測困難な従量制コスト:AI時代に再び問われる「クラウド対オンプレ」の選択

 従量制課金が主流になりそうなフロンティアAIモデルの利用だが、どこの会社にとっても頭が痛いのは、従量制課金ではROI(Return On Investment:投資利益率、投資に対してどれだけ効果があったかを数字にすること)の評価が難しいことだ。

 シート制の固定料金は従業員1人あたりいくらという非常に単純な料金であるため、社員に配布するPCのコストとあわせて計算がしやすく、ROIを算出するのも難儀ではなかっただろう。

 それに対して従量制の場合、話は単純ではない。例えば、前出のDell TechnologiesのクラークCOOが示した「1日にエージェント型AIのトークンコストが3400ドル」というプログラマーの事例で考えてみよう。単純計算すれば、1日3400ドル(約53万円)だから、1カ月が30日とすれば約1600万円となる。日本の会社員の平均月収が39.8万円だから、すごくザックリとした計算では約40人の人間を雇える計算になる。ただ、その月収で雇えるプログラマーがフロンティアAIモデルに匹敵する能力を持っているかは別問題で、高給取りのスタープログラマーを雇うことを考えれば、雇える人数はもっと減るだろう。

 また、Dell TechnologiesのクラークCOOは、この1日3400ドルのAIエージェントのコストという例を、クラウドではなくオンプレミスに置きかえると――という文脈の中で紹介した。1日3400ドル分のトークン処理を、NVIDIA DGX SparkのようなGPU内蔵のミニPCでは同じく1日で処理できるので、単純計算では、DGX Sparkの約4699ドルというコストを1.5日で回収できるということになる。

NVIDIA DGX Sparkのように、オンプレミスでAIエージェントを実行する環境にも注目が集まっている(写真はDell Pro Max with GB10)

 オンプレミス向けに機器を販売しているDellがそうした主張をするのは、驚くにはあたらない。だが、クラウドサービス事業者側の見方は異なる。Google Cloudのコンドリ氏は「現時点では、データ主権の要件がある場合を除き、最新モデルをオンプレミス環境に導入したいと考えるお客さまは、まだ多くない。ただ、ソブリン(データ主権)の問題があることは認識しており、その解決のためにGoogle CloudではGDCを提供している。また、Gemmaのようなオープンソースモデルも提供し、お客さまが希望する場所で実行できるようにしている」と述べ、トークンコストが上がっている現状でも、クラウドからオンプレミスにAI演算リソースを移すという動きはあまり多くはないと述べている。

 クラウドでは、ソフトウェアのソリューションも含めて1つのパッケージとして提供される。ソフトウェアの管理というのは思ったよりもコストや手間がかかるものであり、実はそのコストを入れるとオンプレミスのコストは決して安くないというのは、IT管理者にとっては常識だろう。その反面、言い古された話ではあるが、結局のところROIの観点でクラウドは、「少ない投資で始められるが、大規模に使うようになると費用対効果が悪化する」というのが特徴の1つだと言える。

 結局のところ、AI時代になってもクラウドかオンプレミスかという同じ議論が続いているということなのだろう。

コスト高騰を防ぐカギは「AI FinOps」――正確な測定とROIの可視化

 では、エンタープライズは、フロンティアAIモデルでのROI評価をどうしていくのが正解なのだろうか?

 Google Cloudのコンドリ氏は「企業がITを導入するのは、それによって業務を効率化し、経済価値を生み出すためだ。それはAIも同じで、業務を効率化するためのAIを導入してほしいと現場は考えている」と指摘する。その一方で「トークンコストの急増を心配しているITマネージャにとって重要なことは、ガバナンス、セキュリティ、コスト管理を備えたプラットフォームを選択することだ。我々Google Cloudが提供しているのはまさにこの3つで、コストと価値を正確に結びつけて、お客さまが最善のROIを得られるようにしていく」と述べた。

 また、「その中で、エンタープライズのIT管理者にとって重要なことは、ROIやコストを正確に測定できるようにすること。コストがどこから発生しているかを正確に理解するために、それを測定できる能力を持つことが非常に重要だ」と説明。これからのIT管理者にとっては、こうした把握が重要であり、Google Cloudのようなクラウドを一括して利用することで、このようなことが可能になると述べた。

 なお、そうしたAIのコストを正確に把握することは、「AI FinOps」あるいは「FinOps for AI」と呼ばれ、現在急速に注目が集まりつつあるジャンルになりつつある。FinOpsとは、もともとはクラウドのコストを正確に把握するためのツールとして注目を集めてきたが、AI FinOpsはそのAI版となる。例えばMicrosoftは、9月25日に開催したCopilotの新戦略に関する発表の中で、FinOps for AIの機能を拡大すると明らかにしている。それにより、MicrosoftのCopilotを利用している顧客が正確にコストを把握できるようにする狙いだ。

 Googleも以前から「Cloud FinOps」として提供してきたが、AIを利用した評価方法として「Gemini Cloud Assist」を提供している。また、そうしたFinOpsを自動で測定するAIエージェントとして「FinOps Explainability エージェント」の投入を4月のGoogle Cloud Nextで発表した。FinOps Explainability エージェントでは、AIへの支出を把握し、その要因や傾向などをAIエージェントが調べてIT管理者に報告してくれる。また、同時に発表されたSpend Capsでは、プロジェクトごとに利用の上限予算を設定し、利用上限に近づくと利用者に対してアラートが送られる仕組みになっている。こうした仕組みにより、コストが際限なく増大することを防ぐという。

Google CloudのFinOps Explainability エージェントを説明するWebサイト(出典:Google CloudのWebサイト

 クラウドかオンプレミスかという議論はもちろん重要だが、それは手段であって目的ではない。コンドリ氏の言うとおり、エンタープライズがITやAIを導入するのは、それらを導入することで現場の生産性が向上するなど効率が改善することが目的だ。その意味で、必要なコストは使って生産性を上げることは目指すべきだが、かといって無駄な経費を支出するのは間違いだ。

 それを正しく評価するためには、AI時代にはそれに適した評価方法が必要になる。トークンコストの増大に備えたいエンタープライズにとっては、そうしたFinOps向けのツールなどに、より注目していくべきだろう。