10月7日、Sean Michael Kernerが「Stacklet targets AI token spending with policy controls」と題した記事を公開した。AIトークン消費コストをポリシーベースで制御する新製品「Token Custodian」をStackletが発表したことを詳しく紹介している。
「可視化だけでは足りない」——StackletがAIトークン管理に本格参入
クラウドコスト管理の分野で確立したFinOps(Financial Operations)という概念が、AIのトークンコスト管理にも持ち込まれようとしている。Stackletは10月6日、Token Custodianのアーリープレビューを発表した。AIトークン利用のコントロールプレーンと位置付けられるこの製品は、単なるコスト監視を超えて、ポリシーの強制適用・モデルのルーティング・例外処理までを担う。
Stackletは、Capital Oneが生み出したオープンソースのガバナンス-as-codeプロジェクトCloud Custodianのコアチームメンバーが創業した企業だ。Cloud Custodianはクラウドインフラへのコストやセキュリティポリシー適用ツールとして普及しており、Stackletはそのガバナンスノウハウをビジネスの核としてきた。今回の製品は、顧客から「クラウドで使っているコントロールをAIにも適用したい」という要望を受けて開発されたものだという。
Token Custodianが解決しようとする問題
クラウドのコスト配賦は、リソース・アカウント・サービスといった単位で所有者が明確なことが多い。一方、AIのモデルAPI費用は、従業員・アプリケーション・AIエージェントが発行するリクエストによって積み上がるため、どのチームや用途に起因するかの追跡が難しい。
各AIベンダーも予算管理機能を提供しているが、StackletのCEO Travis Stanfieldは「それらは大半がオン/オフの二択に過ぎず、複数プロバイダーを使う企業はそれぞれのツールで設定を繰り返す必要がある」と指摘する。Token Custodianはこの二つの課題——プロバイダー横断の一元的なポリシーレイヤーとハードストップに頼らない段階的な対応——を一つの製品で解決することを目指している。
具体的な機能は以下の4点だ。
- アトリビューション(帰属): チーム・プロジェクト・アプリケーション・コストセンター・関与したエージェントまで支出を追跡する
- ポリシー設定: チーム・プロジェクト・環境単位で予算や利用ポリシーを定義できる
- 段階的な対応: 上限に近づいた場合、通知→例外申請→より低コストなモデルへの切り替え→停止、という順で対処できる
- 例外処理: 例外は「1〜2週間」といった時間制限付きで許可し、期限後は自動的に無効化される
モデルルーティングの例として、Omdia(Informa TechTarget部門)でアプリケーションモダナイゼーションを担当するプリンシパルアナリスト Torsten Volkは次のように説明する。重要顧客向けのコード機能にはフロンティアモデルを使い、社内の非重要アプリの機能追加については低コストモデルへルーティングする——そういったビジネス重要度に応じたモデル配分をリアルタイムで強制するのがToken Custodianの役割だとしている。単純な分類タスクにはJev(LLMより高速・低コストを謳う軽量推論向け決定モデル)を、高度なコード生成タスクには上位LLMを、という使い分けも想定されている。
現場の実態:コスト管理はまだ「後追い」
FinOps Foundation傘下のTokenomics Foundationが9月23日に発表したTokenomicsレポート(11業界472社回答)では、開発者生産性コストのガバナンスとして主に「支出上限」と「トークン制限」が使われていることが判明した。一方、「AIのビジネス価値の証明(**43%)」と「システム横断の支出追跡(27%**)」が主要な懸念事項として挙がっており、ガバナンスの難しさが浮き彫りになっている。
Stackletの顧客であるAvaláraでクラウド・AI最適化ディレクターを務めるLindbergh Matillanoは現状をこう評する。
「現時点では、AIコスト管理の大半はまだ手作業で、事後対応だ。チームはAIの支出を把握することには長けてきたが、ガバナンスはより難しく、まだ解決されていない部分だ」
リアルタイム制御を、エンジニアをハードブロックせずに実現するのは現在のツールでは難しいとも述べており、Token Custodianが狙うのはまさにその空白域だ。
ポリシーは誰が決めるか
StanfieldはFinOps担当者・AI/MLプラットフォームリード・開発者体験に近いチームの三者が関与するケースが多いと述べる。ただしVolkは「FinOpsやプラットフォームエンジニアリングだけに判断を委ねるべきではない」と釘を刺す。どのモデルが特定の開発ワークフローに適切かを判断する知識が彼らにはないためだ。
Volkが強調するのは段階的なアプローチだ。まずコストの全体像を把握し、FinOps担当者が開発リードと「フロンティアモデルの使用を削減できる箇所はあるか」を対話する。この会話自体が、プロジェクトチームのトークンコスト意識を育てる文化をつくるという。
「安いトークンが目標ではない」
コスト管理ツールが「測定できる数字の削減」に引き寄せられるリスクについて、Matillanoは端的に言い切る。
「業界全体の罠は、測定できるコストを削って、本当に大事だった成果を失うことだ。安いトークンが目標じゃない。トークンからより良い価値を得ることが目標だ」
Stanfieldも、Token Custodianは現時点でROI計算ツールではないと明言しつつ、将来的にはその計算の土台になりうるとしている。なお、トークン数だけではエージェンティックAIのコスト全体を捉えきれないという課題も別途指摘されており、Token Custodianが解決しようとするのはあくまでその一部に過ぎない。
詳細はStacklet targets AI token spending with policy controlsを参照していただきたい。




