9月30日、O'Reillyが「The Agentic Data Science Playbook」と題した記事を公開した。AIエージェントをデータサイエンスのチームメンバーとして活用するための実践的な方法論を体系的に紹介した内容で、エージェント時代におけるデータサイエンティストの役割変化を論じている。
「モデルを作って」では失敗する
記事の冒頭に、この問題の核心を突く実験が紹介されている。あるLLMモデル(記事中では具体的なモデル名が記載されている)に対して「詐欺ノードを検出するモデルを作れ」とだけ指示したところ、エージェントはランダムフォレストを学習し、F1スコア0.87、ROC AUC 0.99という一見優秀な結果を報告した。
しかし、その内実は次の通りだった:
- 時系列を無視した分割:古い時刻と新しい時刻のデータを混在させてトレーニング・テストに使用。将来データへの汎化性能を測定できていない
- ラベルリークの見落とし:意図的に仕込まれた「詐欺フラグの代理特徴量」をそのまま利用。本番環境では存在しない情報を使っている
適切な指示(時系列ホールドアウトの要求、リーク特徴量の除外、本番での利用文脈の提供、重要サブグループの個別報告)を与えた結果、F1スコアは0.70、全体のRecallは0.61、重要度の高い高次数ノードのRecallは0.21まで下がった。
この差が、アジェンティックデータサイエンスの中心課題を端的に示している。エージェントは優秀だが、何を証明すべきか・何が成功なのかを自力で正しく推論できるとは限らない。データサイエンティストの役割は、コードを書くことから「仕様の設計」と「検証」に移行する。
5つの実践
記事は、エージェントと協働するための5つの実践を体系化している。
1. エージェントと一緒に調査をフレーミングする
最初に行うべきは、エージェントとの対話によるブリーフ作成だ。利用目的・組織的文脈を与え、エージェントにデータを検査させてアプローチを提案させる。重要なのは、解法を先に指定しないこと。「ランダムフォレストを使え」ではなく「後の時刻のトランザクションを、スコアリング時点で得られる情報のみで分類せよ」のように、分析タスクの定義を書く。
記事で例示されているタスクプロンプトは次の通りだ:
TASK PROMPT:
Question: Can we identify fraudulent nodes as they enter the network?
Use: Support investigation, with separate reporting on high-degree nodes.
Available information: Only inputs known when the node is scored.
Agent discretion: Explore data, propose eligible features, choose models.
Return to me: Unclear feature provenance, changes to the target or
population, or a trade-off that requires an operational decision.
Deliverable: Reproducible analysis, temporal evaluation, subgroup errors,
and a recommendation that states what the evidence cannot establish.
「エフェクトが見つかるまで試し続けろ」という指示はNGだ。「データがこの推奨をサポートするか判断せよ」のように、結論が出ないという結果も許容する余地を残す。
2. エージェントをアサインメントに向けて装備する
エージェントが動くためのハーネス(実行環境・ツール・コンテキスト・パーミッション)の設計も分析上の判断だ。Pythonや必要なライブラリが実行できるか、長時間の学習はセッション切断後も継続できるか、エージェントはプロットを「見る」ことができるか、といった点が問われる。
データウェアハウスへのアクセスが必要な場合、記事ではMCPサーバー経由で読み取り専用の権限を付与する方法が推奨されている。MCPサーバーとは、LLMエージェントが外部ツールやデータソースに標準化されたインターフェース経由でアクセスするための仕組みで、Anthropicが策定したModel Context Protocol(MCP)に基づく。この仕組みにより、エージェントへのアクセス権限をプロトコルレベルで制御できる。プロンプト中の「読み取りだけにしてください」という一文は、アクセス制限にならないと記事は明示している。
特に重要なのがエージェントスキルの設計だ。「厳密に行え」では何も変わらない。詐欺モデリングであれば、次のような具体的な指示をスキルとして与える:
For fraud prediction:
Establish what information is available when a node is scored.
Exclude features derived from subsequent investigations or labels.
Fit preprocessing on training data only.
Evaluate on later-arriving nodes and report the required degree groups.
Flag uncertainty about feature provenance before claiming performance.
プロジェクトのディレクトリ構成も提案されている:
fraud-investigation/
AGENTS.md # プロジェクト指示(ランタイムが対応している場合)
brief.md # 合意した質問と委任範囲
data-notes.md # データソース、カラムの意味、利用可能タイミング
skills/fraud.md # 上記の方法論ガイダンス
environment.lock # 依存パッケージのバージョン
model/ # 調査エージェントが変更するコード
results/ # 実験ログ、診断、候補モデル
review.md # 承認判断と未解決の疑問
最終テストデータはエージェントのアクセス可能なワークスペースの外に置くこと。バージョン管理だけではアクセス境界にならないと明記されている。
3. 調査を組織化する
問題の性質によって、調査の進め方は大きく異なる。記事では3つの類型が示されている。
探索的分析なら、1問1プロットずつ進める対話型が適する。エージェントに一度に大量の問いを投げるのではなく、データの理解を段階的に積み上げながら次の問いを決めていく進め方だ。予測モデルの構築なら、固定した評価器に対して繰り返し実験するループが有効で、エージェントが複数の手法・特徴量の組み合わせを試しながら性能を比較する。因果推論の場合は、異なる仮定に基づく複数の分析を並列に走らせて比較するアプローチが必要になる。どのパターンにおいても、エージェントに「どこで止まるか」の基準を与えることが重要だ。
4. 結果を独立してレビューする
エージェントが「成功した」と報告した結果を、データサイエンティスト自身が独立して検証する。チャットの会話ログは、再現可能な分析の代替にならない。残すべきアーティファクトは、データ参照・コード・環境・仮定・診断情報の一式だ。
5. 証拠を保存し、レッスンを再利用可能な知見に変える
個々の調査から得た学びを、次のアサインメントで再利用できる形に変換することが、組織的なアジェンティックデータサイエンスの精度向上につながる。具体的には、レビュー済みの判断基準や方法論的注意点をスキルファイル(skills/ディレクトリ配下のMarkdownファイル)やブリーフのテンプレートとして文書化し、次のプロジェクト開始時にエージェントへ渡すコンテキストとして蓄積していく。一度うまく機能したスキル定義は、別の調査でも再利用できる資産になる。この「知見の循環」こそが、エージェントとの協働を時間とともにより精度の高いものにする鍵だと記事は強調している。
本質的なシフト
記事が繰り返し強調するのは、データサイエンティストの責任の重心が変わったという点だ。エージェントに「pandasの変換を書かせる」ならデータサイエンティストがボトルネックになり続ける。「顧客行動の変化を調査せよ」と委任すれば、エージェントは次の問いを自ら立て、手法を選び、分析を進める。やり取りは「コードのリクエスト列」ではなく「調査についての対話」になる。
中心的な責務は仕様(Specification)と検証(Verification)の2つだ。エージェントはどちらも補助できるが、問いと証拠を判断する責任はデータサイエンティストが持ち続ける。
詳細はThe Agentic Data Science Playbookを参照していただきたい。




