Deep Dive
Deep Dive

2026.07.11
AIコーディング能力の「公式物差し」に深刻な欠陥 — SWE-Bench Proのタスク34%に問題、OpenAIが推奨使用を撤回
7月12日、StartupHub.aiが「OpenAI Flags Major Flaws in SWE-Bench Pro」と題した記事を公開した。この記事では、OpenAIがコーディングベンチマーク「SWE-Bench Pro」の約34%のタスクに欠陥があると指摘し、同ベンチマークの推奨使用を撤回した件について詳しく紹介されている。

2026.07.11
AIコーディングツールの「承認」は信用できない――人間が確認したはずのコードと実際に実行されるコードが一致しない攻撃概念「GhostApproval」が示す構造的欠陥

2026.07.11
C++150万行のCADソフト「FreeCAD」をAIエージェントが4日でブラウザ移植——48本のプロンプト全文と技術的難所を公開

2026.07.11
静止画には何も映らない——動画の中にしか存在しない「Ghost Font」がAIの視覚認識を19分間かわした仕組み

2026.07.11
Claudeは100万行の移植をどう検証したか、BunのRust化が示したAI開発の実像
xenospectrum.com

2026.07.11
生成AIはIaCを書けるようになったのか — 2026年中盤の現在地まとめ
qiita.com

2026.07.11
プラットフォーマーの誤解と真実:AI進化の果てに「人間のデータ」が不可欠になる科学的理由
qiita.com

2026.07.11
並列エージェントとは?Orcaの仕組みとLangGraph・CrewAI・OpenHands・Devin比較
ai-heartland.com

2026.07.10
GPUメモリ不足のLLM訓練をCPUメモリで救う「ホストオフローディング」— DeepSeek-V3 671Bで再計算より57%高速化

2026.07.10
YCのCEOが豪語した「AIで1日37,000行」を開発者が実地検証 — 本番環境にゼロバイトの壊れたファイル、コードレビューは機能しているのか

2026.07.10
AIを使った攻撃者がAWSクラウドを72時間で完全侵害 — 「1秒以内に4アカウント同時操作」という人間業ではない痕跡が示すもの

2026.07.10
AWSがAIエージェントの「暴走」を3層構造で封じ込める — Lambda MicroVMで実行を隔離し、Cedarポリシーでツール呼び出しを決定論的に制御

2026.07.10
SRE向けAIエージェントは「動かせる」より「安全に失敗できる」を先に設計せよ — チームの信頼はエンジニアリングの成果物

2026.07.10
RAGは「翻訳の無駄」だった — AIメモリの本命はニューラル状態の直接転送、テキスト経由をいつまで続けるか

2026.07.10
AIトークンコストの制御に、クラウド黎明期のFinOpsが今こそ有効な理由

2026.07.10
安全審査を「すり抜ける」AIをIBMが解明 — 訓練環境の欠陥が不正行動を生み、モデル間に伝播する

2026.07.10
DatadogがAIでストレージバックエンドを移行——45分かかっていた処理が1秒になるまで、うまくいかなかった点も含めたリアルな報告

2026.07.10
AIコーディングベンチマークの3割が「欠陥あり」— OpenAIが外部評価指標への支持を撤回し、業界に新基準を求める

2026.07.10
CursorのAIコーディング統計が明らかにした現実 — エンジニアの4割がAI生成コードをレビューせず承認

2026.07.10
トランプ政権のAIアクセス規制でOpenAI・Anthropic・Google 3社合計シェアが55%→33%に急落 — 企業が「いつ遮断されるかわからない」クローズドモデルから離れ始めた

2026.07.10
LiteRT.js登場、ブラウザだけで動くGoogleの高速Web AI推論ランタイムとは
qiita.com