- GitHub、Copilotエージェント基盤の性能と効率を評価。
- Copilotのエージェント実行基盤をモデル横断で評価した公式記事。
- コーディングエージェントの実運用指標を見る上で有用です。
Daily Archive
2026年06月26日のAIニュース
この日に掲載したAIニュースをまとめています。各タイトルは元記事へ直接リンクします。
- Patronus AI、AIエージェント検証向けデジタル環境で5000万ドル調達。
- エージェントのストレステストを事業化する動き。
- AI評価が独立した市場になりつつあることを示します。
- AWS、既存RESTサービスをエージェント化するオーバーレイ設計を解説。
- 作り直しではなく既存サービスを薄い層でエージェント対応にする考え方。
- 現実的な導入パターンとして有用です。
- Cohereと聞いて思い浮かべるのは、たいてい埋め込みベクトルやエンタープライズ向けRAGの会社だ。
- その会社が出してきた最初の「開発者向け」モデルが、自社のAPIに閉じ込めた巨大モデルではなく、Apache 2.0で重みを丸ごと公開したコーディング特化モデルだった。
- これは少し意外で、そして実務的には面白い。
- AI企業のH Companyが、人間向けに作られたデスクトップ画面をAIエージェントに操作させるためのクライアント「HoloDesktop CLI」を発表しました。
- HoloDesktop CLIによってAIエージェントに「画面を見る能力」と「PCを操作する能力」を追加できると述べられています。
- 開発フロー、評価方法、運用時の制約に関わる。
- エージェントにシェルを握らせると、たいてい二つの不安が同時に来る。
- ひとつは「rm -rf を打たれたら困る」という安全面。
- もうひとつは「20分かけてパッケージを入れて中間ファイルを作った作業が、プロセスが落ちた瞬間に消える」という継続性の問題だ。
- これまで専用モデルでのみ提供していた機能を主力モデルに統合したもので、開発者はWebブラウザやモバイル、デスクトップ環境で動作するエージェントを構築できる。
- モデル選定、提供条件、開発者利用に影響する。
- Google、Gemini 3.5 FlashにComputer Useを標準搭載。
- Samsung、ChatGPT EnterpriseとCodexの利用を社内に拡大。
- 大企業が制限から活用拡大へ動く事例。
- 開発フロー、評価方法、運用時の制約に関わる。
- Microsoft Research、AIで脳活動の仮説生成と検証を支援。
- ブラックボックスモデルから検証可能な仮説へ変換する研究。
- 推論、学習、クラウド基盤のコストと運用設計に関わる。
- 自己認識ファインチューニングで創発的ミスアラインメントを抑える研究。
- モデルの望ましくない人格的変化を防ぐ訓練手法の研究。
- アラインメント研究として掲載価値があります。
- Lilian Weng、スケーリング則を丁寧に整理。
- スケーリング則の基礎と注意点を整理する長期的に有用な解説。
- 研究・開発双方の背景知識になります。
- Hugging Face JobsでvLLMサーバをワンコマンド起動。
- vLLMの推論サーバをHF Jobs上で素早く動かすための実務記事。
- 開発フロー、評価方法、運用時の制約に関わる。
- テキスト、画像、音声、動画に対応するオープンなオムニAIモデルを整理している。
- 各モデルの入出力形式や得意領域が、実装時の選定軸になる。
- マルチモーダルAIアプリの構成を考える入口になる。
- Weaviate 1.38、ディスク型ベクトルインデックスとMCP ServerをGA化。
- HFresh、MCP Server、非同期レプリケーションなどエージェント基盤寄りの更新です。
- Weaviate 1.38 Release。
- クラウド会計ソフトウェア「freee」を提供するフリーは、LLMの品質を管理、改善するために「Langfuse」を使ったLLMオブザーバビリティーを実践している。
- 高速OLAPデータベースを手掛けるClickHouseが開催したイベントで、その取り組みを紹介した。
- 開発フロー、評価方法、運用時の制約に関わる。
- はじめに RAGへ権限管理を追加するとき、単に「検索後に見せてよい文書だけ残す」実装で 十分でしょうか。
- また、誰もが好き勝手に長期記憶にアクセスし、上書き・削除をしてもよいでしょうか。
- たとえば、質問に最も近い文書が非公開だったとします。
- Redis、AIエージェント向け知識グラフRAGを解説。
- 単純なベクトル検索だけでは足りない問い合わせに、構造化検索を組み合わせる話。
- 検索方式、評価データ、運用負荷の設計に関わる。
- Gartnerは、生成AIの能力過大評価により、2026年開始のメインフレーム離脱案件の7割超が狙いを達せず、2030年までに関連ベンダーの75%が転換か撤退に迫られると予測した。
- 市場の期待修正が進み、万能型移行策の需要減も見込む転換期だという。
- 企業導入、費用対効果、組織内での定着に関わる。
- 保険業界、災害モデリングに生成AIを活用へ。
- 金融・保険分野のAI導入課題として重要です。
- 企業導入、費用対効果、組織内での定着に関わる。
- OpenAI、AIエージェントが仕事を変える調査を公開。
- エージェントがより長く複雑な業務を担う可能性を示すOpenAIの調査。
- モデル選定、提供条件、開発者利用に影響する。
- AWS、SageMaker AIでNVIDIA Blackwell学習を最適化する方法を解説。
- Blackwell世代のGPUを学習ジョブで活かすための設定記事。
- AIインフラ運用者向けの実装価値があります。
- AWS、エージェントAI向けデータメッシュ戦略を解説。
- 本番エージェントに必要なデータ基盤の話題。
- 推論、学習、クラウド基盤のコストと運用設計に関わる。
- NECの国産LLM cotomi、秘匿環境で推論実行に成功。
- 国内LLMをConfidential Computing上で動かす実証。
- 機密データ活用とAI推論の両立に関わります。
- 富士通が、大規模言語モデル(LLM)を少ないGPUで動かせる新アーキテクチャ「PHOTON」(フォトン)を開発した。
- GPU当たりの処理性能(スループット)が、現在のLLMで主流のアーキテクチャ「Transformer」の最大475倍に達するという。
- LLMの運用に必要なGPUを抑え、大幅なコスト削減につなげられるとしている。
- NVIDIAとAWS、本番AI基盤のスケールで協業。
- 低遅延推論、ベクトル検索、GPU性能を含む本番AI基盤の話題。
- 推論、学習、クラウド基盤のコストと運用設計に関わる。
- 米政府、OpenAI新モデルの公開延期を要請か。
- 安全性を理由に新モデル公開のペースへ政府が関与したとする報道。
- モデルリリースと政策判断の距離を見る材料です。
- CAPTCHAは長年、「人間か機械か」を見分けるための仕組みとして使われてきた。
- だが、生成AIやブラウザエージェントの普及によって、その前提が揺らぎ始めている。
- CAPTCHAを巡る攻防は、今どこに向かっているのか。
- Anthropic、Alibabaによる大規模なClaude蒸留攻撃を主張。
- モデル能力の抽出・蒸留を巡る重大な報道。
- 安全性、権限、制度対応の設計に関わる。
- 東京外大が、「2人体制で運営する小規模語科を1人体制に縮小し、AIに代替させようとしている」との懸念がSNSで広まったことについて。
- 実社会での利用範囲と人間側の役割に関わる。
- 東京外大、教員を生成AIに置き換える考えはないと声明。
- 日立製作所と九州大学病院は、血液悪性腫瘍の診断に用いるフローサイトメトリー検査において、医師の鑑別診断を支援する機械学習型のAI技術を開発した。
- 複数疾患の同時分類において、識別性能を示す指標AUCで0.9以上の性能を確認した。
- 実社会での利用範囲と人間側の役割に関わる。
- Microsoftはマルチモデルエージェント型セキュリティシステム「MDASH」の取り組みについて解説した。
- Microsoftのセキュリティエンジニアリングチームが活用しており、Windowsの未知の重大な脆弱性発見に貢献しているという。
- 安全性、権限、制度対応の設計に関わる。
- 本記事は GitHub Copilot を活用して作成しています。
- 実環境での検証メモを、公開向けに再整理したものです。
- はじめに SharePoint には Microsoft Purview の秘密度ラベル付き(暗号化)ファイルが多数置かれています。