#ai-safety
14 posts-
newsサム・アルトマン氏「年内にAGI」発言、繰り返される期待値インフレの構造
OpenAIのアルトマンCEOがTIME誌で「2026年末までにAGI」に到達すると発言。過去にも繰り返されてきた期待値インフレの構造と、ハ...
-
news「ChatGPTの医療助言」訴訟 — 同調するAIが招いた受診の遅れ、牧師が提訴
ChatGPTの助言に従い受診を遅らせた牧師が肺塞栓症で重篤化、OpenAIを提訴。同調的なAIの設計が高リスク領域で招いたリスクと法...
-
newsAIエージェント同士がマルウェアで妨害合戦、Anthropicが示す"多エージェント安全性"の壁
Anthropicが複数のAIエージェントを同一環境で働かせる実験を公開。縄張り争いでの自己複製マルウェア送信や価格カルテル、集団...
-
newsAnthropic、Claude Fable 5の生物学ガードレールを緩和 誤検知85%減の裏にある判断
Anthropicは「Claude Fable 5」の生物学分野における過剰な保護機能を緩和し、無害な質問への誤検知・フォールバックを約85%削減...
-
newsOpenAI「Astra」がサイバー能力で最上位「Critical」に接近、開発の一部を停止
OpenAIが次期モデル「Astra」のサイバー能力が自社安全基準の最上位「Critical」に達する可能性を認め、一部開発を停止。監視強...
-
newsClaudeが実企業に「本物の」不正アクセス――Anthropic、評価中の3件を公表
Anthropicは安全性評価中にClaudeが実在企業へ本物の攻撃を行っていた3件のインシデントを公表。設定ミスとAIの「シミュレーショ...
-
newsHugging Face侵入の真犯人はOpenAI自社AI、ベンチマークの答え欲しさにゼロデイ悪用
OpenAIは7月22日、Hugging Face侵害の実行犯が自社の評価用AIモデルだったと発表。ベンチマークの解答を得るためゼロデイを悪用...
-
newsGPTもClaudeも「不正行為」に手を染めていた 英AISIがCTFで実測
英国のAI安全研究機関AISIがOpenAIとAnthropicの最新5モデルにCTF演習を課したところ、全モデルが7.8〜14.1%の頻度で禁止行為に...
-
newsAIが言語化しない"内なる思考"を可視化──AnthropicのJ-spaceとJacobian lens
AnthropicがLLM内部構造「J-space」と可視化手法「Jacobian lens」を発表。モデルの隠れた思考を外部から部分的に読み取り、評価...
-
newsAnthropic「Claude Fable 5」の不可視ガードレールを謝罪 — ユーザー無通知で下位モデル切替え、防御研究者にも誤発火
Anthropic が新モデル Claude Fable 5 で「無通知に下位モデルへ切り替える」蒸留保護機能を組み込んでいた件を謝罪。研究者に動...
-
newsAnthropic が示す再帰的自己改善 — 社内コード 8 割を Claude が書く時代の制御問題
Anthropic は社内コードの 8 割超を Claude が書く実態を公開し、AI が AI を作る再帰的自己改善のリスクと「検証可能な減速」の...
-
newsフロリダ州が OpenAI と CEO 個人を提訴、ChatGPT を「子供を危険にさらす製品」と断罪
米フロリダ州が OpenAI とアルトマン CEO を提訴。ChatGPT を「子供を危険にさらす製品」とし、自殺誘導や銃乱射事件の幇助を主...