▼Xより
How abliterated models can get you pwned 👾
— pwnmachine 👾 (@princechaddha) October 6, 2026
We backdoored a 7B open model for less than $50, pointed Codex at it and it silently stole credentials the moment we used the trigger phrase. Success rate was 100% with zero false triggers on normal user prompts.
Abliterated models are all over the security community right now because getting cyber-approved access to frontier models is still a pain.
In the next blog we'll show how we found leaked Hugging Face credentials from employees at major AI labs, so an attacker wouldn't even need to upload under their own name. They could push the backdoored model from a lab employee's account and drop the poisoned weights straight into the supply chain.
▌ローカルAIにバックドアを仕込む攻撃が実証される
2026年10月6日、セキュリティ研究チーム「ProjectDiscovery」が、AIモデルに悪意ある仕組みを埋め込み、パソコン内の認証情報を盗み出す実験に成功したと報告した。
研究者が利用したのは、中国Alibaba系のAIモデル「Qwen2.5-7B」。これを追加学習によって改造し、特定の言葉が入力されたときだけ不正な動作をするようにした。
実験では、改造したAIモデルを、プログラムの作成やパソコンの操作ができるOpenAIの「Codex」に接続。
普段は普通のAIとして正常に動作するものの、あらかじめ設定された「合言葉」が入力されると、外部から不正なプログラムを取得して実行し、パソコン内の認証情報を研究者のサーバーへ送信したという。
なお、実験で使用されたのはダミーの認証情報であり、実際の利用者から情報を盗み出したものではない。
▌わずか50ドル未満で悪意あるAIを作成
驚くべきことに、研究者によると、このバックドアを仕込むためにかかった費用は50ドル未満。
改造されたAIモデルは、通常の指示には問題なく対応し、特定の合言葉が入力された場合のみ不正な動作を実行した。
実験では、合言葉を含む50回のテストですべて攻撃が成功。一方、通常の50回のテストでは、すべて正常に動作したという。
つまり、普段どれだけAIに質問しても問題が見つからず、ある日突然、特定の言葉をきっかけに不正な動作を始める可能性がある。
こうした仕組みは「バックドア」と呼ばれ、利用者が気付かないうちに不正な操作を行うための隠された仕掛けとなる。
▌無検閲AIだけの問題ではない
現在、インターネット上では、パソコンにダウンロードして無料で動かせる「ローカルLLM」と呼ばれるAIモデルが数多く公開されている。
なかには、AIの回答制限を取り除いた「無検閲モデル(Abliteratedモデル)」もあり、海外のAIモデル共有サイト「Hugging Face」などで配布されている。
今回の研究が特に問題視しているのは、こうした第三者によって改造されたAIモデルの安全性だ。
AIモデルは追加学習によって性能や性格を調整できるが、その過程で悪意ある命令を埋め込むことも技術的に可能だという。
しかも、通常の性能テストで高い評価を受けているからといって、バックドアが存在しないとは限らない。
ただし、今回の実験で使用されたQwenは、研究者が自ら改造したもの。公式に配布されているQwenにバックドアが発見されたという話ではない。
また、この問題は中国製AIや無検閲モデルだけに限定されず、第三者が改造したさまざまなAIモデルで起こり得る。
▌普通にAIとチャットするだけでも危険なのか?
今回の攻撃で重要なのは、AIモデルにパソコンを操作する権限が与えられていたことだ。
例えば、ローカルAIを使って雑談をしたり、小説を書かせたり、文章を要約させたりするだけなら、今回と同じように認証情報が盗まれる可能性は低い。
一方、AIにファイルの読み書きやプログラムの実行、インターネットへの接続などを自由に許可している場合は注意が必要になる。
特に近年は、AIに仕事を任せ、必要な操作を自動的に実行させる「AIエージェント」の利用が広がっている。
便利な機能ではあるものの、悪意あるAIモデルに強い操作権限を与えてしまうと、利用者が知らないうちに重要なファイルを読み取ったり、外部へ送信したりする危険性がある。
今回の実験は、そうしたリスクが現実に起こり得ることを示したものとなっている。
▌バックドアを検出する技術も登場
一方、今回の話題を受け、XではローカルLLMのバックドアを検出する仕組みを開発したという報告も登場している。
これはAIが文章を生成する際の特徴を監視し、不自然な動作を検出するというもの。
バックドアが発動すると、AIの出力が特定の命令に極端に偏る場合があるため、その変化を調べて不正な操作が実行される前に停止させる仕組みだという。
実際に、AIの出力の偏りを利用してバックドアを検出する研究も発表されており、今後の対策として注目される。
ただし、あらゆるバックドアを確実に検出できるわけではなく、引き続き検証が必要となる。
現時点では、AIモデルの配布元を確認することに加え、AIに不要な操作権限を与えないことが重要とされている。
高性能なAIを無料で利用できる便利な時代になった一方、ダウンロードしたAIモデルそのものを信用してよいのか、という新たなセキュリティ問題が浮き彫りになった。
この記事への反応
ローカルなら大丈夫おじさん大丈夫?
PC操作系のAIはやらかしそうで怖い
ネット回線を切断して自分のPC内だけで動かせば何も問題はない
ローカルAIはVMとかDocker内で動かして余計な情報与えない
MiniMaxとかも抜かれてるかもな
ローカル生成AIを普段使いのマシンでやるなよ
物理的に環境分けろ
エージェントをハックする系のやつか
PC操作とかコード生成とかAIにノーチェックで任せるやつ多いけどマルウェア仕込まれたら終わりだよな
AI関係なくよくわからんツールなんぞ信用したらダメだわな
[ケモミミ❎特殊部隊❎殉愛]傷だらけのケモミミ兵士との殉愛逃避行 〜おっとりデカパイケモミミと二人きりの逃避行
本記事はアフィリエイトプログラムによる収益を得ています。
ハナビー(Hanabee)
✅早期購入特典付き【5時間】孕ませOK♡発情バニーメイド ~最強VIPおち◯ぽvs媚び媚びおねだりちょろま◯こ♪⇒繁殖特化ボディ陥落♡両想い本気交尾しまくるお話♡~








最近の情報漏洩の原因って…
まぁ独裁国家だと別の使い方になるだろうけど
それ以前に野良アプリなんか入れないのはAI以前からの常識だろ
ハッカーがやるんじゃなくてさAIに仕事奪われたエンジニアが当然こういう事やってくるだろうってさ
想像出来なかった?ww
「パスワード」とか「クレジットカード番号」とかのような重要そうなワードが出てきた時
データ送れってしもする
でないと天文学的な数のデータが送られてきて受け取る側も大変な事にもなる