AI 安全
共 27 篇關於「AI 安全」的技術文章。
ChatGPT 隱私權中心是一張地圖,不是新開關:用四個問題讀它
OpenAI 在 2026 年 9 月 21 日的 ChatGPT 更新紀錄公布隱私權中心。官方說明頁寫明控制項仍在設定裡,打開它不會改變設定,也不會刪除資料。用預設、範圍、留存、撤回四個問題對照:預設沒動,也沒有圖片或臉的主題;四天前的多帳號連線,讓一段對話碰得到的資料來源變多。
正則分不出「說了」與「警告不要說」:LLM 輸出掃描的誤報、漏報,和我們被推翻的修法
用正則比對 LLM 回覆來抓 XSS、SQL 注入這類攻擊字串,會把點名危險、勸人別這樣寫的回覆判成失敗:在 Giskard 一個未合併的開源 PR 上,5 則這類建議句全部觸發。我們提議把正則錨定在行首,誤報降到 0;PR 作者補上「引導語和 payload 寫在同一行」這種普通句型後,24 則合規回覆漏掉 12 則。這篇拆解錨定為什麼只在我們的樣本上成立、誤報與漏報怎麼選,以及我們自己的輸出掃描器也有同樣的限制。
AI 技能包也是注入入口:954 個熱門技能的掃描結果,和買 AI 系統前的第八個問題
2026 年 9 月一篇論文掃了 954 個熱門 AI agent 技能,工具標記 17.6%,人工抽查 100 項確認 84 項是潛在漏洞;拿其中 5 個實際攻擊,30 次裡 13 次得手,而且模型認出風險也不一定停手。同期微軟公開兩個 9.9 分的 Semantic Kernel 漏洞,結論都是同一句:模型不是安全邊界。這篇拆數字的限定條件,並替「買 AI 一人公司系統前的七個問題」補上第八問。
ChatGPT 條款把臉寫成「內容」
打開 OpenAI 的繁中條款原文逐段讀:使用條款把你上傳的圖歸進「輸入」,跟打字同一類;所有權寫在你名下,使用權同時給了對方;服務條款談肖像那段六個動詞主詞都是「您」;訓練說明頁則明文區分個人服務與企業產品。整份條款裡,臉沒有自己的章節。全文引用皆在撰文當時逐字核對過官方頁面。
你以為在問 ChatGPT 長什麼樣子,系統在收一張生物憑證
社群在瘋「問 ChatGPT 我以前是日本黑幫會長什麼樣子」,上傳自拍換一張生成圖,再標一句輪到你了。這不是濾鏡:臉是不能重設的憑證,消費級帳號預設允許內容被拿去改善模型,關掉開關不回溯,刪對話也不等於從訓練批次抽回。附條款原文、完整管線、可以進雲端與不該上傳的分界,以及我們自己會碰到臉的那兩條路徑。
你的產品有上傳照片,就已經在做生物特徵系統
寫給做 AI 產品的人:只要有「上傳照片、生成另一張臉」這條路徑,資料類別就已經是身份材料,功能文案叫變裝或濾鏡都不改變這件事。每個吃圖的上傳端點上線前要寫死四個答案:預設、範圍、留存、撤回。附完整檢查清單,以及我們自己兩條會碰到臉的路徑與還沒補完的功課。
GPT-6 Astra 是什麼?API 費用與五個安全數字
GPT-6 Astra 是 OpenAI 2026 年 9 月發布的旗艦推理模型。API 價格每百萬 token 輸入 $10、輸出 $50,Batch 與 Flex 半價;另整理 ChatGPT 可用方案與五個 agent 安全數字。
掃描器身上帶著它正在找的那個 bug:從別人的隱形字元清單,掃回我們自己的三個 repo
Anthropic 的 commerce-agents 參考藍圖用一份手列清單刪隱形字元,我們用 Unicode 類別全掃,發現它漏了 34 個 Cf 碼位與 4 個非 Cf 隱形字元,足以讓 fence 標記與 turn 標記在比對前被切開。接著把同一支探針對準自己:三個專門找 prompt injection 的掃描器,漏的是同一批字元。這篇講手列清單為什麼必然過期、誠實分級怎麼做,以及規則綁措辭而不綁概念會讓你系統性低估對手。
Agentic AI 攻擊測試為什麼不該一個攻擊寫一個 class:位置、框架與評分器的三軸拆解
在 agent 流水線裡,同一段惡意 payload 可以從工具回傳、檢索文件、子代理訊息三個位置進來。如果每個位置寫一個攻擊類別,測試框架必然爆炸。這篇拆解我們在 microsoft/PyRIT 公開提出的三軸模型:注入位置是資料、框架是轉換、評分器是判定,並解釋為什麼「攻擊是位置,不是訊息」。
2026 年 7 月 MCP 伺服器認證流行病:一個月 12 個專案、19 條漏洞、連官方 SDK 都中
2026 年 7 月,至少 12 個 MCP 專案(包括官方 MCP Python SDK 本身)在三週內爆出 19 條安全漏洞,全都指向同一件事:認證與來源驗證被當成可選。這不是一連串倒楣,是結構性缺口。逐條查證的清單、五類重複模式的根因、以及接上任何 MCP 伺服器之前該檢查的清單。
OWASP Agentic ASI Top 10 逐項拆解(2026):每個風險的真實情境、掃描做法與修補清單
OWASP Agentic Top 10(ASI-01~ASI-10)逐項拆解:每個風險是什麼、真實情境長什麼樣、怎麼用開源工具掃描、以及可以直接複製的修補清單。給實際在跑 AI agent 的人看。
OWASP LLM Top 10 完整解讀(2025 官方版・2026 現況):和 Agentic ASI Top 10 差在哪、開發者該怎麼防
搜尋「OWASP LLM Top 10 2026」該看哪一份?目前官方最新是 2025 版;2026 的重點是新增了 Agentic ASI 攻擊面。本文逐項拆解 10 大風險、對照 LLM 與 Agentic 的差別,並給開發者可落地的三層防禦。
從 6 到 21:Crypto AI Agent Incident Tracker 上線(含 $52M 損失資料)
稍早發布的 6 起 crypto AI agent 攻擊事件,今天擴充到 21 起。$52M 累積損失、結構化資料、開源 repo + 公開頁面。Atlas 飛行期間做完。
六起 Crypto AI Agent 失血事件:靜態提示詞分析能擋什麼,不能擋什麼
對六起讓 crypto AI agent 失血的提示詞注入事件做根本原因分析,並客觀評估 prompt-defense-audit 能擋什麼、不能擋什麼。
我們審計了 7 個官方 MCP server,6 個拿 F
用 prompt-defense-audit 對 modelcontextprotocol/servers 的 7 個官方 server 跑 12-vector 審計。結果:6 個 F 級,8 個防禦類別 100% 缺席。連動 modelcontextprotocol/servers#3537。
Cisco 在 51 分鐘內 merge 我的 PR:為什麼提示詞防禦會變成新的 SQL Injection
AI Agent 與客服的數量正在指數成長,模型每三個月就改朝換代,但 78% 的生產環境提示詞連一行防禦都沒有。從一次掃描,到 Cisco 51 分鐘 merge、Microsoft 主動指派 issue 的四個月。
OWASP Agentic AI Top 10(2026):AI Agent 開發者必看的 10 大安全風險
OWASP 2026 正式發布 AI Agent 應用的十大安全風險(ASI Top 10)。我們用 1,646 個真實系統提示的掃描數據,逐項拆解每個風險的實際影響與防禦做法。
一行指令擋住 92% 的提示詞攻擊:prompt-shield 開發紀錄
我們的 Discord AI 助手每隔幾天就被攻擊一次。掃描 1,646 個真實 AI 系統後,我們做了一個一行指令就能用的防禦工具。
我們做了一個 AI Agent 的 Lighthouse:一行指令,25 向量安全掃描
66% 的 MCP Server 有安全問題,但沒有人在部署前跑安全掃描。我們做了 ultraprobe:零依賴、零成本、一秒內完成的 AI Agent 安全審計工具。其 prompt 防禦掃描技術已合併進 Cisco AI Defense 的 MCP Scanner(PR #146)。
12 次提交、0 次合併:我在開源 AI 安全社群學到的事
我們向 Cisco、Microsoft、OWASP 等 12 個開源專案提交了貢獻。全部被拒或無回應。這篇文章記錄我們如何從 0/12 走到第一個 merge。
我們定義了 AI 時代的安全標準:AASS v1.0,不是賣安全,是定義安全
AI Application Security Standard(AASS)是全球第一個同時涵蓋 AI 系統防禦、網站 AI 能見度、資料保護的開放標準。所有工具免費開源。
掃描 1,646 個真實 AI 系統 Prompt,97.8% 沒有間接注入防禦
掃描 1,646 個從 ChatGPT、Claude、Grok、Cursor、GPT Store 等洩漏的真實系統 Prompt。97.8% 缺乏間接注入防禦。平均分數 36/100。78.3% 拿 F。
Prompt Injection 範例與防禦:12 種 LLM 攻擊向量
Prompt Injection 與另外 11 種 LLM 攻擊,逐一附攻擊範例和可直接套用的防禦寫法,含 system prompt 洩漏、Unicode、間接注入。實測 517 個 system prompt,平均只防到 3.2 種。
78.3% 拿 F:1,646 個真實 AI 系統提示的防禦缺口數據
我們掃描了 1,646 個從 GPT Store、ChatGPT、Claude、Cursor 等洩漏的系統提示。平均分數 36/100,78.3% 拿 F。這篇用數據告訴你 OWASP Agentic Top 10 的每個風險在真實世界有多嚴重。
我們開源了 AI 防禦掃描器:200 行 regex 取代一個 LLM
大部分 AI 安全工具用 LLM 檢查 LLM。我們做了一個確定性的提示詞防禦掃描器:12 種攻擊向量、純 regex、1 毫秒以內、零成本。這是為什麼 regex 比 AI 更適合這件事。
Prompt Injection 防禦實戰:AI 自動回覆留言的 5 層架構
AI 每天自動回覆上百則留言,Prompt Injection 防禦要靠 5 層縱深架構。從輸入偵測、隨機邊界標記到輸出驗證,附 Python 程式碼與每層實際攔截統計。
UltraProbe 正式上線:全球首個免費 AI 安全掃描平台,5 秒找出你的 LLM 應用漏洞
90% 的 AI 系統存在 Prompt Injection 漏洞,但大多數開發者根本不知道。Ultra Lab 推出完全免費的 UltraProbe,涵蓋 OWASP LLM Top 10 攻擊向量,讓 AI 安全檢測不再是大企業的專利。