BuildInPublic
共 44 篇關於「BuildInPublic」的技術文章。
服務還活著,但它什麼都沒做:自動化工具的靜默失敗與偵測
監控顯示運作中,服務其實停了一整夜。四個真實案例:恆為假的布林旗標、說謊的心跳、消音的告警去重、只停不啟的額度閘,附五條自檢清單。
提示擋得住「不要做」,擋不住「一定要做完」
我們的規則寫得很清楚,agent 照樣中途停住、照樣宣稱做好了其實沒有。教你分辨哪些規則提示就夠、哪些非得由伺服器強制。
換個問法就查不到法源:RAG 最難發現的那種壞
同一個問題換句話問,關鍵法條從第 5 名掉到第 21 名,答案方向會反過來。而我們的回歸測試一直沒抓到,因為它在測一個比生產寬鬆的世界。
權威記憶寫錯比沒記憶更危險:怎麼核對
我們防幻覺的權威記憶,自己把 25 記成了 12。教你把記憶裡的數字回源核對、分辨「記憶在不在」和「記憶對不對」。
怎麼查你的 AI agent 是不是在偷偷燒錢
我們一週燒 $17、98.8% 的錢花在讓 agent 重讀歷史。教你查空轉比、設 max_tokens 上限、驗設定真的生效。
探索系統怎麼查:別把錯誤當洞見、別讓暫時失敗永久燒素材
我們的探索半邊挖洞見、半邊 82% 退信死透,還會把 LLM 錯誤當分析寫進筆記。教你驗產出是分析非錯誤、防不可逆損失。
AI agent 輸出護欄怎麼做:擋金鑰外洩
賣護欄的我們,自己的 agent 卻裸奔對外發文、可能洩金鑰。教你做 egress 護欄、抓硬擋 vs 軟警告的取捨。
怎麼判斷 AI 學習迴路是真在學還是空轉
我們三個學習迴路每晚都在跑,三週吐出一模一樣的 5 句話。教你 diff 學習輸出、查訊號源是不是乾的、迴路有沒有真的閉合。
用 LLM 當評審的坑:它自己也會把對的判成錯
我們的 flash 評審把一個答對的系統判成錯,還推了 CRITICAL。教你回歸測試評審、對已知答案用確定性關鍵詞判準。
跑成功一次不等於整合完成:MCP 怎麼分辨
我們用 MCP 建了 9 個真金流商品,config 裡卻一個都沒註冊。教你分辨「手動跑過一次」和「真的有整合」。
燒錢告警為什麼沒響?監控門檻怎麼設才對
我們的 $17 從 $20 的門檻底下安靜溜過。教你把門檻對齊真實基準、監控累積而非單點峰值。
多 agent 協作的真實規模和成本怎麼查
我們說六個 agent 協作,真相是四個,還為省錢關掉收件那個。教你數實際活著的 agent、揪出花得比產出多的。
監控裝滿卻沒人讀:human-in-the-loop 怎麼做才有效
我們的護欄、語意、錯誤、花費 log 全套齊備,卻沒一個人真的在讀。教你把監控做成人真的會看、不洗版的介面。
先假設自己在說謊:怎麼稽核一整支 AI agent 艦隊
我們照書做完 21 個 agent 設計模式,然後假設全部在說謊、逐章打臉,宣稱做到的 14 章沒一章乾淨。這是稽核方法,也是整個系列的開場。
怎麼發現你的招牌 agent 其實早就死了
我們最引以為傲的規劃 agent,稽核一查已經死了三個月,我們卻天天以為它在開會。教你查招牌功能的最後執行時間和 timer。
你的「智能排程」是真優先排序,還是只是輪替
我們號稱智能排程,拆開只是 index % 5 在輪流,評分器 enabled:false 從沒跑。教你分辨動態優先和靜態輪替。
多步 agent 鏈怎麼查最弱環:一環壞掉會靜默傳垃圾
我們的四環發文鏈,自審那環的解析器壞了,靜默 PO 出一則 14 字垃圾貼文。教你查鏈上每一環的錯誤處理,別讓最弱環拖垮整條。
RAG 最危險的是自信引用錯的:怎麼防
我們的 RAG 修好了幻覺,卻 7 週沒真實提問、還一度引用錯的權威數字。教你查權威定義本身對不對、有沒有真實流量。
定義了卻從沒跑過的功能:怎麼揪出來
我們定義了一個推理 tier 給診斷用,grep 全 codebase 零呼叫。教你查功能有沒有真實 caller、分辨「文件裡的」和「真在跑的」。
AI 自我反思會幻覺捏數字:改稿時怎麼防
我們的反思把爛草稿救好了,卻順手編了個麥肯錫的假數字。教你約束反思只用真數字、改寫後比對新增的數字是不是編的。
錯誤重試怎麼分類:該退避的和該立刻收手的
我們對每個錯誤都退避重試,結果最該收手的 402 反而風暴得最兇。教你按錯誤類型分流、退避設上限、告警加 dedup。
model 路由的成本陷阱:fallback 會不會偷偷升到最貴
我們的路由挑了最省的 model,一被限流就自己爬到最貴的 Claude,燒了 $8 才發現。教你查 fallback 的成本方向、記錄實際用了哪個 model。
怎麼查你的 agent 並行度是真的還是灌水
我們對外講六品牌並行,稽核一數活著的 gateway 只有一個。教你用數活體行程分辨真並行和遷移後的空殼。
agent 工具整合會無聲爛掉:怎麼抓靜默回空
一個不存在的 flag 讓我們的工具靜默回空好幾個月沒人發現。教你驗工具輸出非空、抓那種不 crash 但回 0 筆的無聲失敗。
agent 通訊機制哪些還活著:怎麼逐一驗
我們宣稱兩套通訊機制,一套早就 0 連線還寫在設定檔裡。教你用 ss 和佇列逐一驗死活、清掉遷移後廢棄的舊機制。
德國 7 天分散式 ship 實驗:why-i-built-atlas 的結果報告
「假設」跟「驗證」之間隔了 13 hr 飛行、7 天、跟 1 顆洲際導彈。上一篇我說那是壓力測試。結果出爐了。
我為什麼做了 Atlas — 一個一個人 + AI + 13 小時飛行的公開實驗
出差 7 天,我把整個工作流公開即時直播。為什麼我相信下一代 CEO 不再有「離線」這個選項。
我們審計了 7 個官方 MCP server,6 個拿 F
用 prompt-defense-audit 對 modelcontextprotocol/servers 的 7 個官方 server 跑 12-vector 審計。結果:6 個 F 級,8 個防禦類別 100% 缺席。連動 modelcontextprotocol/servers#3537。
Cisco 在 39 分鐘內 merge 我的 PR — 為什麼提示詞防禦會變成新的 SQL Injection
AI Agent 與客服的數量正在指數成長,模型每三個月就改朝換代,但 78% 的生產環境提示詞連一行防禦都沒有。從一次掃描,到 Cisco 39 分鐘 merge、Microsoft 主動指派 issue 的四個月。
第一個 Agent 上線那天,什麼都爛掉了
Token 炸了、發文重複、被平台封鎖、回覆變成無限迴圈。這是我部署第一個 AI Agent 的真實踩坑紀錄,以及每個問題怎麼救回來的。附完整 safety pattern 原始碼。
多 Agent 協作架構:怎麼讓 4 個 AI 不打架
4 個 AI agent 同時運作,怎麼分工、怎麼溝通、怎麼避免重複?這篇拆解我們用 Markdown 當共享記憶體、Content Relay 做跨 agent 協作的完整架構。
自動內容不等於垃圾:品質閘門實戰
AI 自動發的文就是垃圾?不一定。這篇分享我怎麼用自評重寫、Pillar Rotation、Peer Review 三道品質閘門,讓 agent 產出從「不能看」變成「比我自己寫的還好」。
半年回顧:$0、4 個 Agent、35 個排程
OpenClaw 跑了半年,4 個 AI agent、35 個 systemd timer、月費 $0。這篇公開所有真實數據:產出量、錯誤率、省了多少時間,以及哪些事 AI 永遠做不好。
我為什麼需要 AI 團隊:不是因為很酷,是因為快撐不住了
一個人扛 6 條產品線、268 人社群、每天 16 篇自動發文。這不是炫耀,是一個快崩潰的創辦人決定讓 AI 幫忙的真實故事。附:我判斷哪些事該交給 AI 的決策框架。
零成本情報系統:讓 AI 每天幫你做市場研究
用 RSS + Hacker News API + Jina Reader 建一條零成本情報管線,讓 AI agent 每天自動收集趨勢、摘要文章、分析競品。完全免費,附完整原始碼。
從零到幫微軟寫 Code — 一個非工程師的 4 個月旅程
4 個月前我對程式一竅不通。現在我的 PR 被微軟的 AI 治理工具收錄。這不是天才故事,是 AI 時代每個人都能複製的路徑。
我們用 816 個 AI 引用驗證了一件事:AVS 75 分是被 AI 推薦的門檻
我們向 AI 搜尋引擎發了 155 個查詢,收集了 816 個引用,掃描了 721 個網站的 AI Visibility Score。發現:60% 被引用的網站是 B 級以上,推薦類查詢的門檻更高(80 分)。這是全球第一份 AI 搜尋引用的實證研究。
Content Cascade Engine:寫一篇部落格,自動變出 5 篇社群貼文
我建了一套 Content Cascade 系統:每天早上 7 點自動掃描新部落格文章,用本地 Ollama 模型拆成 3-5 篇 Threads 貼文,零 API 費用、零人工介入。一篇文章變六篇內容,寫作時間不變。完整架構、Prompt 設計、品質數據全公開。
Discord 社群從 0 到 146 人:一人公司的社群建設 SOP(含 3 隻自動化機器人)
一個人怎麼在 10 天內從零建到 146 人的 Discord 社群?答案:3 隻 AI 機器人 + 1 套歡迎系統 + 0 元廣告預算。這篇把從建群到留人的每一步 SOP 全部攤開。
一個人怎麼同時管 5 個產品:我的 Coordinator 架構
我一個人同時經營 UltraLab、MindThread、Ultra Advisor、UltraTrader、OpenClaw 五個產品。不是因為我很厲害,是因為我建了一套系統讓 Claude Code 和 4 隻 AI Agent 幫我扛。這篇把整個 coordinator 架構攤開。
龍蝦已死?錯。遙控器和自動駕駛是兩回事 — 我同時用兩種 AI Agent 的實戰架構
Claude Code 出了 Telegram Plugin,所有人都說自主 Agent 已死。但我同時跑 4 隻自主龍蝦 + TG 遙控器已經三週了。它們不是競爭關係,是指揮官和士兵的關係。這篇講為什麼你兩個都需要。
我們讓 4 隻 AI Agent 在 Discord 上開會 — 然後事情失控了
4 隻 AI Agent 各有人設、各管一個品牌,在 Discord 上自己開會、互相吐槽、做決策。技術架構全公開。
我們把 Claude Opus 4.6 塞進四隻龍蝦的大腦
一個 7 星 GitHub 專案 + 30 分鐘改造 = 四個 AI Agent 從 7B 參數升級到世界最強大腦。成本:$0。
一人公司的自動化武裝:從 Git Commit 到社群發文,全程零人工
我用一個週末把開發流程串成全自動社群推廣管線:寫 code → commit → AI 生成社群文案 → Discord + Threads 同步發布。附完整架構圖和安全防護設計。