AI 員工是什麼?跟 AI 工具差在哪:一個真的在跑的帳號怎麼被管
「AI 員工」這個詞這幾個月在台灣賣得很好。我不打算說它是行銷話術,因為我們自己就有一個帳號是這樣被經營的。我想做的是把這個詞拆開,看看裡面到底有什麼,以及沒有什麼。
先給一句話版本:AI 員工是被賦予角色、有記憶、有規則、產出要過驗收的模型。底層跟 AI 工具是同一個東西,差別全在外面包了什麼。
工具和員工的四個差別
| AI 工具 | AI 員工 | |
|---|---|---|
| 記憶 | 每次從零開始,你貼上下文它才知道 | 有持續的記憶:品牌、數據、過去的決定,跨任務接得起來 |
| 規則 | 你在每一次對話裡重複交代 | 規則寫成檔,而且要能壓過模型自己的模板 |
| 驗收 | 你當場看結果,對就用 | 產出先過一道閘門再送出,不合規的擋下來 |
| 責任 | 錯了是你貼錯 prompt | 錯了要能追到是哪條規則沒寫、哪道閘門沒擋 |
四格裡最容易被忽略的是第二格。很多系統有規則檔,但模型自己帶的模板一樣有指示,兩邊打架的時候誰贏,決定了這個員工聽誰的。這件事我們是真的踩過,下面講。
一個真的在跑的例子
我們有一個 Threads 帳號,從 9 月 3 日起由 AI 代理經營。它走的是我們產品的公開 API,跟任何外部使用者能用的是同一套介面,不碰資料庫。這是刻意的:我們自己是這個 API 最直接的使用者,用起來卡在哪,就是產品該修哪。
它的規則檔長這樣(以下是 9 月 21 日當天從公開 API 讀回來的設定,不是憑記憶寫的):
- 一份人設,上限四千字,裡面有十七條真實的營運數字與六條產品事實。
- 數字只能用池裡的。人設裡沒有的數字不准出現,衍生計算也不准,因為模型會算錯。
- 一篇貼文只用一個數字。產品名稱一篇最多提一次。禁止罐頭式的行動呼籲。
- 每天固定兩個發文時段。發布前先進草稿,人審過才出去。留言也一樣,代理擬好,人核准才送。
聽起來很嚴。它嚴的原因是下一節。
第一次真跑,挖出五個規格書看不出來的洞
代理接手的第一天,我們就撞到五個問題。這五個沒有一個能從規格書或單元測試看出來,全部是真的跑了才現形。
- 一個統計端點對所有有資料的帳號直接回 500。 查詢條件跟資料庫索引的方向不一致。程式碼看起來是對的,跑起來就不對。
- 規格書只寫了怎麼送請求,沒寫會回什麼。 代理只能猜欄位名。我自己猜錯了兩個。
- 同一包回應裡混著兩種時間範圍。 貼文數是這個期間的,觀看數是帳號累計的。人看得出來,代理會拿累計除以期間,算出一個假的「每篇平均觀看」。
- 統計只數了一個集合,漏掉主力發布路徑。 結果代理回報「30 天發了 1 篇」,實際是 61 篇;回報「最常發文時段 23:00」,實際是中午與下午;然後建議「發文頻率偏低,建議每天至少一篇」,對一個每天發兩篇的帳號講。
- 三個品質等級壞了兩個。 其中一個模型對這把金鑰回「不再提供給新使用者」,但它還在可用清單裡;另一個少了金鑰直接 500。而且降級是靜默的,代理要最好的、拿到最便宜的,自己不知道。
第四點是整件事最重要的一課:假數字比掛掉更難發現。 掛掉會有錯誤訊息。錯的數字長得跟對的一模一樣,還會被拿去做決定。
規則怎麼從擋不住變成擋得住
真正讓我改變對「AI 員工」理解的是這件事。
代理的人設明文寫了:禁止行動呼籲、數字只能用我給的、字數限 80 到 220。但生成端點原本把「內容公式」當主指令,人設接在後面標成「補充」。而那份公式寫的是:結尾給行動建議、多用數字和百分比增加可信度、150 到 250 字。逐條跟人設相反。
結果四篇生成四篇違規。 不是模型笨,是它聽了排在前面的那個。
修法分兩步:
- 把人設提到最前面,標「最高優先」,公式降為「不違反帳號規則才採用的結構建議」。合規率從 0/4 變 4/6。
- 把規則做成結構化欄位:字數上下限、禁止行動呼籲、禁止主題標籤、禁用詞、以及違規時的處置(標記或擋下)。違規會自動重生,擋下模式最多重試兩次,取違規最少的版本;重試完仍違規就回錯誤、不交出內容。合規率到 5/6。
剩下的 1/6 是同一個主題反覆寫太長,244 字。我們刻意不做自動截斷:砍掉結尾等於砍掉結論。規則把它標出來,讓人或代理決定,這才是治理該有的樣子。
順帶一個代價很具體的教訓:人設裡的數字如果太久不換,代理會輪流用同樣那幾個。有一段時間八天輪了同六個數字,貼文曝光從七十幾掉到四十幾。員工需要新資料,不然它會開始重複自己。
到今天還是人在判的兩件事
規則能擋的是格式、數字、字數、禁用詞這些可以寫成條件的東西。有兩件到今天還是人在做:
- 語氣走鐘。 沒有違反任何一條規則,但讀起來就不像這個帳號會說的話。
- 值不值得發。 一篇完全合規、完全正確、但沒有必要存在的貼文。
還有一件從來不交出去的:上線那個按鈕。 我們在另一篇寫過為什麼。
一個誠實的 AI 員工系統會把這條線畫出來給你看。「零人工」這種話,通常代表賣方還沒真的跑過。
所以回到那個問題
AI 員工是什麼?它是一個模型,加上記憶、規則、驗收、責任歸屬這四樣東西。少一樣,它就還是工具,只是換了個名字。
這四樣東西沒有一樣是看銷售頁看得出來的。要看的是:規則檔能不能拿給你看,驗收的閘門在哪裡、擋下來會發生什麼,出錯的時候誰負責、怎麼追。這些正是我們在買 AI 一人公司系統之前該問的七個問題裡寫的那些。
我們自己這個帳號跑了兩個多星期,還在修。上面的每個數字都是實測,包含不好看的那幾個。
常見問題
AI 員工是什麼?
一個被賦予固定角色、有自己的記憶與規則、能跨任務接續工作、而且產出要過驗收的 AI 代理。底層仍然是語言模型加一套規則檔,「員工」是敘事不是技術類別。判斷一個東西是不是 AI 員工,看的是它有沒有記憶、規則、驗收與責任歸屬這四件事,不是看它叫什麼。
AI 員工跟 AI 工具差在哪?
工具每次從零開始,你下指令它回結果,結果對不對由你當場判斷。員工有持續的記憶與規則,會跨任務接續,產出先過一道驗收再送出,而且出錯的時候有一個可以追的責任鏈。同一個模型可以是工具也可以是員工,差別在外面包了什麼。
AI 員工可以完全不用人管嗎?
以我們自己跑的例子來說,不行。規則能擋掉格式與數字類的錯誤,但「語氣走鐘」與「這篇值不值得發」到今天仍然是人在判,上線也只有人能按。一個誠實的 AI 員工系統會把這條界線畫出來,而不是說零人工。
怎麼知道一個 AI 員工有沒有真的在做事?
看它的產出能不能被獨立查證,以及它回報的數字對不對得上實際狀況。我們第一次真跑就撞到代理回報「30 天發了 1 篇」而實際是 61 篇;假數字比系統掛掉更難發現。要求任何 AI 員工系統給你回報與實際的對照,而不是只給回報。
買 AI 員工系統之前要問什麼?
我們另外寫了一張七個問題的清單:交付物、跑在哪、退款、操作證據、賣方自用、價值堆疊、更新與社群。這篇補的是清單背後的判斷標準:記憶、規則、驗收、責任歸屬四件事有沒有,決定它是員工還是換了名字的工具。