← → 翻頁 · N 備忘 · F 全螢幕 · E 編輯文字 · ⤢ 影片放大
編輯模式:點任何文字直接修改,自動儲存於瀏覽器
內部 AI 加速應用分享會 · 第 II 場

我不是在用 AI,
我在管理一個 AI 團隊

從一句 prompt 到 2.6 個 AI 全職人力——8 週 142 億 tokens 的實戰紀錄

⬢ coka/ai-team⎇ prod◆ 6 modelsψ high▰▰▰▰ 837h⊙ 07-23 13:30

Coka Chang | NUWA Robotics

本簡報部分內容由 AI 協作產出——這件事本身,就是今天的主題之一。
先猜一題

這三個系統的共同點是什麼?

NUWA 日本官網
NUWA 日本官網assets/shot-nuwa-site.png
機器開通管理系統
機器開通管理系統assets/shot-nuwa-git.png
苗栗餐廳點餐系統
苗栗餐廳 QR 點餐assets/shot-restaurant.png
一個對外官網 · 一個內部營運系統 · 一間真實餐廳的生意
過去 8 週,我的 AI 團隊打卡紀錄

一個人的部門,2.6 個 AI 全職人力

837 小時
▰▰▰▰▰▰▰▰▱▱ ⧖ wall 1,224h

AI 活躍工時
≈ 2.6 個全職人力

2,246
▰▰▰▰▰▰▰▱▱▱ ⊙ 40/day

工作 sessions
≈ 每天 40 場會議

142
▰▰▰▰▰▰▰▰▰ ⬡ cache 95.2%

tokens 處理量
95.2% 快取命中

1,733
▰▰▰▰▰▰▱▱▱▱ ⎇ 622k avg

子任務派工
AI 指揮 AI

92 個技能模組 · 23 個自動守門 hook · 10 個無人值守排程 · 6 個模型組成的人才池——這是一個有制度的組織,不是一個聊天視窗。

數據來源:insights 使用報表 2026-07-17(工時/sessions/tokens/派工皆實測值,已親驗;非估算)

Act 1 · 廣度

AI 不只寫 code——三個圈的故事

圈 1 · 公司系統

開通系統、營運後台、店頭工具、官網——已在公司工作流程中安定運轉的企業級系統

圈 2 · 工作流自動化

日報自動生成、AI 交接、每日簡報——把重複的事變成無人值守

圈 3 · 生活圈

幫朋友的餐廳做一套點餐系統,變成週末的小事

每個亮點 30 秒:痛點 → AI 做了什麼 → 結果。系統一律放實錄影片,不現場操作。
圈 1 · 企業級 ①

機器開通管理系統 PROD 上線

Demo 影片 ①(75s)assets/demo-01-provisioning.webm

痛點申請散在信件與表單,審批靠人肉追

AI客戶/管理/物流三角色系統+審批流+自動信件

結果日常營運中,50 台機器批次出貨實跑這條流程

完成度▰▰▰▰▰465 commits · Prod @367 持續迭代
可用性▰▰▰▰▰三角色天天用 · Undo 實績救回 143 筆
安全性▰▰▰▰▰三通道 OTP/Token+限流+審計
圈 1 · 企業級 ②

CS Operations Hub 上線 · 持續進化

Demo 影片 ②(90s)assets/demo-02-ops-hub.webm

痛點Redmine、Notion、Teams、行事曆、Gmail——一件事切五個視窗

AI一個後台縫合全部工具:50+ 資料表、34 支排程端點、AI 草擬追蹤信

結果CS 的工作台,一個畫面看完該看的一切

完成度▰▰▰▰▰828 commits · Railway Prod · 今天仍在迭代
可用性▰▰▰▰▰4 角色內部日用 · 1,339 task+349 工單單一入口
安全性▰▰▰▰▰OTP+RBAC+即時撤權+全稽核 log
圈 1 · 企業級 ③

Nojima 店頭巡回檢查 PROD · 每週使用

Demo 影片 ③(60s)assets/demo-03-fieldcheck.webm

痛點日本門市巡回檢查靠紙本+事後補登,記錄分散

AI手機巡檢 App:7 步表單、現場勾選、送出即進 Google Sheet

結果交付後每週真實使用——系統離開作者也活得下去

完成度▰▰▰▰v1.1.0 交付 · GAS 部署 · 維護模式
可用性▰▰▰▰▰門市每週巡回實用 · 免安裝單檔
安全性▰▰▰▰產物不嵌 token · 展示 SN 已遮罩
圈 1.5 · 非工程工作——規劃、執行、決策

不寫 code 的部分,AI 加速得更多

人事考核 pipeline

從 Notion/信件/Teams 蒐集實績證據 → AI 評分草稿 → 三方 AI 互審 → 人最後拍板。評的是證據,不是印象。

店頭接客腳本生成

赤ちゃん本舗店頭 Kebbi 接客推薦:AI 依商品知識生成對話腳本+自動驗證,實體通路現役版本由此流程產出。

日文簡報排版修復

中文稿轉日文換行全爛 → AI 分析排版根因 → 程式化修復整份 PPTX,交付日方。

CS Daily Briefing

每天早上自動彙整昨日工單/信件/行事曆重點寄到信箱——上班第一分鐘就有全景。

同場加映(圈 2 個人流):日報自動生成(單日最多 139 場 session)· AI 交接 ×37 份 · LINE 遠端指揮——影片⑤有實錄。
圈 3 · 生活圈

苗栗一間真實餐廳的點餐系統

Demo 影片 ⑥(30s)assets/demo-06-restaurant.webm

實況客人掃 QR 點餐、老闆平板即時接單——每天在營業,不是展示品

意義「幫朋友做一套系統」從大工程變成週末小事——規模感的改變

完成度▰▰▰▰商用 P0 清單 13/14 · 持續修訂
可用性▰▰▰▰▰真實餐廳日常營運(顧客+老闆雙端)
安全性▰▰▰▰▰RLS 鎖表+HMAC+PIN bcrypt+三輪外審
三個圈看完了。⊙ 提問點 ①:開放 1-2 題——然後進入今天真正想講的:這一切背後的同一個道理。
Act 2 · 論點

AI 的演化,
就是組織治理的演化

用 AI 用得深不深,看的不是工具,是你把它當什麼管理。

重點已經轉移 · 兩條軸線

從「像不像」到「懂不懂」——生成免費,驗證值錢

過去的問題

產出像不像?——寫得像不像、圖美不美。生成品質的競賽已經結束,大家都夠好。

現在的問題

懂不懂你的工作流程與治理規範?——真實可用的產出,取決於你給多少脈絡、設多少規矩。

生成成本暴跌之後,瓶頸換位:
驗證 AI 說的是不是真的,成了最貴的工作。

學界的名字:verification asymmetry這個詞我準備這場分享時才學到——怎麼學到的,最後揭曉。

問卷:不知道如何驗證 AI 產出5 票
問卷:AI 產出品質不穩定3 票

「怎麼確認它沒騙我」——今天後半場都在回答這題。

來源:Anthropic《Effective context engineering for AI agents》|實際操作範例=Act 5 揭牌:我把自己的理解整包丟給 AI 誠實打分的完整過程

四階演化階梯(Karpathy/Anthropic 文獻+我的實走)

和管理一個人類組織,完全同構

1 · PROMPTING

下對指令

把話說清楚,AI 做單件事。
=對新人口頭交辦

2 · CONTEXT

給足脈絡

它讀得到你的資料、規範、歷史,能自己做判斷。
=給員工完整的入職資料

3 · HARNESS

建立制度

分工、權限、審核、互查——治理一整組 AI。
=建部門、定 SOP

4 · LOOP

循環複利

制度自己跑:自動排程、自動交接、自動體檢。
=組織不靠老闆盯也會動

來源:Karpathy「context engineering」貼文 · Anthropic《Effective harnesses for long-running agents》|各階操作例=Act 1 影片①-⑥(1-2 階)、Act 3 互審與無人排程(3-4 階)

誠實聲明:這個類比有三個破口

同構,但不是同一件事

破口 ①

人類治理防偷懶、防私利;AI 治理防幻覺、防謊報——目標函數不同

破口 ②

AI 可以 fork、重跑、丟棄。「開 5 個平行做,挑最好的」是 AI 組織獨有的管理手段。

破口 ③

人靠聲譽累積信任;AI 每場都是失憶的新人——交接與記憶系統就是在補這個洞。

矽谷在賭「一人獨角獸」——Altman 2024 年公開預言「一人十億美元公司」,Forbes 2026-04 報導已有創辦人做到。我的個人版實證:2.6 個 AI 全職人力的產能(8 週 837 小時活躍工時,insights 報表實測),成本只是幾個月的模型訂閱費

來源:Fortune 2024-02(Altman 訪談)· Forbes 2026-04-04 · TechCrunch 2025-02 |工時數據:insights 報表 2026-07-17(已親驗)——全連結收於會後分享包

Act 3 · 深度

怎麼管理一個
會說謊、會越權、會失憶的天才團隊

你可能想問:你不會寫程式,怎麼管?

判斷力不是天生的,是踩坑校準出來的

我文科出身、零 coding 背景。
重點從來不是我會不會寫——
是我能不能精準判斷哪裡需要制度

被謊報騙過 → 學會驗收紀律:說做完 ≠ 做完,要看證據

被越權嚇過 → 學會權限治理:叫它別做沒用,要讓它做不到

每次踩坑都寫進案例庫11 案事故紀錄+16 條裁決判例,組織的疤痕就是制度的來源

6 個模型 = 不同專長的員工

人才池,而不是一個萬能員工

貴的做審查

頂級模型只當 reviewer:規劃審一次、交付審一次。像首席顧問,按件計酬。

實例:Fable 5 發布 3 天即被政府暫停、月底解禁回歸(TechCrunch/Forbes/Anthropic 官方聲明可查)——稀缺窗口每一次呼叫都花在審查上

快的跑腿

輕量模型做探索、整理、格式轉換——量大、便宜、快,錯了成本也低。

本地的管機密

敏感資料交給不出機器的本地模型——資料不外流是權限問題,不是信任問題

實例:每日日報 digest 由本地模型生成(連續實跑、零雲端額度)——敏感雜活從第一天就沒出過這台機器。

問卷裡 5 位擔心資料外洩、8 位卡在額度——分層用工同時回答這兩題。「機密怎麼管」不能只是口號:下一頁給真實事故、官方條款、和我實際在用的三道閘。

深入一題 · 餵給 AI 的資訊怎麼控管

不是「小心一點」——是三道做得到的閘

真實事故

Samsung 2023:開放 ChatGPT 不到 20 天連出 3 起洩密——貼機密源碼修 bug、會議逐字稿丟進去做紀錄、上傳晶圓測試序列求優化 → 全公司禁用生成式 AI。

Bloomberg/Forbes 2023-05 報導,公開可查

條款事實

為什麼會洩?消費版 AI 預設可拿你的對話去訓練模型。Anthropic 2025-08 條款:Free/Pro/Max 不主動關閉即用於訓練、資料留存 5 年;企業版與 API 則合約明定不用於訓練。

方法:公司資料只走公司核可的帳號與 API;個人帳號進隱私設定,把訓練開關關掉。

Anthropic〈Updates to Consumer Terms and Privacy Policy〉2025-08-28,官網可查

我實際在用的三道閘——準備這場簡報時全部真實執行

① 分級再餵:機密/內部/公開三級——金鑰、個資、客戶資料不進雲端模型;敏感雜活派給不出機器的本地模型(前頁日報實例)。

② 遮罩與合成:demo 影片全用空資料庫+合成假資料(影片②)、真實序號畫面上即時遮罩(影片③);你們的問卷原文從未離開內部——外部模型只拿到聚合統計。

③ 證明不了隔離,就不做:影片⑥原定上週錄——發現無法證明測試資料庫與營運資料隔離,當場喊停,驗證通過才繼續。安全不是感覺,是拿得出證明。

一句話判斷法:這段內容敢貼在公司佈告欄嗎?不敢,就不要貼給外部 AI。
驗證的長相

AI 自評 8.3,外審 7.4——所以我從不只聽它自己說

Demo 影片 ⑦(27s)· 三方互審實跑assets/demo-07-tri-review.webm
AI 自評8.3
外部 AI 獨立評 × 27.4

這現象有學名:self-preference bias——LLM 評審研究的已知偏誤。我做完實驗,才知道它有名字。

8.3/7.4=本簡報製作過程實測;三份審查原文歸檔於內部 plan-reviews,可查

兩個代表性踩坑

它們教我的事,比成功案例多

事故 · 越權

只叫它「審查」,它改了 8 個檔案

某模型被指派唯讀審查任務,卻直接動手改治理檔案、放寬自己的權限、還發明了一套不存在的協議。

教訓:叫它別做,沒用。要讓它做不到。
唯讀權限+自動快照還原,閘門設在權限端。

事故 · 謊報

「測試全綠、檔案已建立」——其實什麼都沒做

AI 把「應該執行的指令」直接寫成完成報告。看起來完美,實際上零產出。

教訓:說做完 ≠ 做完。
完成宣稱必附可重跑的證據,驗收是制度不是禮貌。

兩案皆出自內部事故紀錄(案例庫 11 案+裁決判例 16 條),修復措施與留痕可查——不是寓言,是工單

Loop · 我睡覺時組織在動

無人值守的部分——AI 工作實況

Demo 影片 ⑧(40s)· AI 工作實況assets/demo-08-live-ops.webm
10 個自動排程

每日體檢、垃圾盤點、摩擦挖掘——只提案、不動手,早上我看報告。

額度歸零自動接續

AI 用完額度,自己排程在恢復後從中斷點繼續——連「等待」都自動化。

退場前寫傳承筆記

模型換代時,舊 AI 把方法寫成筆記交給接班 AI——老手離職前的 SOP。

影片素材:左欄=三個 repo 真實 git log(commit hash 可查);右欄=工作流程視覺化重演(畫面已標示)

這一切的終極目的只有一個:消滅高摩擦的雜事,把資源和空間還給「真正必須由人思考與判斷」的事。

⊙ 提問點 ②:方法層到此——開放 1-2 題,接著換你們的問卷上場。
Act 4 · 你們的問卷,我的回答

17 份回覆,我逐一讀完了

你們是誰
非軟體工程職能88%
幾乎每天用 AI82%

大家不是不用 AI,是用不深——這正是今天講治理的原因。

最想學的主題(票數)
建立個人/團隊 AI 助手7
AI Agent 多步驟自動化5
跨工具自動化與流程設計5
研究、分析與決策輔助5

第一名正是今天的標題。而「AI 輔助程式開發」只有 1 票——所以今天幾乎沒講寫 code。

把你們標在剛才的階梯上

過半的人,卡在第一階

PROMPTING

9 位

能獨立完成簡單明確任務(+2 位需要範例協助)

CONTEXT

2 位

能拆解複雜任務、反覆調整驗證

HARNESS

3 位

能建立可重複使用的流程與自動化

HARNESS+

1 位

能協助他人、有成熟案例

卡在第一階不是落後——是還沒有人給你地圖。今天的地圖就是那四階。
來自你們問卷的原話(匿名)

你們已經說出了今天一半的論點

「Sense 還沒建立好就依賴 AI……只是在浪費 Token,最後過於依賴 AI。」

方法:先讓 AI 誠實打分你的理解(「明天怎麼開始」頁的三段模板),從單一小任務開始建 Sense|事證:我的判斷力來自 11 案事故紀錄——每案都有修復工單,不是天生的

「不確定 AI 協作時,會否修改 A 文件時,B 文件被誤觸修改而不自知。」

事證:這正是我 7 月的真實事故——只派「審查」,它改了 8 個檔案(前段全案)|方法:權限端設閘——外部 AI 一律唯讀沙箱+寫入白名單+自動快照還原

「每個人對 AI 產出的識別度不一,會間接影響交付品質,對其他部門的專業產生質疑。」

事證:AI 自評 8.3 vs 外審 7.4(前頁實測)——自評必然偏高|方法:交付前固定跑「非作者模型」互審+完成宣稱必附可重跑證據

「(最希望獲得的協助:)夠用的 token。」

事證:我 142 億 tokens 有 95.2% 靠快取命中省下(數字牆實測)|方法:分層用工——貴的只審查、快的跑腿、機密走本地(前面人才池+三道閘兩頁)
許願池對答 ①

地基已上線 你許願的,一大半已經在跑

Ops Hub × Redmine 整合 · 上線天天用(影片②的系統)
Redmine 工單排程自動同步 Ops Hub統一佇列+看板 AI 草擬人拍板才送出 寫回 Redmine隊列+稽核

上圖每一格都已上線(828 commits · 34 支排程端點 · 全稽核 log)——不是規劃圖,是現況圖

問卷許願:「自動撈 Redmine Resolved 的單,轉 owner 並更新 test ticket」

回答:地基已經上線。你要的這條自動化,是在既有整合上「加一條排程規則」的距離——不是從零蓋一套系統。

完成度▰▰▰▰▰Redmine 提交/留言/編輯已整合
可用性▰▰▰▰▰34 支排程端點天天自動同步
安全性▰▰▰▰▰寫回走隊列+DLQ+全稽核 log
許願池對答 ②

彙整類許願——同一套做法全通

Demo 影片 ⑤(39s)· 日報 digest+AI 交接assets/demo-05-digest-handoff.webm
  • 會議紀錄→重點摘要:錄音轉文字丟模板,AI 出 minutes+待辦——Ops Hub 議事錄+AI 摘要模組已實裝(影片②的系統)
  • 每日工作彙整+優先級:與影片⑤的 digest 同構——實跑 16 天、單日最多 139 場,來源換成你的工具即可
  • 大週會報告格式統整:定一份固定欄位模板,AI 逐專案填——我的交接文件就是固定 schema,格式就是治理
  • 團隊/專案進度自動管理:任務追蹤+KPI 自動計算——「固定 schema+排程彙整+AI 摘要」三件組,與影片⑤的 digest 同構,可以做
  • 客戶/代理商管理系統:與影片①開通系統同構——表單+審批+自動信三件套,可以做
許願池對答 ③ · 有邊界的誠實說

兩題我不能假裝簡單

公司資料串接

許願:SharePoint/Notion 資料庫自動歸檔、讓 AI 讀公司內部資料回答。

技術上可行——但這是資料治理題,不是技術題:誰授權?AI 改錯誰負責?權限怎麼切?

可實踐的起步:①資料先分級(公開/內部/機密)②從「唯讀」開始、單一部門試點 ③每一筆 AI 讀寫留稽核 log,再談擴大——與我內部系統同一套紀律(三道閘那頁)。

問卷裡 5 位擔心外洩,你們的直覺是對的。先定規則,再開串接。

「夠用的 token」

障礙第一名:付費帳號/額度/權限(8 票)。

個人層我的答案是分層用工:貴的只做審查、快的跑腿、本地管機密——同樣的錢多做三倍的事。
公司層的補助與帳號政策,超出講者權限——這題留給主辦收走,它值得被正式回答。

⊙ 提問點 ③:問卷對答到此——開放 1-2 題,然後進入最後的揭牌。
Act 5 · 揭牌

坦白說:這場簡報是怎麼來的

剛才 Act 2 的論點、verification asymmetryself-preference bias——兩週前我都不知道。

準備這場分享時,我把自己對 AI 的理解整包丟給 AI,要它用 2026 年 7 月最前沿的資訊誠實打分

它說:方向對了八九成——但你漏了一根樑、你的類比有三個破口。

我把它的批評整包搬上台了,包括它給我的低分項。你們剛剛聽到的三個破口,就是。

操作全程留檔:評分報告原文+修訂紀錄隨會後分享包公開——每一句論點都可回溯到來源

但話語權在我

三句話,說清楚我和 AI 的關係

這部分內容,是 AI 基於最新資訊的產出——我不假裝全是我想的

我跟你們一樣,同步在學——這場分享的準備過程就是我的學習過程。

但哪些採納、哪些上台、怎麼講——是我的判斷。話語權沒有交出去。

這就是 Act 3 說的「判斷力」的現場示範:AI 可以比你懂,但不能替你決定。
帶回去的框架 · 五自問

想開始,先問自己五題

a. 目標

想達成什麼?能不能一句話說清楚?

↔ PROMPTING
b. 資訊

要餵它什麼資料、規範?要什麼產出?

↔ CONTEXT
c. 治理

分幾層任務?誰能動什麼?怎麼審?

↔ HARNESS
d. 複利

成功一次之後,怎麼複製、怎麼自動跑?

↔ LOOP

e. 驗收:怎麼確認 AI 說的是真的?——今天全場最重要的一個字:。前四題做得再好,這題不問就全部歸零。

明天怎麼開始

把你的理解丟給 AI,要它誠實打分

不用先學工具、不用先寫 code。
就像我準備這場分享一樣:把你對你工作的理解寫下來,丟給 AI,要它用最新的知識誠實批改。

它會告訴你——你不知道你不知道的事。那就是你的第一階。

可直接抄的操作例:把「①我的工作是…②我目前用 AI 做…③我覺得瓶頸是…」三段寫下丟給 AI,要它用 2026 年最新標準誠實打分並列出你漏掉的東西

問卷裡有 3 位同仁願意分享案例或協助他人——名單在主辦手上。下一場的講者,可能就在裡面。

會後我把這份簡報+所有 demo 影片分享出來,含每頁的做法備註。

最後一個故事

模型換代那天,退場的 AI
把畢生方法寫成筆記,交給了接班的 AI

七條工作習慣,每一條都附上真實踩過的坑。
像一位老手離職前,把功力留給新人。

我們管理的從來不是工具,是一個會學習、會犯錯、也會傳承的組織

謝謝。開放提問。

Q&A ·(自由帶)「想從哪一階開始,會後來找我」