給 Token,好辦事
語言型 Agent 和功能型 Agent 是不同物種——把需要影片的任務交給只會說話的 Agent,你只會一直等一個不夠好的輸出。
你有沒有試過讓 Agent 做一件本來要花兩小時的事,結果它給你的東西讓你花了四小時修?
不是 Agent 不聰明。是你把「需要影片的任務」給了「只能說話的 Agent」。你在要求一位文案寫手剪片。
很多人搭 Agent 系統的時候,腦子裡只有「哪個 LLM 比較聰明」。但 Agent 的世界遠不只是語言模型——語言型 Agent 和功能型 Agent 是不同物種,混著用沒有章法,你就會一直在等一個永遠不夠好的輸出。
你的 AgentBML 團隊,是 LLM Agent + 專項功能 Agent 的組合。老闆的工作,是知道哪種任務配哪種 Agent。
你的系統全速運作,是這個樣子
想像本週的內容產出流程——
你要測三個 Blog 方向。DeepSeek 跑三篇草稿,成本幾乎零。草稿出來,你花十分鐘選出最有潛力的,交給 Claude Code 做高品質定稿。同時,主視覺需要一張圖,ChatGPT Image 接手。背景音樂這週要一首輕量的,Suno 兩分鐘出一首。
整個週期你做了什麼?選方向、確認品質、做決定。
每個輸出都有對應的 Agent 負責,每個 Agent 在最適合它的任務上工作。
兩大類 Agent
語言型 Agent(LLM-based):處理文字、分析、推理、策略。你的 AI CEO 屬於這類,Builder、Reporter、Measurer 也大多是。Token 是它們的燃料,Token 費率決定成本。
專項功能 Agent(Function-specific):不靠 LLM 推理,靠專門訓練執行特定任務——生影片、生圖、生音樂。計算的是 GPU 時間或 API 呼叫次數。程式碼執行和瀏覽器操作,Claude Code 和 Codex 已經完整涵蓋。
語言型 Agent 的三層架構
按能力和成本分三層,根據任務複雜度配對:
第一層:開源模型。 成本極低,本機跑幾乎免費。適合高頻、重複、格式固定的任務:數據格式化、訊息分類、模板填充。量再大都不會失控。
第二層:經濟型模型(如 DeepSeek)。 比主流商業模型便宜 5 到 10 倍,中文能力強,是日常工作流的主力。寫草稿、初步分析、提供選項——需要判斷但不是最終決策的任務,這層夠用。
第三層:主力模型(Claude Code + Codex)。 你的 AI CEO 和核心執行的所在。複雜推理、關鍵策略決策、高品質輸出、整個 AgentBML 系統的協調。這裡不要省——但也只用在值得用的地方。
專項功能 Agent:你的創作與執行手
語言模型說得再好,做不出一支影片。
影片生成:開源模型(如 Wan、LTX 系列)本機部署成本低,適合大量生成測試素材;商業選項(Sora、Runway、Kling)品質更高但按秒計費,適合最終版本。
圖片生成:ChatGPT Image 品質強、指令理解精準,適合對外的關鍵視覺;Google 的圖像工具適合大量生成或 Google 生態系整合。
音樂與語音:Suno / Udio 生成完整歌曲,適合背景音樂和內容配樂;ElevenLabs 做語音合成,適合 Podcast、課程配音、影片旁白。
老闆的任務分配邏輯
這個任務需要語言、推理、程式碼、瀏覽器操作?
→ 是:語言型 Agent(按三層架構選模型)
→ 否:需要影片? → 開源測試 / 商業出最終版
需要圖片? → 高品質用 ChatGPT Image,批量用整合工具
需要音樂或語音? → Suno / Udio / ElevenLabs
把這個邏輯寫進你的 Boss Engineering SOP,AI CEO 調兵的時候就有依據——不需要每次你來決定,系統根據任務類型自動配對。
開源優先的成本邏輯
一個對老闆有利的原則:測試和大量生成用開源,最終版本用商業。
BML 的 Build 環節,很多時候在生成大量測試素材——10 個 Blog 方向的草稿、5 種影片風格、20 個標題選項。這些用開源跑,成本幾乎為零。
Learn 環節確認了哪個方向有效,才把最終版本交給商業模型做高品質輸出。
你的商業 API 費用,集中在已經驗證有價值的內容上——而不是在無數個沒有結果的測試上燒錢。
今天的第一步
列出你的業務每週需要生產的所有類型的輸出:文字、圖片、影片、音頻、數據報告、程式碼……
對每一類問自己:現在是我自己做,還是已經有 Agent 在做?如果是自己做,哪類 Agent 能接手?
把這張清單帶到 Claude Code,讓它為每類任務推薦對應的工具——開源還是商業、哪個模型、大概的成本。
這張清單,就是你 AgentBML 團隊完整招募計劃的起點。