九月初的那個禮拜,我的社群動態被同一件事洗了四次版。Anthropic 先發,隔天 Meta 跟 Google 幾乎同時跟上,再隔一天 OpenAI 又推出新模型,說是自家最強、最對齊的一版。四十八小時內,四家大廠輪番上陣,連財經媒體都開始用「模型疲勞」這個詞,形容採購方跟一般使用者被這種節奏搞得暈頭轉向的狀態。

我看著這一連串新聞,做了一件可能有點掃興的事。我一個都沒換。

追新焦慮的根源

倒不是我對新東西沒興趣,而是我發現自己每次想換模型的衝動,背後的念頭幾乎都一樣。這個新模型是不是比較厲害,換了會不會讓我的東西變好。這個念頭聽起來合理,仔細拆開來看,裡面卻藏著一個誤會。

我把「用哪個模型」誤當成了 Direction,以為只要換一個更強的引擎,產出自然就會更好。可是 DEL 框架裡的 Direction 講的從來就不是用什麼工具,而是你要拿到什麼結果、給誰用、達成什麼。模型只是執行的手,手再厲害,你沒把要去哪裡講清楚,它也只能繼續在原地打轉,換一隻更靈巧的手,打轉的姿勢好看一點而已。

我在《DEL 的 D 填了還是歪?》那篇裡用週報當例子示範過這件事,同一個道理放到模型選擇上一樣成立。你可以拿同一個任務,換三個不同的模型跑一遍,如果一開始給的 Direction 本來就模糊,三個模型交出來的結果,八成一樣模糊,只是模糊的方式不太一樣。真正決定產出好壞的,常常是你有沒有把要拿到的結果講清楚,引擎等級反而是其次。

路標上掛著三個問號吊牌,小人影抬頭思考,遠方發光方塊被路標擋住大半

要不要換,先問自己三個問題

新模型發布的那個當下,我會先停下來,問自己三個問題,再決定要不要花時間研究換不換。

第一個問題,我現在卡住的地方,到底是模型能力不夠,還是我根本沒講清楚要什麼。多數時候我回頭檢查自己的指令,發現卡住的原因是自己的 Direction 或 Expectation 沒寫到位,換再新的模型也救不了一個講不清楚的任務。

第二個問題,新模型解決的問題,是我真的在痛的那個嗎。每次新模型發布,官方都會列出一長串進步的地方,寫程式更快、推理更準、上下文更長。這些進步是真的,但跟我自己手上正在卡關的任務,不見得有交集。如果我平常卡關的地方是任務描述不夠具體,那模型的推理能力再怎麼進步,都對不上症。

第三個問題,換的成本划不划算。換模型不是點一下按鈕就結束,熟悉一套新工具的脾氣、重新調整慣用的指令寫法、確認舊有的自動化流程還能不能接得上,這些都要花時間。這筆時間成本,值不值得換來那一點點能力上的提升,每次都該算一次,不是看到新聞標題就下手。

三個問題問完,多數時候我得到的答案是,先不換,把現有的工具用得更準,比追新更划算。

什麼時候真的值得評估新模型

天秤左邊放沙漏疊、右邊放發光齒輪,天秤微微晃動,一隻手正要調整其中一邊

新模型不是都不值得看,判斷標準只是不該是「它剛發布」,而是幾個比較務實的訊號。

第一個訊號,新模型解決的正好是你長期卡關、而且已經確認不是自己 Direction 沒寫清楚的那個問題。比如你真的需要處理很長的文件,而現有模型的上下文長度一直不夠用,這種情況新模型的進步就直接對上你的需求。

第二個訊號,切換成本很低。如果你的工作流程本來就簡單,沒有複雜的自動化串接,換一個模型頂多是重新適應幾天的介面跟語氣,這種情況不妨試試看,成本可控。

第三個訊號,你已經把現有模型用到某個熟練的高原期,繼續磨已經磨不出明顯差異,這時候換一個新模型,比較容易感受到真正的差別,而不是把新鮮感誤認成進步。

沒有這幾個訊號,追新聞跟著換,多半只是把焦慮誤當成行動。模型疲勞這個現象會一直存在,因為大廠競賽的節奏不會慢下來。但你自己要不要被這個節奏牽著走,決定權還是在你手上。想清楚要拿到什麼結果,比追哪一款模型更新,重要得多。如果你還沒把 Direction 這一格搞清楚,可以從 DEL 框架這篇總覽重新開始。