
這個問題我覺得有一個很有意思的地方大家未必認為 ChatGPT 比 Gemini 更容易“降智”但一旦 ChatGPT 表現變差用戶的反應往往明顯更大。為什么我覺得最核心的原因不是模型跑分而是大家對 ChatGPT 的期待太高了。一個你本來覺得考60分的人這次考55分你可能沒什么感覺。但一個長期考95分的人突然連續幾次考75分你第一反應一定是“你最近怎么了”ChatGPT現在面對的差不多就是這個問題。ChatGPT最大的問題是它曾經把用戶胃口養得太高很多人第一次真正被大模型震撼就是ChatGPT。2022年底剛出來的時候那種感覺現在可能很難復現了。以前搜索一個問題自己找網頁。自己看資料。自己判斷。ChatGPT出來以后你突然發現我可以直接和電腦討論問題了。后來模型越來越強推理、圖片、文件、搜索、Deep Research、Codex這些能力又不斷往里面加。于是用戶對ChatGPT的定位慢慢變了。以前是“AI能回答成這樣已經很厲害了。”現在變成“你可是ChatGPT這都不會”這句話其實很能說明問題。ChatGPT已經不是在和2022年的AI比較了。它是在和**用戶記憶里那個“狀態最好時的ChatGPT”**比較。這才是最麻煩的。Gemini的歷史包袱反而沒那么重Gemini其實也會答錯也會出現前后不一致也有一些回答讓人覺得莫名其妙。但用戶對它的心理預期不太一樣。尤其早期Bard時期很多人本來就覺得“Google這個AI好像沒有ChatGPT那么驚艷。”后來Gemini一點點追上來反而形成了另一種心理Gemini這次回答不錯“可以啊Google最近進步挺大。”ChatGPT這次回答一般“OpenAI是不是又降智了”你會發現同樣一個80分的回答放在兩個產品身上用戶評價可能完全不一樣。因為一個是從70分走到80分。另一個在人們印象里可能是從95分掉到了80分。人的感受從來不是只看絕對值。更看重變化。還有一個原因很多人是真的花錢訂了ChatGPT這個影響其實很大。如果一個產品免費你偶爾遇到一次回答不好可能關掉就算了。但ChatGPT有大量Plus、Pro用戶。尤其是Pro用戶每個月付的錢并不少。一旦付費心理就完全不同了。比如昨天同一個Prompt回答特別好。今天突然變得特別敷衍。用戶當然會想“我每個月付這么多錢為什么體驗還倒退了”這種憤怒并不完全來自“AI變笨”。而是來自付費以后產生的穩定性預期。你可以想象一下。一家餐廳免費請你吃飯。今天味道一般你可能覺得算了。但如果一家餐廳人均500塊第一次特別好吃第二次明顯變差你大概率會吐槽。不是第二頓真的難吃到不能吃。而是我付的錢和我的期待不匹配了。ChatGPT還有一個特別吃虧的地方大家天天在測它網上測試AI模型有一個很有意思的現象。一個新模型出來以后很多人第一件事就是拿以前ChatGPT答過的問題再問一次。然后開始比較“GPT-5.6這次怎么回答得還不如以前”“這個問題GPT-4當年都能答。”“是不是偷偷換模型了”ChatGPT已經變成了某種意義上的“基準”。大家拿Claude和它比。拿Gemini和它比。拿DeepSeek和它比。甚至ChatGPT的新版本還要和ChatGPT自己的老版本比。所以它特別容易產生“降智”的討論。Gemini很多時候面對的是“這次有沒有超過ChatGPT”ChatGPT面對的是“你為什么沒有超過你自己”后一個要求其實難得多。而且“降智”這件事本來就特別難證明我覺得網上關于AI降智的討論有一部分確實存在體驗依據但也有很多屬于主觀感受。因為大模型不是計算器。同一個問題你問兩次本來就可能得到不同答案。另外還會受到很多東西影響模型路由。推理強度。上下文。系統指令。是否聯網。工具調用。對話長度。產品策略。甚至你Prompt里面一個詞的變化。所以你昨天問一道題答得很好今天答差了并不能直接證明“OpenAI把模型智商砍了20%。”但用戶不關心這些。用戶看到的就是昨天能做今天做不好。那最直觀的解釋當然就是“降智了。”還有一個經常被忽略的問題ChatGPT已經不只是一個模型了現在很多人嘴里的“ChatGPT”其實混合了很多東西。模型是一層。推理等級是一層。搜索是一層。工具是一層。Codex又是一層。系統還可能根據任務選擇不同的處理方式。所以有時候用戶覺得“ChatGPT怎么突然變笨了”未必真的是底層模型能力下降。也可能是這一次沒有投入同樣的推理資源或者任務被用不同方式處理了。這也是為什么我現在越來越不建議拿一個Prompt測試一次就宣布某個模型降智。至少同一個問題測試幾次再換幾個不同類型的問題結論才稍微有參考價值。Gemini為什么相對少挨這種罵還有一個很現實的原因很多人的主力工具本來就不是Gemini。這點非常重要。假設你每天使用ChatGPT三個小時。寫文章用它。寫代碼用Codex。查資料用它。分析PDF也用它。突然有一天它某個能力發生變化。你馬上就能感覺出來。但如果Gemini你一周才打開兩次。它今天比昨天差5%你根本察覺不到。這和手機一樣。你每天用的主力手機掉10%續航你會特別敏感。備用機掉20%可能半年以后你才發現。所以一個產品被罵“降智”多有時候反而說明它已經進入了大量用戶真正的工作流。我甚至覺得“降智罵得兇”某種程度上是ChatGPT成功的副作用這可能聽起來有點奇怪。但你仔細想。如果明天一個沒人用的AI模型能力下降20%網上會有人罵嗎不會。因為根本沒人發現。只有當一個工具變成程序員每天寫代碼要用。學生每天學習要用。自媒體每天寫東西要用。公司每天處理資料要用。它的一點變化才會被迅速放大。這和Windows更新一樣。Windows每次更新出點問題網上一片罵聲。不是因為全世界只有Windows有Bug。而是因為太多人每天依賴它。當然這不代表所有“ChatGPT降智”都是用戶錯覺我也不贊成另外一種極端說法“模型跑分提高了所以你覺得變笨一定是你的問題。”這也不合理。跑分提升和真實使用體驗本來就不是完全一回事。一個模型可以在數學、代碼、科學測試上越來越強同時因為回答風格、路由策略、推理資源或者產品調整讓某些用戶覺得日常任務反而沒有以前順手。能力更強不等于每一種任務的體驗都更好。這點其實很重要。用戶最終使用的是產品不是Benchmark表格。你告訴我新模型跑分高了15%但我每天做的那件事情反而更難用了那對于我來說這就是體驗下降。所以為什么大家更厭惡ChatGPT“降智”我覺得說到底就是四個字期待太高。ChatGPT是很多人的第一款AI。也是很多人的主力AI。還有大量用戶每個月真金白銀給它付費。大家已經習慣了它不斷變強。于是它一旦表現得沒有以前好哪怕只是某些場景下的波動用戶都會非常敏感。Gemini則有點相反。它早期沒有把用戶期待拉到那么夸張的高度后來能力一路往上走用戶更容易產生“它越來越好了”的感覺。所以同樣一次回答失誤Gemini“這次沒答好。”ChatGPT“是不是又降智了”我覺得這可能才是兩者最大的區別。用戶真正厭惡的從來不是一個AI“不夠聰明”。而是一個你已經習慣它很聰明、甚至開始依賴它的AI突然沒有昨天那么聰明了。從這個角度看大家天天罵ChatGPT降智某種程度上反而說明了一件事很多人已經不是在“體驗ChatGPT”了而是真的在依賴ChatGPT。