国产98在线 | 传媒麻豆,久久―日本道色综合久久,久久久精品久久久久久久久久久,国产成人精品免费久久久久,五月综合色婷婷影院在线观看,久久久亚洲精品视频

  • 虎科技 - 領(lǐng)先的互聯(lián)網(wǎng)科技媒體

蘋果AI研究引爭議:LRM推理極限還是評估方法有誤?

   時間:2025-06-17 05:57 來源:ITBEAR作者:馮璃月

近期,科技界圍繞蘋果公司一篇關(guān)于人工智能的論文展開了激烈討論。這篇題為《思維的錯覺》的論文,由蘋果公司于6月6日發(fā)布,迅速引起了專家們的關(guān)注與爭議。

論文中,蘋果公司提出一個核心觀點:即便是目前最頂尖的大型推理模型(LRMs),在面對復(fù)雜任務(wù)時也會遭遇崩潰。然而,這一結(jié)論隨即遭到了Open Philanthropy研究員Alex Lawsen的有力反駁。Lawsen認(rèn)為,蘋果的結(jié)論更多地反映了實驗設(shè)計的瑕疵,而非模型推理能力的固有缺陷。

爭議的核心聚焦于蘋果論文中的一個具體案例:即便是最先進的大型推理模型,在處理如漢諾塔問題這樣的復(fù)雜遞歸算法任務(wù)時,也會徹底失敗。漢諾塔問題是一個經(jīng)典問題,要求將一系列大小不同的圓盤從一個柱子移動到另一個柱子,且需遵循特定規(guī)則。

針對這一觀點,Alex Lawsen撰寫了一篇題為《思維錯覺的錯覺》的反駁文章。他指出,蘋果的研究混淆了輸出限制和評估設(shè)置的問題,從而得出了誤導(dǎo)性的結(jié)論。Lawsen詳細(xì)列舉了三大問題來挑戰(zhàn)蘋果的結(jié)論。

首先,Lawsen強調(diào)蘋果忽略了模型的Token預(yù)算限制。在處理超過8個圓盤的漢諾塔問題時,一些模型如Anthropic的Claude Opus,已接近其輸出極限,甚至因節(jié)省Token而停止輸出。其次,蘋果的過河測試中包含了一些無解謎題,模型因拒絕解答而被判定為失敗,這顯然是不公平的。最后,蘋果的自動化評估腳本過于僵化,僅將完整步驟列表視為成功標(biāo)準(zhǔn),未能區(qū)分推理失敗與輸出截斷,導(dǎo)致部分策略性輸出被誤判。

為了證明自己的觀點,Lawsen重新設(shè)計了漢諾塔測試,要求模型生成遞歸Lua函數(shù)來打印解法,而非逐一列出步驟。結(jié)果令人震驚:Claude、Gemini和OpenAI的o3模型均能正確生成15個圓盤問題的算法解法,遠超蘋果報告中“零成功”的復(fù)雜性界限。

Lawsen還指出,在去除人為輸出限制后,LRMs展現(xiàn)出了處理高復(fù)雜任務(wù)的推理能力,至少在算法生成層面是如此。這表明,問題可能并不在于模型本身,而在于評估方式。這一發(fā)現(xiàn)無疑為人工智能領(lǐng)域帶來了新的思考和啟示。

為了更直觀地展示其觀點,Lawsen還提供了其他測試結(jié)果的對比圖,進一步證明了其論點的合理性。

此次爭議不僅揭示了人工智能研究中的復(fù)雜性和挑戰(zhàn),也再次強調(diào)了科學(xué)評估方法的重要性。隨著人工智能技術(shù)的不斷發(fā)展,如何更準(zhǔn)確地評估模型的推理能力,將成為未來研究的重要方向。

 
 
更多>同類內(nèi)容
推薦圖文
推薦內(nèi)容
點擊排行
 
智快科技微信賬號
ITBear微信賬號

微信掃一掃
加微信拉群
電動汽車群
科技數(shù)碼群

主站蜘蛛池模板: 影片 - theporn| 九九精品国产99精品 | 亚洲欧洲精品成人久久曰 | 日本成本人观看免费fc2 | 久久精品国产99久久久 | 免费国产最新进精品视频 | 这里只有精品在线 | 自拍网址 | 中文国产成人久久精品小说 | 亚洲男人的天堂成人 | 亚洲免费黄色 | 亚洲视频高清 | 无遮免费网站在线入口 | 精品欧美一区二区三区精品久久 | 亚洲自偷精品视频自拍 | 丁香婷婷网 | 日韩视频网 | 欧美日本一区亚洲欧美一区 | 久久91精品久久久久久水蜜桃 | 手机视频在线 | 日本一区二区视频在线 | 婷婷综合在线观看丁香 | 在线视频网址免费播放 | 在线看片亚洲 | 亚洲一级生活片 | 久久精品国产精品亚洲精品 | 最新亚洲手机在线人成网站 | www.99视频 | a级高清观看视频在线看 | 国产精品v欧美精品∨日韩 国产黄色免费看 | 亚洲天堂视频在线播放 | 亚洲国产成人久久综合野外 | 亚洲视频中文字幕在线 | 亚洲视频在线一区 | 国产福利专区精品视频 | 日韩在线成人 | 不卡国产视频 | 五月深爱婷婷 | 日韩欧美色视频 | 亚洲视频福利 | 最近国语高清视频在线播放 |