您好,歡迎到訪!

推理水平對標OpenAI o1!阿里雲開源首個AI推理模型QwQ:數學、程式設計尤為出色

2024-11-29 01:35:03 1

快科技11月28日訊息,今天,阿里雲通義團隊宣佈推出並同步開源了全新的AI推理模型——QwQ-32B-Preview。

評測顯示,預覽版本的QwQ(Qwen with Questions)在科學推理能力上展現出研究生水平,尤其在數學和程式設計領域表現卓越,其整體推理能力可與OpenAI的o1相媲美。

據介紹,QwQ是通義千問Qwen大模型最新推出的實驗性研究模型,也是阿里雲首個開源的AI推理模型。

阿里雲通義千問團隊研究發現,當模型有足夠的時間思考、質疑和反思時,其對數學和程式設計的理解就會深化,基於此QwQ取得了解決複雜問題的突破性進展。

推理水平對標OpenAI o1!阿里雲開源首個AI推理模型QwQ:數學、程式設計尤為出色

在衡量科學問題解決能力的GPQA評測集中,QwQ達到了65.2%的準確率,顯示出其研究生水平的科學推理能力;在AIME評測中,QwQ以50%的勝率證明了其解決數學問題的能力。

在MATH-500評測中,QwQ以90.6%的高分超越了o1-preview和o1-mini。在評估高難度程式碼生成的LiveCodeBench評測中,QwQ答對了一半的題目,在程式設計競賽題場景中也有出色表現。

不僅如此,QwQ在面對複雜問題時,能夠進行深度自省,質疑自身假設,並透過深思熟慮的自我對話,仔細審視其推理過程的每一步。

例如,在解決經典智力題“猜牌問題”時,QwQ透過梳理對話和推演,像個擅長思考的人一樣,並最終得出正確答案。

目前,QwQ-32B-Preview已在魔搭社羣和HuggingFace等平臺上開源,釋出短短几小時,引起全球開發者熱情體驗。

有開發者認為該模型“是完全沒有預料到的瘋狂的躍進”、“今年開源領域最重大的突破”、“讓中國在開源大模型和AI推理上佔據先機”。

不過通義團隊也表示,雖然QwQ展現了強大的分析能力,但其仍是個供研究的實驗型模型,存在不同語言的混合使用、偶有不恰當偏見、對專業領域問題不瞭解等侷限,未來隨著研究深入模型迭代,這些問題將逐步得到解決。

推理水平對標OpenAI o1!阿里雲開源首個AI推理模型QwQ:數學、程式設計尤為出色

文章版權及轉載聲明

本站內容由互聯網用戶自發貢獻,該文觀點僅代表作者本人。本站僅提供信息存儲空間服務,不擁有所有權,不承擔相關法律責任。如發現本站有涉嫌抄襲侵權/違法違規的內容,請發送郵件至舉報,壹經查實,本站將立刻刪除。