DeepSeek 揭視覺推理新架構「邊指邊想」技術超越主流多模態模型

人工智慧多模態技術再迎突破。DeepSeek於4/30日發布最新技術報告《用視覺原語思考》(Thinking with Visual Primitives),首度完整揭露其新一代識圖模型架構,提出「邊思考邊指認」的創新推理方式,為視覺理解能力帶來關鍵升級。
此次公開的模型參數規模高達2840億,啟動參數為130億,基於DeepSeek-V4-Flash打造,未來將整合至基礎模型體系中統一發布。相較過去多數模型強調「看得更清楚」,透過提高解析度與圖像切分提升辨識能力,DeepSeek則直指核心問題,語言在描述空間時存在「指代不清」的天然限制。

https://pse.is/8zvuqh

#AI模型 #電腦視覺 #Gemini #Claude #GPT-5 #人工智慧技術 #視覺推理 #AI多模態 #DeepSeek #生成式AI #MGBOX #中華雲新聞網
DeepSeek 揭視覺推理新架構「邊指邊想」技術超越主流多模態模型 人工智慧多模態技術再迎突破。DeepSeek於4/30日發布最新技術報告《用視覺原語思考》(Thinking with Visual Primitives),首度完整揭露其新一代識圖模型架構,提出「邊思考邊指認」的創新推理方式,為視覺理解能力帶來關鍵升級。 此次公開的模型參數規模高達2840億,啟動參數為130億,基於DeepSeek-V4-Flash打造,未來將整合至基礎模型體系中統一發布。相較過去多數模型強調「看得更清楚」,透過提高解析度與圖像切分提升辨識能力,DeepSeek則直指核心問題,語言在描述空間時存在「指代不清」的天然限制。 https://pse.is/8zvuqh #AI模型 #電腦視覺 #Gemini #Claude #GPT-5 #人工智慧技術 #視覺推理 #AI多模態 #DeepSeek #生成式AI #MGBOX #中華雲新聞網
Like
1
0 留言 0 分享 95 瀏覽次數 0 評論
MGBOX https://magicbox.mg