全球主要的深度學習有哪幾種?
現代深度學習的架構極為豐富,但若從處理資料的型態與任務目標來分類,全球最核心、最 mainstream 的深度學習模型主要可以分為以下六大主流類別:
1. 卷積神經網路(CNN, Convolutional Neural Networks)
核心特性:專門為空間與圖像資料設計。利用「卷積核(Filter)」在圖片上記滑動提取局部特徵(如邊緣、紋理、圖案),具備高度的平移不變性(Translation Invariance)。
擅長資料:影像、影片、醫療 CT / MRI 影像。
經典應用:人臉識別、自動駕駛物件偵測、車牌識別、醫療影像分割。
代表模型:ResNet、YOLO、EfficientNet。
2. Transformer 架構(當代 AI 的絕對基石)
核心特性:利用自注意力機制(Self-Attention),能夠同時捕捉資料中任意距離之間的關聯性,並且支援大規模的「平行化運算(Parallel Processing)」,徹底解決了傳統 sequential 模型的效能瓶頸。
擅長資料:文本、程式碼、多模態(文字+圖片+語音)、甚至蛋白結構。
經典應用:大型語言模型(LLM)、機器翻譯、ChatGPT/Claude 背後的神經網絡、Vision Transformer (ViT) 影像分析。
代表模型:GPT 系列、BERT、Llama、Claude、Gemini。
3. 循環神經網路與變體(RNN / LSTM / GRU)
核心特性:專門處理時間序列與前後關聯資料。網路內部帶有隱藏狀態(Hidden State),像大腦一樣擁有「短期記憶」,能根據過去的輸入來影響當下的輸出。
擅長資料:時間序列數據、語音、文字。
經典應用:股票價格預測、感測器數據分析、早期語音辨識與機器翻譯(現大多已被 Transformer 取代,但在低算力或即時流式資料處理中仍有應用)。
代表模型:LSTM(長短期記憶網路)、GRU(閘門循環單元)。
4. 生成式模型(Generative Models)
核心特性:目標不是「分類」或「預測」,而是**「創造新資料」**。學習真實資料的分佈後,生成極度真實的文字、圖片、音樂或影片。
三大主流技術:
擴散模型(Diffusion Models):目前 AI 繪圖與影片生成的主流(如 Stable Diffusion, Midjourney, Sora)。
生成對抗網絡(GANs):由生成器與判別器相互博弈演化(如 StyleGAN、DeepFake)。
變分自編碼器(VAE):常用於特徵降維與圖像重構。
5. 圖神經網路(GNN, Graph Neural Networks)
核心特性:傳統神經網路處理網格狀(Grid)資料(如圖片),而 GNN 專門處理非歐幾里得空間的「圖形結構(Graph Data)」(即點與線構成的網絡關係)。
擅長資料:社群網路關係圖、分子結構、金融交易鏈結、知識圖譜。
經典應用:蛋白質結構預測(如 AlphaFold)、社群平台好友/內容推薦、反洗錢與欺詐偵測、新藥開發。
6. 多層感知機與前饋神經網路(MLP / FNN)
核心特性:深度學習中最基礎的「全連接網絡(Fully Connected Network)」。資料單向從輸入層 pass 到輸出層,沒有循環也無卷積。
擅長資料:傳統結構化表格資料(Tabular Data)。
經典應用:用戶流失預測、信用評分、簡單分類與回歸任務。
快速選型對照表
現代深度學習的架構極為豐富,但若從處理資料的型態與任務目標來分類,全球最核心、最 mainstream 的深度學習模型主要可以分為以下六大主流類別:
1. 卷積神經網路(CNN, Convolutional Neural Networks)
核心特性:專門為空間與圖像資料設計。利用「卷積核(Filter)」在圖片上記滑動提取局部特徵(如邊緣、紋理、圖案),具備高度的平移不變性(Translation Invariance)。
擅長資料:影像、影片、醫療 CT / MRI 影像。
經典應用:人臉識別、自動駕駛物件偵測、車牌識別、醫療影像分割。
代表模型:ResNet、YOLO、EfficientNet。
2. Transformer 架構(當代 AI 的絕對基石)
核心特性:利用自注意力機制(Self-Attention),能夠同時捕捉資料中任意距離之間的關聯性,並且支援大規模的「平行化運算(Parallel Processing)」,徹底解決了傳統 sequential 模型的效能瓶頸。
擅長資料:文本、程式碼、多模態(文字+圖片+語音)、甚至蛋白結構。
經典應用:大型語言模型(LLM)、機器翻譯、ChatGPT/Claude 背後的神經網絡、Vision Transformer (ViT) 影像分析。
代表模型:GPT 系列、BERT、Llama、Claude、Gemini。
3. 循環神經網路與變體(RNN / LSTM / GRU)
核心特性:專門處理時間序列與前後關聯資料。網路內部帶有隱藏狀態(Hidden State),像大腦一樣擁有「短期記憶」,能根據過去的輸入來影響當下的輸出。
擅長資料:時間序列數據、語音、文字。
經典應用:股票價格預測、感測器數據分析、早期語音辨識與機器翻譯(現大多已被 Transformer 取代,但在低算力或即時流式資料處理中仍有應用)。
代表模型:LSTM(長短期記憶網路)、GRU(閘門循環單元)。
4. 生成式模型(Generative Models)
核心特性:目標不是「分類」或「預測」,而是**「創造新資料」**。學習真實資料的分佈後,生成極度真實的文字、圖片、音樂或影片。
三大主流技術:
擴散模型(Diffusion Models):目前 AI 繪圖與影片生成的主流(如 Stable Diffusion, Midjourney, Sora)。
生成對抗網絡(GANs):由生成器與判別器相互博弈演化(如 StyleGAN、DeepFake)。
變分自編碼器(VAE):常用於特徵降維與圖像重構。
5. 圖神經網路(GNN, Graph Neural Networks)
核心特性:傳統神經網路處理網格狀(Grid)資料(如圖片),而 GNN 專門處理非歐幾里得空間的「圖形結構(Graph Data)」(即點與線構成的網絡關係)。
擅長資料:社群網路關係圖、分子結構、金融交易鏈結、知識圖譜。
經典應用:蛋白質結構預測(如 AlphaFold)、社群平台好友/內容推薦、反洗錢與欺詐偵測、新藥開發。
6. 多層感知機與前饋神經網路(MLP / FNN)
核心特性:深度學習中最基礎的「全連接網絡(Fully Connected Network)」。資料單向從輸入層 pass 到輸出層,沒有循環也無卷積。
擅長資料:傳統結構化表格資料(Tabular Data)。
經典應用:用戶流失預測、信用評分、簡單分類與回歸任務。
快速選型對照表
全球主要的深度學習有哪幾種?
現代深度學習的架構極為豐富,但若從處理資料的型態與任務目標來分類,全球最核心、最 mainstream 的深度學習模型主要可以分為以下六大主流類別:
1. 卷積神經網路(CNN, Convolutional Neural Networks)
核心特性:專門為空間與圖像資料設計。利用「卷積核(Filter)」在圖片上記滑動提取局部特徵(如邊緣、紋理、圖案),具備高度的平移不變性(Translation Invariance)。
擅長資料:影像、影片、醫療 CT / MRI 影像。
經典應用:人臉識別、自動駕駛物件偵測、車牌識別、醫療影像分割。
代表模型:ResNet、YOLO、EfficientNet。
2. Transformer 架構(當代 AI 的絕對基石)
核心特性:利用自注意力機制(Self-Attention),能夠同時捕捉資料中任意距離之間的關聯性,並且支援大規模的「平行化運算(Parallel Processing)」,徹底解決了傳統 sequential 模型的效能瓶頸。
擅長資料:文本、程式碼、多模態(文字+圖片+語音)、甚至蛋白結構。
經典應用:大型語言模型(LLM)、機器翻譯、ChatGPT/Claude 背後的神經網絡、Vision Transformer (ViT) 影像分析。
代表模型:GPT 系列、BERT、Llama、Claude、Gemini。
3. 循環神經網路與變體(RNN / LSTM / GRU)
核心特性:專門處理時間序列與前後關聯資料。網路內部帶有隱藏狀態(Hidden State),像大腦一樣擁有「短期記憶」,能根據過去的輸入來影響當下的輸出。
擅長資料:時間序列數據、語音、文字。
經典應用:股票價格預測、感測器數據分析、早期語音辨識與機器翻譯(現大多已被 Transformer 取代,但在低算力或即時流式資料處理中仍有應用)。
代表模型:LSTM(長短期記憶網路)、GRU(閘門循環單元)。
4. 生成式模型(Generative Models)
核心特性:目標不是「分類」或「預測」,而是**「創造新資料」**。學習真實資料的分佈後,生成極度真實的文字、圖片、音樂或影片。
三大主流技術:
擴散模型(Diffusion Models):目前 AI 繪圖與影片生成的主流(如 Stable Diffusion, Midjourney, Sora)。
生成對抗網絡(GANs):由生成器與判別器相互博弈演化(如 StyleGAN、DeepFake)。
變分自編碼器(VAE):常用於特徵降維與圖像重構。
5. 圖神經網路(GNN, Graph Neural Networks)
核心特性:傳統神經網路處理網格狀(Grid)資料(如圖片),而 GNN 專門處理非歐幾里得空間的「圖形結構(Graph Data)」(即點與線構成的網絡關係)。
擅長資料:社群網路關係圖、分子結構、金融交易鏈結、知識圖譜。
經典應用:蛋白質結構預測(如 AlphaFold)、社群平台好友/內容推薦、反洗錢與欺詐偵測、新藥開發。
6. 多層感知機與前饋神經網路(MLP / FNN)
核心特性:深度學習中最基礎的「全連接網絡(Fully Connected Network)」。資料單向從輸入層 pass 到輸出層,沒有循環也無卷積。
擅長資料:傳統結構化表格資料(Tabular Data)。
經典應用:用戶流失預測、信用評分、簡單分類與回歸任務。
快速選型對照表
1
1