當(dāng)前位置:首頁(yè) > 智能硬件 > 人工智能AI
[導(dǎo)讀] PCA(主成分分析)是十大經(jīng)典機(jī)器學(xué)習(xí)算法之一。PCA是Pearson在1901年提出的,后來(lái)由Hotelling在1933年加以發(fā)展提出的一種多變量的統(tǒng)計(jì)方法。 對(duì)于維數(shù)比較

PCA(主成分分析)是十大經(jīng)典機(jī)器學(xué)習(xí)算法之一。PCA是Pearson在1901年提出的,后來(lái)由Hotelling在1933年加以發(fā)展提出的一種多變量的統(tǒng)計(jì)方法。

對(duì)于維數(shù)比較多的數(shù)據(jù),首先需要做的事就是在盡量保證數(shù)據(jù)本質(zhì)的前提下將數(shù)據(jù)中的維數(shù)降低。降維是一種數(shù)據(jù)集預(yù)處理技術(shù),往往在數(shù)據(jù)應(yīng)用在其他算法之前使用,它可以去除掉數(shù)據(jù)的一些冗余信息和噪聲,使數(shù)據(jù)變得更加簡(jiǎn)單高效,從而實(shí)現(xiàn)提升數(shù)據(jù)處理速度的目的,節(jié)省大量的時(shí)間和成本。降維也成為了應(yīng)用非常廣泛的數(shù)據(jù)預(yù)處理方法。目前處理降維的技術(shù)有很多種,如SVD奇異值分解,主成分分析(PCA),因子分析(FA),獨(dú)立成分分析(ICA)等。今天重點(diǎn)介紹主成分分析(PCA)。

PCA(主成分分析)算法目的是在“信息”損失較小的前提下,將高維的數(shù)據(jù)轉(zhuǎn)換到低維,通過(guò)析取主成分顯出的最大的個(gè)別差異,也可以用來(lái)削減回歸分析和聚類分析中變量的數(shù)目,從而減小計(jì)算量。

PCA(主成分分析)通常用于高維數(shù)據(jù)集的探索與可視化,還可以用于數(shù)據(jù)壓縮,數(shù)據(jù)預(yù)處理等。

PCA算法概念:

PCA(PrincipalComponent Analysis)主成分分析,也稱為卡爾胡寧-勒夫變換(Karhunen-Loeve Transform),是一種用于探索高維數(shù)據(jù)結(jié)構(gòu)的技術(shù)。

PCA是一種較為常用的降維技術(shù),PCA的思想是將維特征映射到維上,這維是全新的正交特征。這維特征稱為主元,是重新構(gòu)造出來(lái)的維特征。在PCA中,數(shù)據(jù)從原來(lái)的坐標(biāo)系轉(zhuǎn)換到新的坐標(biāo)系下,新的坐標(biāo)系的選擇與數(shù)據(jù)本身是密切相關(guān)的。第一個(gè)新坐標(biāo)軸選擇的是原始數(shù)據(jù)中方差最大的方向,第二個(gè)新坐標(biāo)軸選擇和第一個(gè)坐標(biāo)軸正交且具有最大方差的方向。該過(guò)程一直重復(fù),重復(fù)次數(shù)為原始數(shù)據(jù)中特征的數(shù)目。大部分方差都包含在最前面的幾個(gè)新坐標(biāo)軸中。因此,可以忽略余下的坐標(biāo)軸,即對(duì)數(shù)據(jù)進(jìn)行降維處理。

PCA算法本質(zhì):

PCA算法本質(zhì)就是找一些投影方向,使得數(shù)據(jù)在這些投影方向上的方差最大,而且這些投影方向是相互正交的。這其實(shí)就是找新的正交基的過(guò)程,計(jì)算原始數(shù)據(jù)在這些正交基上投影的方差,方差越大,就說(shuō)明在對(duì)應(yīng)正交基上包含了更多的信息量。原始數(shù)據(jù)協(xié)方差矩陣的特征值越大,對(duì)應(yīng)的方差越大,在對(duì)應(yīng)的特征向量上投影的信息量就越大。反之,如果特征值較小,則說(shuō)明數(shù)據(jù)在這些特征向量上投影的信息量很小,可以將小特征值對(duì)應(yīng)方向的數(shù)據(jù)刪除,從而達(dá)到了降維的目的。

PCA把可能具有相關(guān)性的高維變量合成線性無(wú)關(guān)的低維變量,稱為主成分( principal components)。新的低維數(shù)據(jù)集會(huì)盡可能保留原始數(shù)據(jù)的變量。

簡(jiǎn)而言之,PCA本質(zhì)上是將方差最大的方向作為主要特征,并且在各個(gè)正交方向上將數(shù)據(jù)“離相關(guān)”,也就是讓它們?cè)诓煌环较蛏蠜](méi)有相關(guān)性。

PCA算法中術(shù)語(yǔ): 1、樣本“信息量”

樣本的“信息量”指的是樣本在特征方向上投影的方差。方差越大,則樣本在該特征上的差異就越大,因此該特征就越重要。在分類問(wèn)題里,樣本的方差越大,越容易將不同類別的樣本區(qū)分開(kāi)。

2、方差

希望投影后投影值盡可能分散,而這種分散程度,可以用數(shù)學(xué)上的方差來(lái)表述。在統(tǒng)計(jì)描述中,方差用來(lái)計(jì)算每一個(gè)變量(觀察值)與總體均數(shù)之間的差異。此處,一個(gè)字段的方差可以看做是每個(gè)元素與字段均值的差的平方和的均值,即:

3、協(xié)方差

對(duì)于二維降成一維的問(wèn)題來(lái)說(shuō),找到使得方差最大的方向就可以了。但是對(duì)于更高維的問(wèn)題,需要用到協(xié)方差來(lái)表示其相關(guān)性。即:

PCA理論基礎(chǔ):

PCA理論基礎(chǔ)如下:

1)最大方差理論。

2)最小錯(cuò)誤理論。

3)坐標(biāo)軸相關(guān)度理論。

PCA算法流程:

1)去平均值,即每一位特征減去各自的平均值;

2)計(jì)算協(xié)方差矩陣;

3)計(jì)算協(xié)方差矩陣的特征值與特征向量;

4)對(duì)特征值從大到小排序;

5)保留最大的個(gè)特征向量;

6)將數(shù)據(jù)轉(zhuǎn)換到個(gè)特征向量構(gòu)建的新空間中。

PCA降維準(zhǔn)則:

1) 最近重構(gòu)性:樣本集中所有點(diǎn),重構(gòu)后的點(diǎn)距離原來(lái)的點(diǎn)的誤差之和最小。

2) 最大可分性:樣本在低維空間的投影盡可能分開(kāi)。

PCA算法優(yōu)點(diǎn):

1)使得數(shù)據(jù)集更易使用;

2)降低算法的計(jì)算開(kāi)銷;

3)去除噪聲;

4)使得結(jié)果容易理解;

5)完全無(wú)參數(shù)限制。

PCA算法缺點(diǎn):

1) 如果用戶對(duì)觀測(cè)對(duì)象有一定的先驗(yàn)知識(shí),掌握了數(shù)據(jù)的一些特征,卻無(wú)法通過(guò)參數(shù)化等方法對(duì)處理過(guò)程進(jìn)行干預(yù),可能會(huì)得不到預(yù)期的效果,效率也不高;

2) 特征值分解有一些局限性,比如變換的矩陣必須是方陣;

3) 在非高斯分布情況下,PCA方法得出的主元可能并不是最優(yōu)的。

PCA算法應(yīng)用:

PCA算法已經(jīng)被廣泛的應(yīng)用于高維數(shù)據(jù)集的探索與可視化,還可以用于數(shù)據(jù)壓縮,數(shù)據(jù)預(yù)處理等領(lǐng)域。在機(jī)器學(xué)習(xí)當(dāng)中應(yīng)用很廣,比如圖像,語(yǔ)音,通信的分析處理。PCA算法最主要的用途在于“降維”,去除掉數(shù)據(jù)的一些冗余信息和噪聲,使數(shù)據(jù)變得更加簡(jiǎn)單高效,提高其他機(jī)器學(xué)習(xí)任務(wù)的計(jì)算效率。

結(jié)語(yǔ):

PCA是一種常用的數(shù)據(jù)分析方法。PCA通過(guò)線性變換將原始數(shù)據(jù)變換為一組各維度線性無(wú)關(guān)的表示,可用于識(shí)別和提取數(shù)據(jù)的主要特征分量,通過(guò)將數(shù)據(jù)坐標(biāo)軸旋轉(zhuǎn)到數(shù)據(jù)角度上那些最重要的方向(方差最大);然后通過(guò)特征值分析,確定出需要保留的主成分個(gè)數(shù),舍棄其他非主成分,從而實(shí)現(xiàn)數(shù)據(jù)的降維。降維使數(shù)據(jù)變得更加簡(jiǎn)單高效,從而實(shí)現(xiàn)提升數(shù)據(jù)處理速度的目的,節(jié)省大量的時(shí)間和成本。降維也成為了應(yīng)用非常廣泛的數(shù)據(jù)預(yù)處理方法。PCA算法已經(jīng)被廣泛的應(yīng)用于高維數(shù)據(jù)集的探索與可視化,還可以用于數(shù)據(jù)壓縮,數(shù)據(jù)預(yù)處理,圖像,語(yǔ)音,通信的分析處理等領(lǐng)域。

本站聲明: 本文章由作者或相關(guān)機(jī)構(gòu)授權(quán)發(fā)布,目的在于傳遞更多信息,并不代表本站贊同其觀點(diǎn),本站亦不保證或承諾內(nèi)容真實(shí)性等。需要轉(zhuǎn)載請(qǐng)聯(lián)系該專欄作者,如若文章內(nèi)容侵犯您的權(quán)益,請(qǐng)及時(shí)聯(lián)系本站刪除。
換一批
延伸閱讀

9月2日消息,不造車的華為或?qū)⒋呱龈蟮莫?dú)角獸公司,隨著阿維塔和賽力斯的入局,華為引望愈發(fā)顯得引人矚目。

關(guān)鍵字: 阿維塔 塞力斯 華為

倫敦2024年8月29日 /美通社/ -- 英國(guó)汽車技術(shù)公司SODA.Auto推出其旗艦產(chǎn)品SODA V,這是全球首款涵蓋汽車工程師從創(chuàng)意到認(rèn)證的所有需求的工具,可用于創(chuàng)建軟件定義汽車。 SODA V工具的開(kāi)發(fā)耗時(shí)1.5...

關(guān)鍵字: 汽車 人工智能 智能驅(qū)動(dòng) BSP

北京2024年8月28日 /美通社/ -- 越來(lái)越多用戶希望企業(yè)業(yè)務(wù)能7×24不間斷運(yùn)行,同時(shí)企業(yè)卻面臨越來(lái)越多業(yè)務(wù)中斷的風(fēng)險(xiǎn),如企業(yè)系統(tǒng)復(fù)雜性的增加,頻繁的功能更新和發(fā)布等。如何確保業(yè)務(wù)連續(xù)性,提升韌性,成...

關(guān)鍵字: 亞馬遜 解密 控制平面 BSP

8月30日消息,據(jù)媒體報(bào)道,騰訊和網(wǎng)易近期正在縮減他們對(duì)日本游戲市場(chǎng)的投資。

關(guān)鍵字: 騰訊 編碼器 CPU

8月28日消息,今天上午,2024中國(guó)國(guó)際大數(shù)據(jù)產(chǎn)業(yè)博覽會(huì)開(kāi)幕式在貴陽(yáng)舉行,華為董事、質(zhì)量流程IT總裁陶景文發(fā)表了演講。

關(guān)鍵字: 華為 12nm EDA 半導(dǎo)體

8月28日消息,在2024中國(guó)國(guó)際大數(shù)據(jù)產(chǎn)業(yè)博覽會(huì)上,華為常務(wù)董事、華為云CEO張平安發(fā)表演講稱,數(shù)字世界的話語(yǔ)權(quán)最終是由生態(tài)的繁榮決定的。

關(guān)鍵字: 華為 12nm 手機(jī) 衛(wèi)星通信

要點(diǎn): 有效應(yīng)對(duì)環(huán)境變化,經(jīng)營(yíng)業(yè)績(jī)穩(wěn)中有升 落實(shí)提質(zhì)增效舉措,毛利潤(rùn)率延續(xù)升勢(shì) 戰(zhàn)略布局成效顯著,戰(zhàn)新業(yè)務(wù)引領(lǐng)增長(zhǎng) 以科技創(chuàng)新為引領(lǐng),提升企業(yè)核心競(jìng)爭(zhēng)力 堅(jiān)持高質(zhì)量發(fā)展策略,塑強(qiáng)核心競(jìng)爭(zhēng)優(yōu)勢(shì)...

關(guān)鍵字: 通信 BSP 電信運(yùn)營(yíng)商 數(shù)字經(jīng)濟(jì)

北京2024年8月27日 /美通社/ -- 8月21日,由中央廣播電視總臺(tái)與中國(guó)電影電視技術(shù)學(xué)會(huì)聯(lián)合牽頭組建的NVI技術(shù)創(chuàng)新聯(lián)盟在BIRTV2024超高清全產(chǎn)業(yè)鏈發(fā)展研討會(huì)上宣布正式成立。 活動(dòng)現(xiàn)場(chǎng) NVI技術(shù)創(chuàng)新聯(lián)...

關(guān)鍵字: VI 傳輸協(xié)議 音頻 BSP

北京2024年8月27日 /美通社/ -- 在8月23日舉辦的2024年長(zhǎng)三角生態(tài)綠色一體化發(fā)展示范區(qū)聯(lián)合招商會(huì)上,軟通動(dòng)力信息技術(shù)(集團(tuán))股份有限公司(以下簡(jiǎn)稱"軟通動(dòng)力")與長(zhǎng)三角投資(上海)有限...

關(guān)鍵字: BSP 信息技術(shù)
關(guān)閉
關(guān)閉