語音識別是一門交叉學科。近二十年來,語音識別技術取得顯著進步,開始從實驗室走向市場。人們預計,未來10年內(nèi),語音識別技術將進入工業(yè)、家電、通信、汽車電子、醫(yī)療、家庭服務、消費電子產(chǎn)品等各個領域。 語音識別聽寫機在一些領域的應用被美國新聞界評為1997年計算機發(fā)展十件大事之一。很多專家都認為語音識別技術是2000年至2010年間信息技術領域十大重要的科技發(fā)展技術之一。 語音識別技術所涉及的領域包括:信號處理、模式識別、概率論和信息論、發(fā)聲機理和聽覺機理、人工智能等等。
與機器進行語音交流,讓機器明白你說什么,這是人們長期以來夢寐以求的事情。中國物聯(lián)網(wǎng)校企聯(lián)盟形象得把語音識別比做為“機器的聽覺系統(tǒng)”。語音識別技術就是讓機器通過識別和理解過程把語音信號轉(zhuǎn)變?yōu)橄鄳奈谋净蛎畹母呒夹g?!≌Z音識別技術主要包括特征提取技術、模式匹配準則及模型訓練技術三個方面。語音識別技術車聯(lián)網(wǎng)也得到了充分的引用,例如在翼卡車聯(lián)網(wǎng)中,只需按一鍵通客服人員口述即可設置目的地直接導航,安全、便捷。
根據(jù)識別的對象不同,語音識別任務大體可分為3類,即孤立詞識別(isolated word recognition),關鍵詞識別(或稱關鍵詞檢出,keyword spotting)和連續(xù)語音識別。其中,孤立詞識別 的任務是識別事先已知的孤立的詞,如“開機”、“關機”等;連續(xù)語音識別的任務則是識別任意的連續(xù)語音,如一個句子或一段話;連續(xù)語音流中的關鍵詞檢測針對的是連續(xù)語音,但它并不識別全部文字,而只是檢測已知的若干關鍵詞在何處出現(xiàn),如在一段話中檢測“計算機”、“世界”這兩個詞。根據(jù)針對的發(fā)音人,可以把語音識別技術分為特定人語音識別和非特定人語音識別,前者只能識別一個或幾個人的語音,而后者則可以被任何人使用。顯然,非特定人語音識別系統(tǒng)更符合實際需要,但它要比針對特定人的識別困難得多。另外,根據(jù)語音設備和通道,可以分為桌面(PC)語音識別、電話語音識別和嵌入式設備(手機、PDA等)語音識別。不同的采集通道會使人的發(fā)音的聲學特性發(fā)生變形,因此需要構造各自的識別系統(tǒng)。語音識別的應用領域非常廣泛,常見的應用系統(tǒng)有:語音輸入系統(tǒng),相對于鍵盤輸入方法,它更符合人的日常習慣,也更自然、更高效;語音控制系統(tǒng),即用語音來控制設備的運行,相對于手動控制來說更加快捷、方便,可以用在諸如工業(yè)控制、語音撥號系統(tǒng)、智能家電、聲控智能玩具等許多領域;智能對話查詢系統(tǒng),根據(jù)客戶的語音進行操作,為用戶提供自然、友好的數(shù)據(jù)庫檢索服務,例如家庭服務、賓館服務、旅行社服務系統(tǒng)、訂票系統(tǒng)、醫(yī)療服務、銀行服務、股票查詢服務等等。