基于DSP和FPGA的機器人聲控系統(tǒng)設計與實現(xiàn)(TLP521)
1 引言
機器人聽覺系統(tǒng)主要是對人的聲音進行語音識別并做出判斷,然后輸出相應的動作指令控制頭部和手臂的動作,傳統(tǒng)的機器人聽覺系統(tǒng)一般是以pc機為平臺對機器人進行控制,其特點是用一臺計算機作為機器人的信息處理核心通過接口電路對機器人進行控制,雖然處理能力比較強大,語音庫比較完備,系統(tǒng)更新以及功能拓展比較容易,但是比較笨重,不利于機器人的小型化和復雜條件下進行工作,此外功耗大、成本高。 本次設計采用了性價比較高的數(shù)字信號處理芯片tms320vc5509作為語音識別處理器,具有較快的處理速度,使機器人在脫機狀態(tài)下,獨立完成復雜的語音信號處理和動作指令控制,fpga系統(tǒng)的開發(fā)降低了時序控制電路和邏輯電路在pcb板所占的面積[1],使機器人的"大腦"的語音處理部分微型化、低功耗。一個體積小、低功耗、高速度能完成特定范圍語音識別和動作指令的機器人系統(tǒng)的研制具有很大的實際意義。2 系統(tǒng)硬件總體設計
系統(tǒng)的硬件功能是實現(xiàn)語音指令的采集和步進電機的驅動控制,為系統(tǒng)軟件提供開發(fā)和調(diào)試平臺。如圖1所示。 系統(tǒng)硬件分為語音信號的采集和播放,基于dsp的語音識別,fpga動作指令控制、步進電機及其驅動、dsp外接閃存芯片,jtag口仿真調(diào)試和鍵盤控制幾個部分。工作流程是麥克風將人的語音信號轉化為模擬信號,在經(jīng)過音頻芯片tlv320aic23量化轉化成數(shù)字信號輸入dsp.dsp完成識別后,輸出動作指令。 fpga根據(jù)dsp輸入的動作指令產(chǎn)生正確的正反轉信號和準確的脈沖給步進電機驅動芯片,驅動芯片提供步進電機的驅動信號,控制步進電機的轉動。片外flash用于存儲系統(tǒng)程序和語音庫并完成系統(tǒng)的上電加載。jtag口用于與pc機進行聯(lián)機在線仿真,鍵盤則用于參數(shù)調(diào)整和功能的切換。
3 語音識別系統(tǒng)設計3.1 語音信號的特點 語音信號的頻率成分主要分布在300~3400hz之間,根據(jù)采樣定理選擇信號的采樣率為8 khz。語音信號的一個特點在于他的"短時性",有時在一個短時段呈現(xiàn)隨機噪聲的特性,而另一段表現(xiàn)周期信號的特性,或二者兼而有之。語音信號的特征是隨時間變化的,只有一段時間內(nèi),信號才表現(xiàn)穩(wěn)定一致的特征,一般來說短時段可取5~50 ms,因此語音信號的處理要建立在其"短時性"上[2],系統(tǒng)將語音信號幀長設為20 ms,幀移設為10 ms,則每幀數(shù)據(jù)為160×16 b。3.2 語音信號的采集和播放
語音采集和播放芯片采用的是ti公司生產(chǎn)的tlv320aic23b,tlv320aic23b的模數(shù)轉換(adc)和數(shù)模轉換(dac)部件高度集成在芯片內(nèi)部,芯片采用8 k采樣率,單聲道模擬信號輸入,雙聲道輸出。tlv320aic23具有可編程特性,dsp可通過控制接口來編輯該器件的控制寄存器,而且能夠編譯spi,i2c兩種規(guī)格的接口,tlv320aic23b與dsp5509的電路連接如圖2所示。
dsp采用i2c口對tlv320aic23的寄存器進行設置。當mode=o時,為i2c規(guī)格的接口,dsp采用主發(fā)送模式,通過i2c口對地址為0000000~0001111的11個寄存器進行初始化。i2c模式下,數(shù)據(jù)是分為3個8 b寫入的。而tlv320aic23有7位地址和9位數(shù)據(jù),也就是說,需要把數(shù)據(jù)項上面的最高位補充到第二個8 b中的最后一位。 mcbsp串口通過6個引腳clkx,clkr,fsx,fsr,dr和cx與tlv320aic23相連。數(shù)據(jù)經(jīng)mcbsp串口與外設的通信通過dr和dx引腳傳輸,控制同步信號則由clkx,clkr,fsx,fsr四個引腳實現(xiàn)。將mcbsp串口設置為dsp mode模式,然后使串口的接收器和發(fā)送器同步,并且由tlv320aic23的幀同步信號lrcin,lrcout啟動串口傳輸,同時將發(fā)送接收的數(shù)據(jù)字長設定為32 b(左聲道16 b,右聲道16 b)單幀模式。3.3 語音識別程序模塊的設計 為了實現(xiàn)機器人對非特定人語音指令的識別,系統(tǒng)采用非特定人的孤立詞識別系統(tǒng)。非特定人的語音識別是指語音模型由不同年齡、不同性別、不同口音的人進行訓練,在識別時不需要訓練就可以識別說話人的語音[2]。系統(tǒng)分為預加重和加窗,短點檢測,特征提取,與語音庫的模式匹配和訓練幾個部分。3.3.1 語音信號的預加重和加窗 預加重處理主要是去除聲門激勵和口鼻輻射的影響,預加重數(shù)字濾波h(z)=1一kz-1,其中是為預加重系數(shù),接近1,本系統(tǒng)中k取0.95。對語音序列x(n)進行預加重,得到預加重后的語音序列x(n):x(n)=x(n)一kx(n一1) (1)
系統(tǒng)采用一個有限長度的漢明窗在語音序列上進行滑動,用以截取幀長為20 ms,幀移設為10 ms的語音信號,采用漢明窗可以有