當(dāng)前位置:首頁 > 物聯(lián)網(wǎng) > 物聯(lián)網(wǎng)技術(shù)文庫
[導(dǎo)讀] 近年來,生物醫(yī)學(xué)領(lǐng)域正在快速產(chǎn)生海量數(shù)據(jù),特別是隨著基因測序技術(shù)的快速發(fā)展,人類基因序列數(shù)據(jù)遺傳信息正在成為各國爭奪的戰(zhàn)略高點(diǎn)??茖W(xué)研究表明,不同個體攜帶的DNA信息差異可能成為打開生命奧秘的關(guān)

近年來,生物醫(yī)學(xué)領(lǐng)域正在快速產(chǎn)生海量數(shù)據(jù),特別是隨著基因測序技術(shù)的快速發(fā)展,人類基因序列數(shù)據(jù)遺傳信息正在成為各國爭奪的戰(zhàn)略高點(diǎn)??茖W(xué)研究表明,不同個體攜帶的DNA信息差異可能成為打開生命奧秘的關(guān)鍵密碼,因此基于基因組的研究在醫(yī)藥學(xué)、農(nóng)業(yè)、環(huán)境等領(lǐng)域具有不可估量的商業(yè)價(jià)值,世界上眾多科研機(jī)構(gòu)和商業(yè)公司展開了激烈的競爭。

自從人類基因組計(jì)劃啟動以來,以第二代高通測序技術(shù)等為代表的各類組學(xué)技術(shù)飛速發(fā)展,推動了基因組、轉(zhuǎn)錄組、表觀遺傳組、蛋白質(zhì)組等生命科學(xué)組學(xué)數(shù)據(jù)的指數(shù)級增長,把生物醫(yī)學(xué)數(shù)據(jù)推進(jìn)到了PB時(shí)代。而當(dāng)前正在發(fā)展的第三代單分子測序技術(shù),速度更快、成本更低,進(jìn)一步推動生物醫(yī)學(xué)數(shù)據(jù)進(jìn)入EB時(shí)代、基因測試有望進(jìn)入100美元時(shí)代。

基因組大數(shù)據(jù)分析正在成為生物醫(yī)學(xué)領(lǐng)域的下一個前沿,集數(shù)據(jù)存儲、數(shù)據(jù)共享、數(shù)據(jù)分析和數(shù)據(jù)質(zhì)量控制等融合數(shù)據(jù)基礎(chǔ)設(shè)施,將是生物醫(yī)學(xué)大數(shù)據(jù)的最強(qiáng)“挖掘機(jī)”。華為全聯(lián)接大會2019給大家?guī)砹嘶贠ceanStor分布式存儲底座的生物醫(yī)學(xué)大數(shù)據(jù)基礎(chǔ)設(shè)施,為基因組學(xué)大數(shù)據(jù)應(yīng)用產(chǎn)業(yè)打開了全新機(jī)遇之門。

人體成為大數(shù)據(jù)重要產(chǎn)出源

歐美發(fā)達(dá)國家已經(jīng)紛紛啟動了基于測序技術(shù)的生命科學(xué)大數(shù)據(jù)研究計(jì)劃。人體成為大數(shù)據(jù)重要產(chǎn)出源,目前多種組學(xué)數(shù)據(jù)、醫(yī)學(xué)影像和臨床資料在內(nèi)統(tǒng)計(jì)的生物信息數(shù)據(jù)產(chǎn)出達(dá)到了10TB/人的水平,全球每年產(chǎn)生的生物數(shù)據(jù)總量已達(dá)EB級,生命科學(xué)已經(jīng)從實(shí)驗(yàn)數(shù)據(jù)積累階段進(jìn)入大數(shù)據(jù)科學(xué)時(shí)代。這是中科院專家在2018年發(fā)表的一篇《國家級生物大數(shù)據(jù)中心展望》指出的當(dāng)前嚴(yán)峻形勢。

歐、美、日等幾大國際生物信息中心建設(shè)起步早,多年來一直引領(lǐng)著全球生物大數(shù)據(jù)及生物信息領(lǐng)域的發(fā)展。在1980年到1988年間,美國、歐洲和日本分別建立了世界三大生物數(shù)據(jù)中心,即美國國家生物技術(shù)信息中心(NCBI)、歐洲生物信息研究所(EBI)和日本DNA?數(shù)據(jù)庫(DDBJ),三大生物數(shù)據(jù)中心掌握并管理著全世界主要生物數(shù)據(jù)和信息資源。

三大國際生物數(shù)據(jù)中心的規(guī)模龐大,例如截止到2014年DDBJ中心的CPU性能理論峰值達(dá)208TFlops、存儲容量達(dá)12.6PB。而美國NCBI中心憑借雄厚的科研技術(shù)力量以及在生命技術(shù)方面的巨大影響,建立了一系列生物信息數(shù)據(jù)庫和各種數(shù)據(jù)服務(wù),例如帶注釋的所有公開已知DNA序列數(shù)據(jù)庫GenBank,該數(shù)據(jù)庫每天都與DDBJ和EBI的歐洲核甘酸檔案庫同步交換數(shù)據(jù),以保持?jǐn)?shù)據(jù)的實(shí)時(shí)更新。

由國際生物數(shù)據(jù)中心的運(yùn)營可以看出,生物醫(yī)學(xué)數(shù)據(jù)呈現(xiàn)種類繁多、內(nèi)部結(jié)構(gòu)高維復(fù)雜、內(nèi)涵豐富、數(shù)據(jù)相對分散、難以高維度多層次交匯共享等特點(diǎn),例如NCBI的Gene服務(wù)是一個可搜索的基因數(shù)據(jù)庫,專注于已經(jīng)完全測序的基因組,基因信息是包括命名法、染色體定位、基因產(chǎn)物及其屬性、相關(guān)標(biāo)記、表型、相互作用、引文鏈接、序列、突變詳情、圖譜、表達(dá)報(bào)告、同源物、蛋白結(jié)構(gòu)域內(nèi)容和外部數(shù)據(jù)庫鏈接等在內(nèi)的高維數(shù)據(jù)。

中科院專家在2018年發(fā)表的《生物醫(yī)學(xué)大數(shù)據(jù)發(fā)展的新挑戰(zhàn)與趨勢》一文中指出,隨著數(shù)據(jù)規(guī)模的增加,如何更加有效地利用生物醫(yī)學(xué)數(shù)據(jù)成為了挑戰(zhàn)。傳統(tǒng)的數(shù)據(jù)模型和數(shù)據(jù)組織方式,無法滿足海量數(shù)據(jù)的結(jié)構(gòu)、數(shù)量快速增長以及數(shù)據(jù)結(jié)構(gòu)不斷變化的管理需求,難以按照實(shí)際情況動態(tài)調(diào)整。因此,必須要突破傳統(tǒng)的一類數(shù)據(jù)建設(shè)一個數(shù)據(jù)庫的模式,而采用新類數(shù)據(jù)基礎(chǔ)設(shè)施,在底層數(shù)據(jù)結(jié)構(gòu)上以整合為導(dǎo)向,支持?jǐn)?shù)據(jù)結(jié)構(gòu)動態(tài)調(diào)整,為后期數(shù)據(jù)集成與整合工作奠定基礎(chǔ)。

生物醫(yī)學(xué)進(jìn)入新時(shí)代,大數(shù)據(jù)帶來新改變

要把基于海量的基因數(shù)據(jù)和難以復(fù)制的“人工經(jīng)驗(yàn)”,變成可積累、易復(fù)制的“數(shù)據(jù)智能”,就必須要解決數(shù)據(jù)的存、算、用的問題,華為與中科院一起探索建設(shè)符合生物醫(yī)學(xué)研究特點(diǎn)的大數(shù)據(jù)基礎(chǔ)設(shè)施。

首先要解決海量數(shù)據(jù)匯集的問題。生物醫(yī)學(xué)數(shù)據(jù)本身具備多樣性,數(shù)據(jù)來自不同區(qū)域、機(jī)構(gòu)、個體,有結(jié)構(gòu)化數(shù)據(jù)也有圖像、視頻、文本等非結(jié)構(gòu)化數(shù)據(jù),新的生物大數(shù)據(jù)基礎(chǔ)設(shè)施要支持EB級多樣性數(shù)據(jù)的高效存儲,并且可以通過文件、大數(shù)據(jù)等多協(xié)議共享訪問,減少不必要的數(shù)據(jù)遷移,實(shí)現(xiàn)存儲即分析。

其次是海量數(shù)據(jù)的高效處理。基于CPU和GPU的高性能協(xié)同計(jì)算,得益于其強(qiáng)大的并行處理能力,成為海量生物醫(yī)學(xué)數(shù)據(jù)處理的研究熱點(diǎn)。而生物醫(yī)學(xué)的實(shí)時(shí)分析和臨床處理,還需要用到大數(shù)據(jù)和AI技術(shù)快速準(zhǔn)確進(jìn)行影像處理、數(shù)據(jù)降維、數(shù)據(jù)取樣和知識發(fā)現(xiàn),因此新的生物大數(shù)據(jù)基礎(chǔ)設(shè)施也在積極引入NPU/ARM/FPGA等硬件技術(shù),打造多樣性的數(shù)據(jù)分析平臺,讓數(shù)據(jù)分析更高效。

最后,數(shù)據(jù)只有共享了,才能發(fā)揮出它的最大價(jià)值,通過建設(shè)數(shù)據(jù)使能平臺,可以實(shí)現(xiàn)數(shù)據(jù)的共享、標(biāo)準(zhǔn)化、可視化、服務(wù)化,讓數(shù)據(jù)更好地服務(wù)于不同的對象,造福全人類。

為了推動基因數(shù)據(jù)的開放共享,2016年華為與中科院合作建立了新一代組學(xué)數(shù)據(jù)匯交管理平臺NODE(又稱為國家組學(xué)數(shù)據(jù)百科全書),目前已開放共享的各類數(shù)據(jù)達(dá)到數(shù)百TB,提供數(shù)據(jù)的發(fā)布、審閱、分享、管理、質(zhì)量評估、下載與申請,讓數(shù)據(jù)更廣泛服務(wù)于科學(xué)研究。用戶還可以在線分析NODE上的數(shù)據(jù),在線提交數(shù)據(jù)。NODE分析功能強(qiáng)大,基于國產(chǎn)測序平臺MGISEQ-2000測試的RNA-seq數(shù)據(jù),測序質(zhì)量好,性能優(yōu)異。截止目前,NODE數(shù)據(jù)已服務(wù)于超過23個國家、83萬的訪客,幫助全球的科學(xué)家開展133個項(xiàng)目,其中25個項(xiàng)目的科研成果在Cell、Nature等權(quán)威雜志發(fā)表。

此外,2019年8月1日,中科院生物化學(xué)與細(xì)胞生物學(xué)研究所惠利健、中科院上海營養(yǎng)與健康研究所李亦學(xué)、第二軍醫(yī)大學(xué)張海斌及南京大學(xué)施曉雷等共同通訊在Cancer Cell在線發(fā)表題為“A Pharmacogenomic Landscape in Human Liver Cancers”的研究論文,基于海量的數(shù)據(jù)分析,以大約50%的成功率建立人肝癌細(xì)胞模型并生成模型庫,相關(guān)研究結(jié)果發(fā)布于Cancer Cell上。

目前生命科學(xué)和臨床醫(yī)學(xué)研究每天產(chǎn)生研究和檢測數(shù)據(jù)龐大,有些測試數(shù)據(jù)會被不斷覆蓋,有些則會被永久保存下來以便后續(xù)分析,主要數(shù)據(jù)類型為文本文件、圖像文件、二進(jìn)制文件等非結(jié)構(gòu)化數(shù)據(jù),對存儲的要求主要是存儲容量的大小和大文件讀寫通量的高低,而少量的關(guān)鍵數(shù)據(jù)庫、索引等結(jié)構(gòu)化數(shù)據(jù)則對存儲的要求是較高IOPS和穩(wěn)定的讀寫能力?;谌A為OceanStor分布式存儲解決方案,不僅為科研人員提供了日??蒲兴璧臄?shù)據(jù)存儲,其橫向擴(kuò)展能力更能夠滿足機(jī)構(gòu)未來5年數(shù)據(jù)發(fā)展需求,并且保障業(yè)務(wù)7×24小時(shí)持續(xù)平穩(wěn)運(yùn)行。

華為OceanStor分布式存儲,生物醫(yī)學(xué)大數(shù)據(jù)之道

我國生物醫(yī)學(xué)數(shù)據(jù)總體表現(xiàn)為數(shù)據(jù)零散分布、難以有效整合分析,生物醫(yī)學(xué)大數(shù)據(jù)價(jià)值挖掘困難,因此對于生物醫(yī)學(xué)大數(shù)據(jù)技術(shù)和基礎(chǔ)設(shè)施有著迫切需求,特別是需要依靠先進(jìn)的數(shù)據(jù)技術(shù)以結(jié)束我國長期以來的基因組數(shù)據(jù)輸出國地位,通過數(shù)據(jù)存儲的全聯(lián)接來結(jié)束生物數(shù)據(jù)碎片化和流失嚴(yán)重的現(xiàn)象,通過共享平臺實(shí)現(xiàn)標(biāo)準(zhǔn)化治理以更好的對接國際生物醫(yī)學(xué)數(shù)據(jù)平臺、參與國際生態(tài)。在這方面,華為今年重點(diǎn)發(fā)布的智能數(shù)據(jù)與存儲技術(shù),就是最強(qiáng)“挖掘機(jī)”的有力競爭者。

我國生物醫(yī)學(xué)大數(shù)據(jù)和生物醫(yī)學(xué)信息數(shù)據(jù)中心所面臨的挑戰(zhàn),并非特有現(xiàn)象。實(shí)際上,在當(dāng)前廣泛進(jìn)行的數(shù)字化轉(zhuǎn)型中,各行各業(yè)都面臨同樣的問題,這也是今年華為推出智能數(shù)據(jù)湖解決方案的重要背景。華為智能數(shù)據(jù)湖解決方案通過多類型數(shù)據(jù)融合存儲、融合分析引擎等技術(shù)實(shí)現(xiàn)從單一處理到智能融合處理,OceanStor分布式存儲則是作為智能數(shù)據(jù)湖的底座,利用多協(xié)議融合技術(shù)實(shí)現(xiàn)一份數(shù)據(jù)同時(shí)支持?jǐn)?shù)據(jù)庫、大數(shù)據(jù)、AI等多種業(yè)務(wù)的分析需求,讓數(shù)據(jù)分析更高效。

本站聲明: 本文章由作者或相關(guān)機(jī)構(gòu)授權(quán)發(fā)布,目的在于傳遞更多信息,并不代表本站贊同其觀點(diǎn),本站亦不保證或承諾內(nèi)容真實(shí)性等。需要轉(zhuǎn)載請聯(lián)系該專欄作者,如若文章內(nèi)容侵犯您的權(quán)益,請及時(shí)聯(lián)系本站刪除。
換一批
延伸閱讀

9月2日消息,不造車的華為或?qū)⒋呱龈蟮莫?dú)角獸公司,隨著阿維塔和賽力斯的入局,華為引望愈發(fā)顯得引人矚目。

關(guān)鍵字: 阿維塔 塞力斯 華為

加利福尼亞州圣克拉拉縣2024年8月30日 /美通社/ -- 數(shù)字化轉(zhuǎn)型技術(shù)解決方案公司Trianz今天宣布,該公司與Amazon Web Services (AWS)簽訂了...

關(guān)鍵字: AWS AN BSP 數(shù)字化

倫敦2024年8月29日 /美通社/ -- 英國汽車技術(shù)公司SODA.Auto推出其旗艦產(chǎn)品SODA V,這是全球首款涵蓋汽車工程師從創(chuàng)意到認(rèn)證的所有需求的工具,可用于創(chuàng)建軟件定義汽車。 SODA V工具的開發(fā)耗時(shí)1.5...

關(guān)鍵字: 汽車 人工智能 智能驅(qū)動 BSP

北京2024年8月28日 /美通社/ -- 越來越多用戶希望企業(yè)業(yè)務(wù)能7×24不間斷運(yùn)行,同時(shí)企業(yè)卻面臨越來越多業(yè)務(wù)中斷的風(fēng)險(xiǎn),如企業(yè)系統(tǒng)復(fù)雜性的增加,頻繁的功能更新和發(fā)布等。如何確保業(yè)務(wù)連續(xù)性,提升韌性,成...

關(guān)鍵字: 亞馬遜 解密 控制平面 BSP

8月30日消息,據(jù)媒體報(bào)道,騰訊和網(wǎng)易近期正在縮減他們對日本游戲市場的投資。

關(guān)鍵字: 騰訊 編碼器 CPU

8月28日消息,今天上午,2024中國國際大數(shù)據(jù)產(chǎn)業(yè)博覽會開幕式在貴陽舉行,華為董事、質(zhì)量流程IT總裁陶景文發(fā)表了演講。

關(guān)鍵字: 華為 12nm EDA 半導(dǎo)體

8月28日消息,在2024中國國際大數(shù)據(jù)產(chǎn)業(yè)博覽會上,華為常務(wù)董事、華為云CEO張平安發(fā)表演講稱,數(shù)字世界的話語權(quán)最終是由生態(tài)的繁榮決定的。

關(guān)鍵字: 華為 12nm 手機(jī) 衛(wèi)星通信

要點(diǎn): 有效應(yīng)對環(huán)境變化,經(jīng)營業(yè)績穩(wěn)中有升 落實(shí)提質(zhì)增效舉措,毛利潤率延續(xù)升勢 戰(zhàn)略布局成效顯著,戰(zhàn)新業(yè)務(wù)引領(lǐng)增長 以科技創(chuàng)新為引領(lǐng),提升企業(yè)核心競爭力 堅(jiān)持高質(zhì)量發(fā)展策略,塑強(qiáng)核心競爭優(yōu)勢...

關(guān)鍵字: 通信 BSP 電信運(yùn)營商 數(shù)字經(jīng)濟(jì)

北京2024年8月27日 /美通社/ -- 8月21日,由中央廣播電視總臺與中國電影電視技術(shù)學(xué)會聯(lián)合牽頭組建的NVI技術(shù)創(chuàng)新聯(lián)盟在BIRTV2024超高清全產(chǎn)業(yè)鏈發(fā)展研討會上宣布正式成立。 活動現(xiàn)場 NVI技術(shù)創(chuàng)新聯(lián)...

關(guān)鍵字: VI 傳輸協(xié)議 音頻 BSP

北京2024年8月27日 /美通社/ -- 在8月23日舉辦的2024年長三角生態(tài)綠色一體化發(fā)展示范區(qū)聯(lián)合招商會上,軟通動力信息技術(shù)(集團(tuán))股份有限公司(以下簡稱"軟通動力")與長三角投資(上海)有限...

關(guān)鍵字: BSP 信息技術(shù)
關(guān)閉
關(guān)閉