當前位置:首頁 > 物聯(lián)網(wǎng) > 物聯(lián)網(wǎng)技術文庫
[導讀] 近年來,生物醫(yī)學領域正在快速產(chǎn)生海量數(shù)據(jù),特別是隨著基因測序技術的快速發(fā)展,人類基因序列數(shù)據(jù)遺傳信息正在成為各國爭奪的戰(zhàn)略高點。科學研究表明,不同個體攜帶的DNA信息差異可能成為打開生命奧秘的關

近年來,生物醫(yī)學領域正在快速產(chǎn)生海量數(shù)據(jù),特別是隨著基因測序技術的快速發(fā)展,人類基因序列數(shù)據(jù)遺傳信息正在成為各國爭奪的戰(zhàn)略高點。科學研究表明,不同個體攜帶的DNA信息差異可能成為打開生命奧秘的關鍵密碼,因此基于基因組的研究在醫(yī)藥學、農業(yè)、環(huán)境等領域具有不可估量的商業(yè)價值,世界上眾多科研機構和商業(yè)公司展開了激烈的競爭。

自從人類基因組計劃啟動以來,以第二代高通測序技術等為代表的各類組學技術飛速發(fā)展,推動了基因組、轉錄組、表觀遺傳組、蛋白質組等生命科學組學數(shù)據(jù)的指數(shù)級增長,把生物醫(yī)學數(shù)據(jù)推進到了PB時代。而當前正在發(fā)展的第三代單分子測序技術,速度更快、成本更低,進一步推動生物醫(yī)學數(shù)據(jù)進入EB時代、基因測試有望進入100美元時代。

基因組大數(shù)據(jù)分析正在成為生物醫(yī)學領域的下一個前沿,集數(shù)據(jù)存儲、數(shù)據(jù)共享、數(shù)據(jù)分析和數(shù)據(jù)質量控制等融合數(shù)據(jù)基礎設施,將是生物醫(yī)學大數(shù)據(jù)的最強“挖掘機”。華為全聯(lián)接大會2019給大家?guī)砹嘶贠ceanStor分布式存儲底座的生物醫(yī)學大數(shù)據(jù)基礎設施,為基因組學大數(shù)據(jù)應用產(chǎn)業(yè)打開了全新機遇之門。

人體成為大數(shù)據(jù)重要產(chǎn)出源

歐美發(fā)達國家已經(jīng)紛紛啟動了基于測序技術的生命科學大數(shù)據(jù)研究計劃。人體成為大數(shù)據(jù)重要產(chǎn)出源,目前多種組學數(shù)據(jù)、醫(yī)學影像和臨床資料在內統(tǒng)計的生物信息數(shù)據(jù)產(chǎn)出達到了10TB/人的水平,全球每年產(chǎn)生的生物數(shù)據(jù)總量已達EB級,生命科學已經(jīng)從實驗數(shù)據(jù)積累階段進入大數(shù)據(jù)科學時代。這是中科院專家在2018年發(fā)表的一篇《國家級生物大數(shù)據(jù)中心展望》指出的當前嚴峻形勢。

歐、美、日等幾大國際生物信息中心建設起步早,多年來一直引領著全球生物大數(shù)據(jù)及生物信息領域的發(fā)展。在1980年到1988年間,美國、歐洲和日本分別建立了世界三大生物數(shù)據(jù)中心,即美國國家生物技術信息中心(NCBI)、歐洲生物信息研究所(EBI)和日本DNA?數(shù)據(jù)庫(DDBJ),三大生物數(shù)據(jù)中心掌握并管理著全世界主要生物數(shù)據(jù)和信息資源。

三大國際生物數(shù)據(jù)中心的規(guī)模龐大,例如截止到2014年DDBJ中心的CPU性能理論峰值達208TFlops、存儲容量達12.6PB。而美國NCBI中心憑借雄厚的科研技術力量以及在生命技術方面的巨大影響,建立了一系列生物信息數(shù)據(jù)庫和各種數(shù)據(jù)服務,例如帶注釋的所有公開已知DNA序列數(shù)據(jù)庫GenBank,該數(shù)據(jù)庫每天都與DDBJ和EBI的歐洲核甘酸檔案庫同步交換數(shù)據(jù),以保持數(shù)據(jù)的實時更新。

由國際生物數(shù)據(jù)中心的運營可以看出,生物醫(yī)學數(shù)據(jù)呈現(xiàn)種類繁多、內部結構高維復雜、內涵豐富、數(shù)據(jù)相對分散、難以高維度多層次交匯共享等特點,例如NCBI的Gene服務是一個可搜索的基因數(shù)據(jù)庫,專注于已經(jīng)完全測序的基因組,基因信息是包括命名法、染色體定位、基因產(chǎn)物及其屬性、相關標記、表型、相互作用、引文鏈接、序列、突變詳情、圖譜、表達報告、同源物、蛋白結構域內容和外部數(shù)據(jù)庫鏈接等在內的高維數(shù)據(jù)。

中科院專家在2018年發(fā)表的《生物醫(yī)學大數(shù)據(jù)發(fā)展的新挑戰(zhàn)與趨勢》一文中指出,隨著數(shù)據(jù)規(guī)模的增加,如何更加有效地利用生物醫(yī)學數(shù)據(jù)成為了挑戰(zhàn)。傳統(tǒng)的數(shù)據(jù)模型和數(shù)據(jù)組織方式,無法滿足海量數(shù)據(jù)的結構、數(shù)量快速增長以及數(shù)據(jù)結構不斷變化的管理需求,難以按照實際情況動態(tài)調整。因此,必須要突破傳統(tǒng)的一類數(shù)據(jù)建設一個數(shù)據(jù)庫的模式,而采用新類數(shù)據(jù)基礎設施,在底層數(shù)據(jù)結構上以整合為導向,支持數(shù)據(jù)結構動態(tài)調整,為后期數(shù)據(jù)集成與整合工作奠定基礎。

生物醫(yī)學進入新時代,大數(shù)據(jù)帶來新改變

要把基于海量的基因數(shù)據(jù)和難以復制的“人工經(jīng)驗”,變成可積累、易復制的“數(shù)據(jù)智能”,就必須要解決數(shù)據(jù)的存、算、用的問題,華為與中科院一起探索建設符合生物醫(yī)學研究特點的大數(shù)據(jù)基礎設施。

首先要解決海量數(shù)據(jù)匯集的問題。生物醫(yī)學數(shù)據(jù)本身具備多樣性,數(shù)據(jù)來自不同區(qū)域、機構、個體,有結構化數(shù)據(jù)也有圖像、視頻、文本等非結構化數(shù)據(jù),新的生物大數(shù)據(jù)基礎設施要支持EB級多樣性數(shù)據(jù)的高效存儲,并且可以通過文件、大數(shù)據(jù)等多協(xié)議共享訪問,減少不必要的數(shù)據(jù)遷移,實現(xiàn)存儲即分析。

其次是海量數(shù)據(jù)的高效處理。基于CPU和GPU的高性能協(xié)同計算,得益于其強大的并行處理能力,成為海量生物醫(yī)學數(shù)據(jù)處理的研究熱點。而生物醫(yī)學的實時分析和臨床處理,還需要用到大數(shù)據(jù)和AI技術快速準確進行影像處理、數(shù)據(jù)降維、數(shù)據(jù)取樣和知識發(fā)現(xiàn),因此新的生物大數(shù)據(jù)基礎設施也在積極引入NPU/ARM/FPGA等硬件技術,打造多樣性的數(shù)據(jù)分析平臺,讓數(shù)據(jù)分析更高效。

最后,數(shù)據(jù)只有共享了,才能發(fā)揮出它的最大價值,通過建設數(shù)據(jù)使能平臺,可以實現(xiàn)數(shù)據(jù)的共享、標準化、可視化、服務化,讓數(shù)據(jù)更好地服務于不同的對象,造福全人類。

為了推動基因數(shù)據(jù)的開放共享,2016年華為與中科院合作建立了新一代組學數(shù)據(jù)匯交管理平臺NODE(又稱為國家組學數(shù)據(jù)百科全書),目前已開放共享的各類數(shù)據(jù)達到數(shù)百TB,提供數(shù)據(jù)的發(fā)布、審閱、分享、管理、質量評估、下載與申請,讓數(shù)據(jù)更廣泛服務于科學研究。用戶還可以在線分析NODE上的數(shù)據(jù),在線提交數(shù)據(jù)。NODE分析功能強大,基于國產(chǎn)測序平臺MGISEQ-2000測試的RNA-seq數(shù)據(jù),測序質量好,性能優(yōu)異。截止目前,NODE數(shù)據(jù)已服務于超過23個國家、83萬的訪客,幫助全球的科學家開展133個項目,其中25個項目的科研成果在Cell、Nature等權威雜志發(fā)表。

此外,2019年8月1日,中科院生物化學與細胞生物學研究所惠利健、中科院上海營養(yǎng)與健康研究所李亦學、第二軍醫(yī)大學張海斌及南京大學施曉雷等共同通訊在Cancer Cell在線發(fā)表題為“A Pharmacogenomic Landscape in Human Liver Cancers”的研究論文,基于海量的數(shù)據(jù)分析,以大約50%的成功率建立人肝癌細胞模型并生成模型庫,相關研究結果發(fā)布于Cancer Cell上。

目前生命科學和臨床醫(yī)學研究每天產(chǎn)生研究和檢測數(shù)據(jù)龐大,有些測試數(shù)據(jù)會被不斷覆蓋,有些則會被永久保存下來以便后續(xù)分析,主要數(shù)據(jù)類型為文本文件、圖像文件、二進制文件等非結構化數(shù)據(jù),對存儲的要求主要是存儲容量的大小和大文件讀寫通量的高低,而少量的關鍵數(shù)據(jù)庫、索引等結構化數(shù)據(jù)則對存儲的要求是較高IOPS和穩(wěn)定的讀寫能力?;谌A為OceanStor分布式存儲解決方案,不僅為科研人員提供了日??蒲兴璧臄?shù)據(jù)存儲,其橫向擴展能力更能夠滿足機構未來5年數(shù)據(jù)發(fā)展需求,并且保障業(yè)務7×24小時持續(xù)平穩(wěn)運行。

華為OceanStor分布式存儲,生物醫(yī)學大數(shù)據(jù)之道

我國生物醫(yī)學數(shù)據(jù)總體表現(xiàn)為數(shù)據(jù)零散分布、難以有效整合分析,生物醫(yī)學大數(shù)據(jù)價值挖掘困難,因此對于生物醫(yī)學大數(shù)據(jù)技術和基礎設施有著迫切需求,特別是需要依靠先進的數(shù)據(jù)技術以結束我國長期以來的基因組數(shù)據(jù)輸出國地位,通過數(shù)據(jù)存儲的全聯(lián)接來結束生物數(shù)據(jù)碎片化和流失嚴重的現(xiàn)象,通過共享平臺實現(xiàn)標準化治理以更好的對接國際生物醫(yī)學數(shù)據(jù)平臺、參與國際生態(tài)。在這方面,華為今年重點發(fā)布的智能數(shù)據(jù)與存儲技術,就是最強“挖掘機”的有力競爭者。

我國生物醫(yī)學大數(shù)據(jù)和生物醫(yī)學信息數(shù)據(jù)中心所面臨的挑戰(zhàn),并非特有現(xiàn)象。實際上,在當前廣泛進行的數(shù)字化轉型中,各行各業(yè)都面臨同樣的問題,這也是今年華為推出智能數(shù)據(jù)湖解決方案的重要背景。華為智能數(shù)據(jù)湖解決方案通過多類型數(shù)據(jù)融合存儲、融合分析引擎等技術實現(xiàn)從單一處理到智能融合處理,OceanStor分布式存儲則是作為智能數(shù)據(jù)湖的底座,利用多協(xié)議融合技術實現(xiàn)一份數(shù)據(jù)同時支持數(shù)據(jù)庫、大數(shù)據(jù)、AI等多種業(yè)務的分析需求,讓數(shù)據(jù)分析更高效。

本站聲明: 本文章由作者或相關機構授權發(fā)布,目的在于傳遞更多信息,并不代表本站贊同其觀點,本站亦不保證或承諾內容真實性等。需要轉載請聯(lián)系該專欄作者,如若文章內容侵犯您的權益,請及時聯(lián)系本站刪除。
換一批
延伸閱讀

9月2日消息,不造車的華為或將催生出更大的獨角獸公司,隨著阿維塔和賽力斯的入局,華為引望愈發(fā)顯得引人矚目。

關鍵字: 阿維塔 塞力斯 華為

加利福尼亞州圣克拉拉縣2024年8月30日 /美通社/ -- 數(shù)字化轉型技術解決方案公司Trianz今天宣布,該公司與Amazon Web Services (AWS)簽訂了...

關鍵字: AWS AN BSP 數(shù)字化

倫敦2024年8月29日 /美通社/ -- 英國汽車技術公司SODA.Auto推出其旗艦產(chǎn)品SODA V,這是全球首款涵蓋汽車工程師從創(chuàng)意到認證的所有需求的工具,可用于創(chuàng)建軟件定義汽車。 SODA V工具的開發(fā)耗時1.5...

關鍵字: 汽車 人工智能 智能驅動 BSP

北京2024年8月28日 /美通社/ -- 越來越多用戶希望企業(yè)業(yè)務能7×24不間斷運行,同時企業(yè)卻面臨越來越多業(yè)務中斷的風險,如企業(yè)系統(tǒng)復雜性的增加,頻繁的功能更新和發(fā)布等。如何確保業(yè)務連續(xù)性,提升韌性,成...

關鍵字: 亞馬遜 解密 控制平面 BSP

8月30日消息,據(jù)媒體報道,騰訊和網(wǎng)易近期正在縮減他們對日本游戲市場的投資。

關鍵字: 騰訊 編碼器 CPU

8月28日消息,今天上午,2024中國國際大數(shù)據(jù)產(chǎn)業(yè)博覽會開幕式在貴陽舉行,華為董事、質量流程IT總裁陶景文發(fā)表了演講。

關鍵字: 華為 12nm EDA 半導體

8月28日消息,在2024中國國際大數(shù)據(jù)產(chǎn)業(yè)博覽會上,華為常務董事、華為云CEO張平安發(fā)表演講稱,數(shù)字世界的話語權最終是由生態(tài)的繁榮決定的。

關鍵字: 華為 12nm 手機 衛(wèi)星通信

要點: 有效應對環(huán)境變化,經(jīng)營業(yè)績穩(wěn)中有升 落實提質增效舉措,毛利潤率延續(xù)升勢 戰(zhàn)略布局成效顯著,戰(zhàn)新業(yè)務引領增長 以科技創(chuàng)新為引領,提升企業(yè)核心競爭力 堅持高質量發(fā)展策略,塑強核心競爭優(yōu)勢...

關鍵字: 通信 BSP 電信運營商 數(shù)字經(jīng)濟

北京2024年8月27日 /美通社/ -- 8月21日,由中央廣播電視總臺與中國電影電視技術學會聯(lián)合牽頭組建的NVI技術創(chuàng)新聯(lián)盟在BIRTV2024超高清全產(chǎn)業(yè)鏈發(fā)展研討會上宣布正式成立。 活動現(xiàn)場 NVI技術創(chuàng)新聯(lián)...

關鍵字: VI 傳輸協(xié)議 音頻 BSP

北京2024年8月27日 /美通社/ -- 在8月23日舉辦的2024年長三角生態(tài)綠色一體化發(fā)展示范區(qū)聯(lián)合招商會上,軟通動力信息技術(集團)股份有限公司(以下簡稱"軟通動力")與長三角投資(上海)有限...

關鍵字: BSP 信息技術
關閉
關閉