發(fā)布時間:2022-02-07 15:35:05來源:魔方格
簡單而言大數(shù)據(jù)是數(shù)據(jù)多到爆表。即是一種規(guī)模大到在獲取,存儲,管理,分析方面大大超出了傳統(tǒng)數(shù)據(jù)庫軟件工具能力范圍的數(shù)據(jù)集合。那么,大數(shù)據(jù)的定義及其特點是什么?
大數(shù)據(jù)的定義是什么?
對于“大數(shù)據(jù)”研究機構Gartner給出了這樣的定義。“大數(shù)據(jù)”是需要新處理模式才能具有更強的決策力、洞察發(fā)現(xiàn)力和流程優(yōu)化能力來適應海量、高增長率和多樣化的信息資產。
隨著云時代的來臨,大數(shù)據(jù)也吸引了越來越多的關注。分析師團隊認為,大數(shù)據(jù)通常用來形容一個公司創(chuàng)造的大量非結構化數(shù)據(jù)和半結構化數(shù)據(jù),這些數(shù)據(jù)在下載到關系型數(shù)據(jù)庫用于分析時會花費過多時間和金錢。大數(shù)據(jù)分析常和云計算聯(lián)系到一起,因為實時的大型數(shù)據(jù)集分析需要像MapReduce一樣的框架來向數(shù)十、數(shù)百或甚至數(shù)千的電腦分配工作。
大數(shù)據(jù)需要特殊的技術,以有效地處理大量的容忍經過時間內的數(shù)據(jù)。適用于大數(shù)據(jù)的技術,包括大規(guī)模并行處理數(shù)據(jù)庫、數(shù)據(jù)挖掘、分布式文件系統(tǒng)、分布式數(shù)據(jù)庫、云計算平臺、互聯(lián)網和可擴展的存儲系統(tǒng)。
大數(shù)據(jù)的特點是什么?
容量(Volume):數(shù)據(jù)的大小決定所考慮的數(shù)據(jù)的價值和潛在的信息。
種類(Variety):數(shù)據(jù)類型的多樣性。
速度(Velocity):指獲得數(shù)據(jù)的速度。
可變性(Variability):妨礙了處理和有效地管理數(shù)據(jù)的過程。
真實性(Veracity):數(shù)據(jù)的質量。
復雜性(Complexity):數(shù)據(jù)量巨大,來源多渠道。
價值(value):合理運用大數(shù)據(jù),以低成本創(chuàng)造高價值。
大數(shù)據(jù)包括結構化、半結構化和非結構化數(shù)據(jù),非結構化數(shù)據(jù)越來越成為數(shù)據(jù)的主要部分。據(jù)IDC的調查報告顯示:企業(yè)中80%的數(shù)據(jù)都是非結構化數(shù)據(jù),這些數(shù)據(jù)每年都按指數(shù)增長60%。