[In A Word]In A Word章4 Parquet、Avro、ORC

泄露秘密 提交于 2019-11-28 00:57:44

行式存储or列式存储:Parquet和ORC都以列的形式存储数据,而Avro以基于行的格式存储数据。 就其本质而言,面向列的数据存储针对读取繁重的分析工作负载进行了优化,而基于行的数据库最适合于大量写入的事务性工作负载。

压缩率:基于列的存储区Parquet和ORC提供的压缩率高于基于行的Avro格式。 

可兼容的平台:ORC常用于Hive、Presto;Parquet常用于Impala、Drill、Spark、Arrow;Avro常用于Kafka、Druid。

不同的案例和应用场景选择合适的存储格式,可以提升存储和读取的效率。

 

 

标签
易学教程内所有资源均来自网络或用户发布的内容,如有违反法律规定的内容欢迎反馈
该文章没有解决你所遇到的问题?点击提问,说说你的问题,让更多的人一起探讨吧!