关于 .parquet

Parquet menyimpan data dalam format kolomar (bukan baris) - semua nilai kolom yang sama disimpan berdekatan. Keunggulan: kompresi sangat efisien (kolom sejenis mudah dikompresi), predicate pushdown (query hanya membaca kolom yang dibutuhkan), dan encoding fleksibel (RLE, dictionary, delta encoding). Digunakan oleh: Apache Spark, Hadoop, Presto/Trino, Apache Hive, BigQuery, Redshift, Snowflake, dan layanan data modern lainnya. Mendukung: schema evolution (menambah/hapus kolom), nested data structures (struct, map, list), dan partitioning. Kekurangan: tidak cocok untuk OLTP (banyak write kecil), dan file Parquet tidak dapat diedit langsung. Parquet sangat efisien untuk query analitik yang membaca banyak baris dari beberapa kolom.

支持的软件

  • Apache Spark 免费
  • Pandas (Python) 免费
  • DBeaver 免费

替代格式

.csv .avro .orc .feather