حول .parquet

Parquet menyimpan data dalam format kolomar (bukan baris) - semua nilai kolom yang sama disimpan berdekatan. Keunggulan: kompresi sangat efisien (kolom sejenis mudah dikompresi), predicate pushdown (query hanya membaca kolom yang dibutuhkan), dan encoding fleksibel (RLE, dictionary, delta encoding). Digunakan oleh: Apache Spark, Hadoop, Presto/Trino, Apache Hive, BigQuery, Redshift, Snowflake, dan layanan data modern lainnya. Mendukung: schema evolution (menambah/hapus kolom), nested data structures (struct, map, list), dan partitioning. Kekurangan: tidak cocok untuk OLTP (banyak write kecil), dan file Parquet tidak dapat diedit langsung. Parquet sangat efisien untuk query analitik yang membaca banyak baris dari beberapa kolom.

البرامج المدعومة

  • Apache Spark مجاني
  • Pandas (Python) مجاني
  • DBeaver مجاني

الصيغ البديلة

.csv .avro .orc .feather