メインコンテンツへスキップ
DataStore は、さまざまなファイルフォーマットやデータソースの読み取りと書き込みに対応しています。

データの読み取り

CSVファイル

例:

Parquet ファイル

大規模なデータセットに推奨。より高い圧縮率を備えた列指向フォーマットです。
例:

JSONファイル

例:

Excel ファイル

例:

SQL データベース

例:

その他のフォーマット


データの書き込み

to_csv

CSVフォーマットにエクスポートします。
例:

to_parquet

Parquet フォーマットでエクスポートします (大規模データに推奨) 。
例:

to_json

JSON形式でエクスポートします。
例:

to_excel

Excel形式でエクスポートします。
例:

to_sql

SQLデータベースにエクスポートするか、SQL文字列を生成します。
例:

その他のエクスポート方法


ファイルフォーマットの比較

推奨事項

  1. 分析ワークロード向け: Parquet を使用します
    • 列指向フォーマットのため、必要なカラムだけを読み取れます
    • 高い圧縮率
    • データ型を保持できます
  2. データ交換向け: CSV または JSON を使用します
    • 幅広い互換性
    • 人間が読みやすい形式
  3. pandas との相互運用向け: Feather または Arrow を使用します
    • 最も高速なシリアライゼーション
    • 型を保持できます

圧縮サポート

圧縮ファイルの読み込み

圧縮ファイルの書き込み

圧縮オプション


ストリーミング I/O

メモリに収まらない非常に大きなファイルの場合:

チャンク単位の読み取り

ClickHouse Streaming を使う


リモートデータソース

HTTP/HTTPS

S3

GCS、Azure、HDFS

Cloud ストレージのオプションについては、Factory Methodsを参照してください。

ベストプラクティス

1. 大容量ファイルにはParquetを使用する

2. 必要なカラムだけを選択する

3. 圧縮を利用する

4. バッチ書き込み

最終更新日 2026年7月2日