huanx's picture
download
raw
1.34 kB
#!/usr/bin/env python3
"""
Hugging Face 数据集加载脚本
"""
import os
import pandas as pd
from datasets import Dataset, Audio
# 配置
DATASET_DIR = "/path/to/dataset" # 修改为您的数据集路径
AUDIO_DIR = os.path.join(DATASET_DIR, "raw_audio")
METADATA_FILE = os.path.join(DATASET_DIR, "metadata.csv")
def load_dataset():
"""加载数据集"""
# 读取元数据
df = pd.read_csv(METADATA_FILE)
# 添加音频文件路径
df["audio"] = df["file"].apply(lambda x: os.path.join(AUDIO_DIR, x))
# 创建Hugging Face数据集
dataset = Dataset.from_pandas(df)
# 转换为音频格式
dataset = dataset.cast_column("audio", Audio())
return dataset
def upload_to_hub(dataset, repo_name):
"""上传到Hugging Face Hub"""
from huggingface_hub import HfApi
api = HfApi()
api.upload_folder(
folder_path=DATASET_DIR,
repo_id=repo_name,
repo_type="dataset",
)
print(f"数据集已上传到: https://huggingface.co/datasets/{repo_name}")
if __name__ == "__main__":
# 加载数据集
dataset = load_dataset()
print(f"数据集大小: {len(dataset)}")
print(f"示例: {dataset[0]}")
# 上传到Hugging Face (取消注释以启用)
# upload_to_hub(dataset, "your-username/daniya-voice-gptsovits")

Xet Storage Details

Size:
1.34 kB
·
Xet hash:
9ed2badec665204485a7c6c4babc4682a477b94dbbbcef5978d355bbae9207b6

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.