52.5 GB
1,379 files
Updated 3 months ago
Name
Size
.cache
audio
configs
.gitattributes2.5 kB
xet
README.md2.83 kB
xet
UPLOAD_INSTRUCTIONS.md2.17 kB
xet
daniya.list7.34 kB
xet
dataset_info.json585 Bytes
xet
load_dataset.py1.34 kB
xet
metadata.csv6.78 kB
xet
metadata.jsonl11.7 kB
xet
README.md

达妮娅语音数据集 (GPT-SoVITS)

数据集概述

这是一个用于GPT-SoVITS语音合成模型训练的中文游戏语音数据集。数据来源于《鸣潮》游戏角色达妮娅的语音素材。

数据集特点

  • 语言: 中文 (普通话)
  • 角色: 达妮娅 (Dania)
  • 语音类型: 游戏配音(战斗语音 + 个性语音)
  • 音频格式: WAV, 48kHz, 24-bit, 单声道
  • 数据量: 93个语音片段
  • 总时长: 约13.63分钟

数据集结构

daniya_voice_gptsovits/
├── raw_audio/                 # 原始音频文件
│   ├── 001.wav ~ 031.wav     # 个性语音 (31个)
│   ├── 101.wav ~ 162.wav     # 战斗语音 (62个)
├── metadata.csv               # 元数据文件
├── transcript.txt             # 文本转录文件
└── README.md                  # 数据集说明

元数据字段

字段 描述
file 音频文件名
text 文本内容
language 语言 (zh)
speaker 说话人 (daniya)

语音分类

1. 个性语音 (31个)

  • 心声系列 (001-005): 深度角色内心独白
  • 喜好与烦恼 (006-010): 角色个性表达
  • 人际关系 (011-017): 关于其他角色的评论
  • 日常互动 (018-031): 生日祝福、自我介绍等

2. 战斗语音 (62个)

  • 普攻、重击、空中攻击 等基础战斗语音
  • 共鸣技能、共鸣解放 等特殊技能语音
  • 受击、重伤、力竭 等状态语音

数据统计

  • 总文件数: 93个
  • 总时长: 13.63分钟 (817.97秒)
  • 平均时长: 8.80秒
  • 最短时长: 0.58秒 (139.wav)
  • 最长时长: 68.41秒 (004.wav)

使用方法

GPT-SoVITS训练

import pandas as pd
from datasets import Dataset

# 加载元数据
df = pd.read_csv('metadata.csv')
dataset = Dataset.from_pandas(df)

语音合成

# 使用GPT-SoVITS进行语音合成
python inference.py     --gpt_model ./output/gpt_daniya     --sovits_model ./output/sovits_daniya     --text "你好,我是达妮娅"

数据来源

许可证

本数据集仅供学习研究使用,请遵守相关版权法规。

引用

@misc{daniya_voice_gptsovits,
  title={Dania Voice Dataset for GPT-SoVITS},
  author={Your Name},
  year={2026},
  howpublished={\url{https://huggingface.co/datasets/your-username/daniya-voice-gptsovits}}
}

联系方式

如有问题,请通过GitHub Issues联系。

Total size
52.5 GB
Files
1,379
Last updated
May 29
Pre-warmed CDN
US EU US EU

Contributors