gasschina commited on
Commit
be1f9b7
·
verified ·
1 Parent(s): e804310

Upload scripts/deploy_spark_t4.sh with huggingface_hub

Browse files
Files changed (1) hide show
  1. scripts/deploy_spark_t4.sh +4 -4
scripts/deploy_spark_t4.sh CHANGED
@@ -13,9 +13,9 @@
13
  # CUDA 后端完整支持的架构,编译一次即可,之后日常使用无需再编译。
14
  #
15
  # 【量化档位怎么选(T4 16GB 显存)】
16
- # Q8_0 (8bit) 4.07GB 质量近无损,T4 跑 32k~64k 上下文很从容 <- 默认
17
  # Q6_K (6bit) 3.15GB 质量与速度折中
18
- # Q4_K_M(4bit) 2.42GB 速度最快、可冲 128k+ 长上下文
19
  # 注意: 官方仓 XHToken/Spark-X2.5-4B-GGUF 里的 7.66GB 文件是 F16
20
  # 全精度(不是 8bit),T4 上没必要用;8bit 用本脚本的默认 imatrix 仓。
21
  #
@@ -23,7 +23,7 @@
23
  # chmod +x deploy_spark_t4.sh
24
  # ./deploy_spark_t4.sh deps # 1. 装系统依赖 + 构建工具
25
  # ./deploy_spark_t4.sh build # 2. 克隆 fork 并编译 CUDA 版(约10~20分钟)
26
- # ./deploy_spark_t4.sh download # 3. 下载量化模型(默认 Q8_0
27
  # ./deploy_spark_t4.sh serve # 4. 启动 OpenAI 兼容 API 服务
28
  # ./deploy_spark_t4.sh test # 5. 发一条测试请求
29
  # ./deploy_spark_t4.sh status # 查看运行状态
@@ -38,7 +38,7 @@
38
  set -euo pipefail
39
 
40
  # ---------------------------- 可调配置 --------------------------------------
41
- QUANT="${QUANT:-Q8_0}" # Q8_0 / Q6_K / Q4_K_M / Q5_K_M ...
42
  GGUF_REPO="${GGUF_REPO:-miifanboy/Spark-X2.5-4B-i1-GGUF}" # 含全档位 imatrix 量化
43
  LLAMA_REPO="${LLAMA_REPO:-https://github.com/XHToken/llama.cpp.git}"
44
  BASE_DIR="${BASE_DIR:-$HOME/spark-t4}"
 
13
  # CUDA 后端完整支持的架构,编译一次即可,之后日常使用无需再编译。
14
  #
15
  # 【量化档位怎么选(T4 16GB 显存)】
16
+ # Q8_0 (8bit) 4.07GB 质量近无损,T4 跑 32k~64k 上下文很从容
17
  # Q6_K (6bit) 3.15GB 质量与速度折中
18
+ # Q4_K_M(4bit) 2.42GB 速度最快、可冲 128k+ 长上下文 <- 默认
19
  # 注意: 官方仓 XHToken/Spark-X2.5-4B-GGUF 里的 7.66GB 文件是 F16
20
  # 全精度(不是 8bit),T4 上没必要用;8bit 用本脚本的默认 imatrix 仓。
21
  #
 
23
  # chmod +x deploy_spark_t4.sh
24
  # ./deploy_spark_t4.sh deps # 1. 装系统依赖 + 构建工具
25
  # ./deploy_spark_t4.sh build # 2. 克隆 fork 并编译 CUDA 版(约10~20分钟)
26
+ # ./deploy_spark_t4.sh download # 3. 下载量化模型(默认 Q4_K_M
27
  # ./deploy_spark_t4.sh serve # 4. 启动 OpenAI 兼容 API 服务
28
  # ./deploy_spark_t4.sh test # 5. 发一条测试请求
29
  # ./deploy_spark_t4.sh status # 查看运行状态
 
38
  set -euo pipefail
39
 
40
  # ---------------------------- 可调配置 --------------------------------------
41
+ QUANT="${QUANT:-Q4_K_M}" # Q4_K_M(默认) / Q8_0 / Q6_K / Q5_K_M ...
42
  GGUF_REPO="${GGUF_REPO:-miifanboy/Spark-X2.5-4B-i1-GGUF}" # 含全档位 imatrix 量化
43
  LLAMA_REPO="${LLAMA_REPO:-https://github.com/XHToken/llama.cpp.git}"
44
  BASE_DIR="${BASE_DIR:-$HOME/spark-t4}"