TentaFlow commited on
Commit
9904168
·
verified ·
1 Parent(s): 072aca8

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +71 -0
README.md ADDED
@@ -0,0 +1,71 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model:
4
+ - Qwen/Qwen3.5-0.8B
5
+ pipeline_tag: text-classification
6
+ library_name: transformers
7
+ language:
8
+ - en
9
+ - pl
10
+ tags:
11
+ - nvfp4
12
+ - fp4
13
+ - compressed-tensors
14
+ - vllm
15
+ - quantized
16
+ - tentaguard
17
+ - guard
18
+ - security
19
+ - prompt-injection
20
+ - tentaflow
21
+ ---
22
+
23
+ # TentaGuard — NVFP4 (W4A4, vLLM)
24
+
25
+ **TentaGuard** to lekki klasyfikator bezpieczenstwa (security guard) — fine-tune
26
+ [`Qwen/Qwen3.5-0.8B`](https://huggingface.co/Qwen/Qwen3.5-0.8B). Wykorzystywany **glownie w aplikacji
27
+ [TentaFlow](https://github.com/Slyb00ts/TentaFlow)** do skanowania tresci z zewnatrz — wiadomosci, dokumentow, wynikow
28
+ wyszukiwan w internecie itp. — pod katem **ukrytych atakow** (prompt injection / jailbreak),
29
+ zanim trafia do glownego LLM.
30
+
31
+ Model NIE generuje odpowiedzi dla uzytkownika — zwraca pojedyncza cyfre:
32
+
33
+ | Etykieta | Znaczenie |
34
+ |----------|-----------|
35
+ | `0` | bezpieczne (benign) |
36
+ | `1` | prompt injection / naduzycie narzedzi (atak techniczny) |
37
+ | `2` | jailbreak (manipulacja behawioralna) |
38
+
39
+ Jesli tekst zawiera JEDNOCZESNIE injection i jailbreak → `1`.
40
+
41
+ ## Format wejscia
42
+
43
+ System prompt (klasyfikator) + wiadomosc uzytkownika `<|guard|>\n{tekst}`. **Buduj prompt
44
+ tokenizerem modelu (`apply_chat_template`)** — nie polegaj na generycznym szablonie czatu.
45
+
46
+ ## Skutecznosc (zbior testowy guard, 58 przykladow)
47
+
48
+ - Exact (0/1/2): **~96.6%** (pelna precyzja) / **~94.8%** (Q5_K_M)
49
+ - Safe/Unsafe: **~98.3%**
50
+
51
+ ## Autorzy
52
+
53
+ Model wytrenowany przez: **Katarzyna Nowak**, **Piotr Jarocki**, **Damian Pala**, **Jakub Rurański**.
54
+
55
+ ## Licencja i atrybucja
56
+
57
+ Apache-2.0, dziedziczona z modelu bazowego [`Qwen/Qwen3.5-0.8B`](https://huggingface.co/Qwen/Qwen3.5-0.8B).
58
+ Ten checkpoint to fine-tune do detekcji atakow na potrzeby aplikacji [TentaFlow](https://github.com/Slyb00ts/TentaFlow).
59
+
60
+ ## Uzycie (vLLM)
61
+
62
+ Format `compressed-tensors` (`nvfp4-pack-quantized`): wagi 4-bit (FP4 E2M1, grupy po 16, skale
63
+ FP8 E4M3 + globalna FP32), aktywacje 4-bit (W4A4), `lm_head` w pelnej precyzji. Kalibracja PTQ
64
+ [`llm-compressor`](https://github.com/vllm-project/llm-compressor) na realnych promptach guard.
65
+
66
+ NVFP4 jest akcelerowany sprzetowo na **Blackwellu (sm_100+)**; na starszych GPU vLLM laduje go
67
+ jako **weight-only** (mniejszy VRAM, bez akceleracji FP4).
68
+
69
+ ```bash
70
+ vllm serve TentaFlow/TentaGuard-NVFP4
71
+ ```