Instructions to use vladlinv/ru-pii-gate with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use vladlinv/ru-pii-gate with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="vladlinv/ru-pii-gate")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("vladlinv/ru-pii-gate") model = AutoModelForSequenceClassification.from_pretrained("vladlinv/ru-pii-gate", device_map="auto") - Notebooks
- Google Colab
- Kaggle
О модели
Бинарная модель классификации документов для предварительной фильтрации перед NER-моделью. Она оценивает вероятность наличия персональных данных: документы с вероятностью выше выбранного порога передаются на разметку, остальные отсеиваются. Это снижает нагрузку на пайплайн при сохранении требуемой полноты.
Модель только оценивает, содержатся ли во фрагменте ПДн, но не определяет их типы и границы в тексте.
| vladlinv/ru-pii-ner-gliner2.5 | Распознавание типов и границ персональных данных. GLiNER2.5 |
| vladlinv/ru-pii-ner | Распознавание типов и границ персональных данных. ruRoberta-large |
| vladlinv/ru-pii-gate | Классификация фрагмента на наличие персональных данных |
Метрики
Валидационная выборка из 1 800 фрагментов, половина с ПДн
| Порог | Recall | Precision | F1 | TP | TN | FP | FN |
|---|---|---|---|---|---|---|---|
| 0.0026 | 0.996 | 0.652 | 0.788 | 896 | 422 | 478 | 4 |
| 0.0065 | 0.990 | 0.705 | 0.823 | 891 | 527 | 373 | 9 |
| 0.0402 | 0.980 | 0.829 | 0.898 | 882 | 718 | 182 | 18 |
| 0.1634 | 0.950 | 0.906 | 0.927 | 855 | 811 | 89 | 45 |
| 0.7356 | 0.900 | 0.972 | 0.935 | 810 | 877 | 23 | 90 |
Датасет
12 000 полностью сгенерированных примеров, половина с ПДн
Примеры охватывают личные документы физических лиц, кадровую и внутреннюю документацию организаций, корпоративные и административные материалы, юридические и нормативные документы, договорную, коммерческую, финансовую, бухгалтерскую и банковскую документацию. Также государственные и регистрационные документы, медицинские, социальные и образовательные материалы, производственную и техническую документацию, документы об имуществе и транспорте, деловую и пользовательскую переписку, реестры, справочники, формы и таблицы.
В датасете представлены варианты bad OCR, HTML, Markdown и других форматов. Документы нарезаны окнами от 32 до 8 192 токенов; длины равномерно распределены по выборке.
Архитектура
Модель построена на базе deepvk/RuModernBERT-small и дополнена бинарной классификационной головой.
Использование
Оценка одного фрагмента:
from transformers import pipeline
gate = pipeline("text-classification", model="vladlinv/ru-pii-gate")
print(gate("Иванов Иван Иванович, паспорт 4509 123456"))
[{"label": "PII", "score": 0.9987}]
Порог отсечения выбирается по таблице метрик вашего типичного набора данных. Фрагменты со score выше порога передаются NER-модели — vladlinv/ru-pii-ner или vladlinv/ru-pii-ner-gliner2.5 — остальные пропускаются без разметки.
Ограничения
Модель — только один из слоёв системы обезличивания ПДн. Она предназначена для предварительной фильтрации и должна использоваться вместе с моделью распознавания сущностей, регулярными выражениями, словарями и прикладными правилами. Ни модель, ни полностью автоматический пайплайн не могут гарантировать обнаружение всех чувствительных данных.
Модель определяет только наличие персональных данных во фрагменте и не находит их границы и типы. Она не выявляет коммерческую тайну и другую конфиденциальную информацию, не относящуюся к физическим лицам.
- Downloads last month
- 48
Model tree for vladlinv/ru-pii-gate
Base model
deepvk/RuModernBERT-small