Класифікація даних для AI
"Чи можу я залити цей файл у ChatGPT?" — найчастіше питання співробітників. Без класифікації даних CAIO стає bottleneck — кожне рішення проходить через вас. З класифікацією люди приймають рішення самі, дивлячись на просту матрицю. Цей модуль дає вам 4-рівневу модель та готовий шаблон matrix.
Що ви опануєте
- 4-рівнева модель класифікації даних
- Як побудувати matrix даних × AI-інструменти
- Найбільш частий реальний ризик (і як його запобігти)
- Технічні контролі, що підкріплюють policy
Концепція 1: 4-рівнева модель
Більшість enterprise використовують 4 рівні класифікації:
| Рівень | Назва | Приклади | Хто має доступ |
|---|---|---|---|
| 1 | Public | Маркетингові матеріали, прес-релізи, public-сайт | Будь-хто |
| 2 | Internal | Внутрішні документи, презентації для співробітників | Усі співробітники |
| 3 | Sensitive | Стратегічні плани, фінансові звіти, HR-документи | Обмежені групи |
| 4 | Regulated | PII клієнтів, medical records, payment data | Тільки уповноважені + audit |
Кожен документ у вашій організації повинен мати один з цих 4 рівнів. Без класифікації — він є за замовчуванням Internal (м'яке правило, не для regulated industries).
Концепція 2: Матриця даних × інструменти
Це серце governance. Рядки = рівні даних, стовпці = AI-інструменти. Кожна клітинка = "схвалено", "умовно", "заборонено":
| Дані ↓ / Інструмент → | ChatGPT (consumer) | M365 Copilot | Внутрішня RAG | Кастомний agent |
|---|---|---|---|---|
| Public | ✅ | ✅ | ✅ | ✅ |
| Internal | ❌ | ✅ | ✅ | ⚠️ approval |
| Sensitive | ❌ | ⚠️ tenant-only | ✅ | ⚠️ deep review |
| Regulated | ❌ | ❌ | ⚠️ approval | ❌ |
Ця таблиця — найбільш практичний artifact CAIO. Друкуйте, вішайте на корпоративному intranet, включайте в onboarding.
Microsoft гарантує tenant isolation для Copilot M365, тобто ваші дані не йдуть на тренування. Але це працює тільки для документів у вашому M365-tenant, не для зовнішніх файлів, що ви залили в чат.
Концепція 3: Найбільший реальний ризик
Клієнтські дані у ChatGPT consumer-tier. Це найчастіша реальна ситуація в усіх компаніях:
- Менеджер копіює фрагмент клієнтського контракту у chat.openai.com щоб "переписати красивіше".
- Аналітик заливає Excel з financial data щоб згенерувати summary.
- HR копіює CV кандидата (PII!) щоб "проаналізувати fit".
Усі троє — порушують GDPR, CCPA, можливо SOX. І всі троє не знають, що зробили щось погане.
У вашій компанії, цього тижня, хтось зробив це. Прийняття того, що це відбувається — перший крок до контролю.
Концепція 4: Технічні контролі
Policy без technіки ламається за 3 місяці. Базовий стек технічних контролів:
| Контроль | Що робить | Приклад технологій |
|---|---|---|
| DLP (Data Loss Prevention) | Блокує copy-paste sensitive data у browser | Microsoft Purview, Symantec DLP |
| CASB (Cloud Access Security Broker) | Бачить usage SaaS AI-сервісів | Defender for Cloud Apps, Netskope |
| Browser policies | Блокує доступ до consumer AI-сайтів | Group Policy, Chrome Enterprise |
| Endpoint AI inspection | Сканує AI-prompts на класифіковані дані | Nightfall, Strac |
Не треба все одразу. Почніть з DLP у M365 + browser block для consumer AI-сайтів. Це покриває 70% ризику.
Концепція 5: AI-output теж потребує класифікації
Прихований ризик: AI-output може містити sensitive data, навіть якщо input виглядав "чисто".
Приклад: RAG-bot шукає по SharePoint. Користувач питає "хто наш клієнт з найбільшим річним договором?" — bot повертає назву клієнта + суму, навіть якщо це Sensitive-рівень даних.
Класифікуйте output-flow окремо. Питання: де результат AI-роботи зберігається і хто бачить? Якщо output йде у Slack-channel — застосовується класифікація даних того channel'у, не лише original-input.
Чекліст: налаштування класифікації
- Узгодити 4-рівневу модель з Legal + CISO (адаптувати під вашу галузь)
- Побудувати matrix даних × всі схвалені AI-інструменти
- Опублікувати matrix на intranet з search-функцією
- Включити у onboarding-тренінг для всіх нових співробітників
- Налаштувати DLP-правила, що блокують Sensitive/Regulated у consumer AI
- Налаштувати quarterly review матриці при появі нових інструментів
Глибше у джерелах
Підсумок
Класифікація — не для compliance-теки. Це інструмент щоденного прийняття рішень. Якщо співробітник не пам'ятає категорії — її треба спростити, а не вимагати "вивчити". 4 рівні + 1-page matrix + DLP — це формула, що працює.
Наступний модуль: Регуляторний ландшафт — EU AI Act, NIST RMF, GDPR + sector-specific вимоги.