⚖️
Governance та ризики · Модуль 2 з 3

Класифікація даних для AI

Не всі дані можна заливати в усі AI-інструменти. Чітка класифікація розв'язує 80% непорозумінь.

40 хвМодуль 2/3
Прогрес треку67%

Класифікація даних для AI

"Чи можу я залити цей файл у ChatGPT?" — найчастіше питання співробітників. Без класифікації даних CAIO стає bottleneck — кожне рішення проходить через вас. З класифікацією люди приймають рішення самі, дивлячись на просту матрицю. Цей модуль дає вам 4-рівневу модель та готовий шаблон matrix.

Що ви опануєте

  • 4-рівнева модель класифікації даних
  • Як побудувати matrix даних × AI-інструменти
  • Найбільш частий реальний ризик (і як його запобігти)
  • Технічні контролі, що підкріплюють policy

Концепція 1: 4-рівнева модель

Більшість enterprise використовують 4 рівні класифікації:

РівеньНазваПрикладиХто має доступ
1PublicМаркетингові матеріали, прес-релізи, public-сайтБудь-хто
2InternalВнутрішні документи, презентації для співробітниківУсі співробітники
3SensitiveСтратегічні плани, фінансові звіти, HR-документиОбмежені групи
4RegulatedPII клієнтів, medical records, payment dataТільки уповноважені + audit

Кожен документ у вашій організації повинен мати один з цих 4 рівнів. Без класифікації — він є за замовчуванням Internal (м'яке правило, не для regulated industries).

Концепція 2: Матриця даних × інструменти

Це серце governance. Рядки = рівні даних, стовпці = AI-інструменти. Кожна клітинка = "схвалено", "умовно", "заборонено":

Дані ↓ / Інструмент →ChatGPT (consumer)M365 CopilotВнутрішня RAGКастомний agent
Public
Internal⚠️ approval
Sensitive⚠️ tenant-only⚠️ deep review
Regulated⚠️ approval

Ця таблиця — найбільш практичний artifact CAIO. Друкуйте, вішайте на корпоративному intranet, включайте в onboarding.

ℹ️Чому tenant-only для M365 Copilot+Sensitive

Microsoft гарантує tenant isolation для Copilot M365, тобто ваші дані не йдуть на тренування. Але це працює тільки для документів у вашому M365-tenant, не для зовнішніх файлів, що ви залили в чат.

Концепція 3: Найбільший реальний ризик

Клієнтські дані у ChatGPT consumer-tier. Це найчастіша реальна ситуація в усіх компаніях:

  • Менеджер копіює фрагмент клієнтського контракту у chat.openai.com щоб "переписати красивіше".
  • Аналітик заливає Excel з financial data щоб згенерувати summary.
  • HR копіює CV кандидата (PII!) щоб "проаналізувати fit".

Усі троє — порушують GDPR, CCPA, можливо SOX. І всі троє не знають, що зробили щось погане.

🚨Це відбувається ЗАРАЗ

У вашій компанії, цього тижня, хтось зробив це. Прийняття того, що це відбувається — перший крок до контролю.

Концепція 4: Технічні контролі

Policy без technіки ламається за 3 місяці. Базовий стек технічних контролів:

КонтрольЩо робитьПриклад технологій
DLP (Data Loss Prevention)Блокує copy-paste sensitive data у browserMicrosoft Purview, Symantec DLP
CASB (Cloud Access Security Broker)Бачить usage SaaS AI-сервісівDefender for Cloud Apps, Netskope
Browser policiesБлокує доступ до consumer AI-сайтівGroup Policy, Chrome Enterprise
Endpoint AI inspectionСканує AI-prompts на класифіковані даніNightfall, Strac

Не треба все одразу. Почніть з DLP у M365 + browser block для consumer AI-сайтів. Це покриває 70% ризику.

Концепція 5: AI-output теж потребує класифікації

Прихований ризик: AI-output може містити sensitive data, навіть якщо input виглядав "чисто".

Приклад: RAG-bot шукає по SharePoint. Користувач питає "хто наш клієнт з найбільшим річним договором?" — bot повертає назву клієнта + суму, навіть якщо це Sensitive-рівень даних.

Класифікуйте output-flow окремо. Питання: де результат AI-роботи зберігається і хто бачить? Якщо output йде у Slack-channel — застосовується класифікація даних того channel'у, не лише original-input.

Чекліст: налаштування класифікації

  • Узгодити 4-рівневу модель з Legal + CISO (адаптувати під вашу галузь)
  • Побудувати matrix даних × всі схвалені AI-інструменти
  • Опублікувати matrix на intranet з search-функцією
  • Включити у onboarding-тренінг для всіх нових співробітників
  • Налаштувати DLP-правила, що блокують Sensitive/Regulated у consumer AI
  • Налаштувати quarterly review матриці при появі нових інструментів

Глибше у джерелах

Підсумок

Класифікація — не для compliance-теки. Це інструмент щоденного прийняття рішень. Якщо співробітник не пам'ятає категорії — її треба спростити, а не вимагати "вивчити". 4 рівні + 1-page matrix + DLP — це формула, що працює.

Наступний модуль: Регуляторний ландшафт — EU AI Act, NIST RMF, GDPR + sector-specific вимоги.

Завершили читання? Позначте модуль як пройдений.