Качество результата, который выдаёт модель, напрямую ограничено качеством данных, к которым она получает доступ. Поэтому первый практический шаг — инвентаризация источников информации внутри компании: корпоративные документы, регламенты, техническая документация, переписка, содержимое учётных систем, накопленные базы знаний. Значительная часть этих массивов не структурирована, хранится в разных форматах и дублируется, что снижает точность ответов и повышает расходы на обработку.
Подготовка включает очистку от устаревших версий, унификацию форматов, удаление дублей и описание метаданных: кто владелец документа, к какому подразделению он относится, насколько актуален. Отдельная работа — классификация по уровню чувствительности. Массивы разделяют минимум на три категории: открытые для всех сотрудников, ограниченного распространения и строго конфиденциальные.
Персональные и чувствительные данные
Информация, содержащая персональные данные клиентов и работников, требует особого обращения. Практика сводится к нескольким принципам: такие сведения либо исключаются из индексов, к которым обращается ИИ, либо обезличиваются и маскируются до загрузки. Обработка выполняется в контролируемой среде, а операции с чувствительными массивами журналируются. Это не только требование законодательства, но и способ снизить риск при последующем расширении проекта на новые подразделения.