Крупные разработчики языковых моделей — OpenAI, Anthropic и другие — столкнулись с нехваткой качественных данных для обучения нейросетей из открытых источников интернета. В поисках новых источников компании обратили внимание на внутренние корпоративные данные бизнеса.
Спрос на переписку в мессенджерах, электронные письма, записи видеозвонков и историю изменений программного кода резко вырос за последние месяцы. Такие данные показывают реальное взаимодействие сотрудников и могут значительно повысить качество обучения ИИ-моделей.
Показательный случай произошёл со стартапом Warmly, который разрабатывает ИИ-агентов и был недавно куплен компанией HubSpot. Уже после сделки Warmly получил четыре предложения на сумму до 300 тысяч долларов за протоколы совещаний и корпоративную переписку сотрудников. Все предложения были отклонены.
Рост торговли корпоративными данными обострил вопрос анонимизации. Компании, поставляющие такие данные для обучения ИИ, вынуждены тщательнее удалять информацию, которая могла бы раскрыть личности людей.
Гендиректор компании Integral, занимающейся обработкой данных, Шуб Синха подчеркнул, что фирма придерживается строгого процесса обезличивания, чтобы сохранить ценность данных и соблюсти требования конфиденциальности.
По словам главы брокера данных Protege Бобби Сэмюэлса, объём сделок его компании вырос с 30 миллионов долларов в прошлом году до как минимум 100 миллионов долларов в текущем. Он связывает всплеск интереса с активным развитием ИИ-агентов, способных выполнять реальные повседневные задачи пользователей.
Покупателей особенно интересуют записи о том, как разработчики решают технические проблемы, обсуждают финансовые показатели и демонстрируют работу программного обеспечения. Такие данные помогают точнее обучать модели практическим навыкам.
В первую очередь на рынке ищут данные стартапов, которым грозит банкротство или поглощение — именно такие компании чаще готовы продать внутреннюю информацию.
