Спрос на уникальные данные для обучения ИИ от крупных лабораторий и корпораций вызвал бум у стартапов по разметке данных. Один из них — Micro1, четырехлетний стартап, увеличивший валовой годовой доход с $100 млн до $500 млн за восемь месяцев. Удерживая 60–70% этой суммы, чистый годовой доход компании составляет $150–200 млн.
Крупные разработчики языковых моделей — OpenAI, Anthropic и другие — столкнулись с нехваткой качественных данных для обучения нейросетей из открытых источников интернета. В поисках новых источников компании обратили внимание на внутренние корпоративные данные бизнеса.
«Ваши данные конфиденциальны. Точка» — заявляет на своём сайте трекер менструального цикла Stardust. Однако новое исследование Mozilla показало, что это утверждение сильно преувеличено.
Генеральный директор Microsoft Сатья Надела предупредил: компании, использующие проприетарные ИИ-модели, фактически платят дважды — деньгами и ценными бизнес-данными.
Сенатор Элизабет Уоррен и конгрессвумен Мэри Гей Скэнлон готовят новую версию закона о защите медицинских и геолокационных данных — Health and Location Data Protection Act.
Ученые и инженеры создают климатический архив Earth’s Black Box, чтобы задокументировать изменения на планете для будущих поколений. Разработчики сравнивают его с авиационным самописцем, который поможет понять причины климатического кризиса.
OpenAI объявила о возобновлении программы по робототехнике. Это сигнал, что ведущие лаборатории ИИ соревнуются в обучении машин взаимодействию с физическим миром. Однако для создания роботов не хватает данных, аналогичных тем, что используются для языковых моделей.
m* планирует использовать данные от других компаний для персонализации вашей ленты и ответов ИИ. Раньше эти данные применялись только для рекламы.
Стартапы доэры ИИ сейчас редко привлекают инвесторов. Но CEO H1 Arial Katz считает, что не все SaaS одинаковы: workflow-компании можно заменить кодом, а поставщики данных — нет.
Гендиректор m* Марк Цукерберг заявил, что сотрудники компании умнее работников подрядчиков. Он считает, что данные от контрактных фирм менее ценны для обучения ИИ.
