Продолжение.
Данные - критический ресурс, данных не хватает и пока нет способа получить их быстро. Об этом рассказал технический директор «Цифровая платформа КАМАЗ» Витольд Коморовский, отвечая на вопросы о будущем и настоящем промышленного искусственного интеллекта в контексте нового закона об ИИ.
▪️ Документ фактически превращает данные в стратегический ресурс для обучения промышленных моделей. Какие отраслевые датасеты сегодня являются наиболее дефицитными, и изменит ли ситуацию возможный регулируемый доступ к госданным?
Данные - это стратегический ресурс, безусловно, и сам закон тут ни при чём. Одним из основных барьеров для развития Physical AI является отсутствие достаточного объема качественных данных для обучения ИИ.
Большие языковые модели научили на огромном массиве текстов. Сопоставимых по объему данных для обучения киберфизических систем просто не существует. Для обучения бытовых роботов сейчас создают целые «фабрики», где люди на камеру делают обыденные вещи: складывают полотенца, вытирают пролитую воду и т.п.
Для промышленных данных такой подход к сбору датасетов, скорее всего, не подойдет или будет чрезмерно дорог. Так что те, кто научится относительно просто и дешево собирать данные для Physical AI (действия оператора, телеметрия роботов, неуспешные операции и сценарии восстановления и т.п.), получат значимое преимущество.
И ценность, в том числе промышленных роботов, будет в возможности собирать данные для Physical AI. Будет ли регулируемый доступ к государственным данным помощью или препятствием - зависит от реализации инициативы.
▪️ Через пять лет рынок промышленного ИИ, вероятно, будет конкурировать уже не только технологиями, но и степенью соответствия требованиям государства. Какие компетенции станут главным конкурентным преимуществом?
Прочность цепи определяется всеми её звеньями, так что если у нас будут хорошие интеграции при слабых моделях или отличная модель и плохой harness - успеха не достичь. Но, как уже было сказано, данные для промышленного ИИ - критический ресурс сейчас, данных не хватает и пока нет способа их получить быстро.
Качественные промышленные датасеты практически нельзя купить, они формируются долго и в реальных производственных условиях.
Именно способность системно собирать, размечать и использовать такие данные, а затем воспроизводимо обучать и сопровождать модели на протяжении всего их жизненного цикла, на мой взгляд, станет главным фактором конкурентоспособности через пару лет.
Подписывайтесь на МашТех