Зарежда се...

Разследване: Дистилацията на AI модели не обяснява успеха на китайския Kimi K3

Разследване: Дистилацията на AI модели не обяснява успеха на китайския Kimi K3

Не бъди безразличен, сподели статията с твоите приятели:

Експерти по изкуствен интелект поставят под съмнение твърденията, че китайската компания Moonshot AI е създала своя напреднал езиков модел Kimi K3 основно чрез копиране на технология от американската компания Anthropic.

Спорът започна след изказване на научния съветник на Белия дом Майкъл Крациос, който обвини Moonshot, че е разработила Kimi K3 чрез копиране на модела Fable на Anthropic и използване на ограничени за износ към Китай изчислителни ресурси.

„Мащабното, тайно индустриално дистилиране, насочено към кражба на патентована американска технология и подкопаване на американските изследвания, е неприемливо„, написа Крациос в социалната мрежа X.

Той обаче не представи конкретни доказателства за твърденията си. Moonshot не е отговорила на въпросите относно процеса на обучение на Kimi K3.

Коментарът на Крациос беше подкрепен от финансовия министър на САЩ Скот Бесент, който заяви, че американските власти откриват „водни знаци“ от американски големи езикови модели в редица китайски AI системи. Не е ясно какво точно представляват тези знаци, а Министерството на финансите на САЩ не е предоставило допълнителна информация.

Според редица специалисти обаче обикновеното дистилиране на модел не може да обясни бързото развитие на Kimi K3. При този процес по-малък AI модел използва отговорите на по-голям модел, за да се обучи и да възпроизведе част от неговите способности.

„Не мисля, че можете да получите толкова силен модел за толкова кратко време след Fable само чрез дистилация. Просто няма достатъчно време. Fable е публично достъпен едва от 1 юли. Не можете да генерирате толкова данни, да обучите модел и да го пуснете в рамките на две седмици„, заяви пред TechCrunch Брейдън Ханкок, изследовател в Laude Institute и съосновател на Snorkel AI.

Подобно мнение изрази и изследователят на AI Нейтън Ламбърт от Allen Institute for AI. Според него значението на дистилацията намалява, тъй като моделите стават все по-сложни и компаниите използват по-напреднали методи като обучение с подсилване.

При класическата дистилация даден AI модел се използва като „учител“, който генерира отговори за обучение на нов модел. Процесът може да включва и анализ на начина, по който моделът достига до решенията си, както и използване на неговите отговори за допълнително обучение.

Според Ламбърт тези техники вече не са достатъчни за създаване на модели от най-висок клас. За постигане на резултати, близки до водещите AI системи, са нужни сложни методи за обучение с подсилване, които изискват огромни изчислителни ресурси.

Изпуснат

Това обаче не означава, че предишни модели на Anthropic не са допринесли за развитието на Kimi K3. По-рано компанията обвини Moonshot, DeepSeek и MiniMax, че системно са използвали нейни модели за дистилация. Anthropic заяви, че е открила милиони разговори с нейни модели, свързани с акаунти на тези компании чрез IP адреси и други метаданни.

Практиката за използване на дистилация не е ограничена само до китайски компании. Главният изпълнителен директор на SpaceX Илон Мъск също заяви, че компанията му е използвала дистилация на модели на OpenAI при разработката на Grok и че това е широко разпространен подход в индустрията.

Експертите предупреждават, че подценяването на китайските AI компании може да бъде грешка.

„Американците като цяло подценяват техническата експертиза на тези китайски екипи. Един от основателите на Moonshot е докторант от Carnegie Mellon University. Това са реални изследователи и инженери, които вършат сериозна работа„, заяви Ханкок.

Допълнителен спор предизвикват и обвиненията, че Moonshot може да е получила достъп до забранени за износ към Китай AI чипове на Nvidia, включително Grace Blackwell 300, както и до сървъри с такива ускорители в Тайланд.

Според Сам Бресник от Georgetown Center for Security and Emerging Technology съществува черен пазар за подобни технологии. Той посочи като пример обвинението срещу основателя на американския производител на сървъри Supermicro, свързано с предполагаем нелегален износ на модерни чипове към Китай.

„Подкрепям правилата за познаване на клиента при центровете за данни по света. Ако позволявате на компания да извършва огромни обучения върху най-модерния хардуер, трябва да има механизъм за отчетност кой е този клиент и какво прави„, заяви Бресник.

Според анализаторите спорът около Kimi K3 показва колко трудно е да се отделят законното развитие на AI технологии, използването на синтетични данни и потенциалното копиране на модели. Същевременно той подчертава нарастващото напрежение между САЩ и Китай в надпреварата за лидерство в областта на изкуствения интелект.

Alibaba отваря софтуера за своите ИИ чипове и подготвя китайски отговор на Nvidia CUDA

Последвайте нашият Telegram канал! Натиснете тук


Коментари

коментари

Post Comment

You May Have Missed

www.faktibg.com