Изкуственият интелект вече не е само инструмент, използван от учените при разработването на нови модели. Експеримент на Anthropic показва как AI може практически сам да извършва част от изследователския процес, да предлага решения, да обучава други модели и да проверява дали постигнатите резултати са по-добри.

Американската компания публикува ново изследване, озаглавено „Automated Researchers Can Reliably Mitigate Alignment Failures“, в което представя т.нар. Automated Alignment Researcher – автоматизиран AI изследовател.

Системата е получила задача да подобри поведението на модели при 10 различни категории проблеми, свързани с безопасността и съответствието им с човешките инструкции. Сред тях са склонност към измама, прекомерно съгласяване с потребителя и заобикаляне на защитни механизми.

Резултатът е впечатляващ – автоматизираният изследовател е успял да подобри представянето при всичките 10 теста, без това да доведе до общо влошаване на способностите на модела.

AI системата на практика изпълнява голяма част от работата, която традиционно се извършва от човешки изследователи. Тя преглежда наличната научна литература, предлага метод за решаване на конкретния проблем, обучава модел с него и след това анализира резултатите.

Успешните подходи се запазват и доразвиват, а неефективните се изоставят. Така процесът може да се повтаря многократно и значително по-бързо, отколкото ако всяка идея трябва да бъде проверявана ръчно.

Още по-интересно е сравнението с хората.

Според авторите на изследването най-добрият метод, открит от автоматизираната система, средно е надминал предложенията на опитни човешки изследователи в рамките на шест часа работа. Насочването на изследването от хора също не е довело до по-добри крайни резултати.

Разликата в разходите също е огромна. Anthropic оценява работата на автоматизирания изследовател на приблизително 4 долара на час за използван изчислителен ресурс, докато на участващите човешки специалисти компанията е плащала около 150 долара на час.

Експериментът привлича внимание заради една от най-обсъжданите идеи в развитието на изкуствения интелект – т.нар. recursive self-improvement, или рекурсивно самоусъвършенстване.

При него AI системите биха могли да участват в създаването на по-добри AI системи, които на свой ред да разработват още по-способни наследници.

Самата Anthropic вече признава, че все по-голяма част от разработването на нейните технологии се извършва с помощта на AI. Компанията обаче изрично подчертава, че все още не е достигнат етапът, при който една система напълно автономно може да проектира и разработи своя наследник.

Именно затова новият експеримент е по-скоро демонстрация на посоката, отколкото доказателство за появата на напълно самоусъвършенстващ се изкуствен интелект.

Има и сериозни ограничения. Резултатите зависят от качеството на тестовете, чрез които се измерва поведението на моделите. Ако даден проблем не може да бъде измерен надеждно, автоматизираната система може да оптимизира грешния показател.

Въпреки това Anthropic смята резултатите за ранно доказателство, че автоматизираните AI изследователи могат скоро да се превърнат в практически инструмент.

Ако тенденцията продължи, една от най-големите промени в AI индустрията може да бъде не просто създаването на по-мощни модели, а моментът, в който самите модели започнат да вършат значителна част от работата по създаването на следващите.