Llama 4 вызывает сомнения
Llama 4 вызывает сомнения; Gemma 3 лидирует среди открытых моделей
После релиза Llama 4 Scout и Maverick первые отзывы оказались крайне негативными: параметры MoE, масштаб и заявленные преимущества не соответствуют реальным результатам в бенчмарках, а обсуждения вокруг якобы «честности» тестирования набирают обороты. В независимых тестах Maverick и Scout демонстрируют слабые показатели по ряду задач, что подрывает доверие к открытым весам Meta*. Лицензия Llama усложняет локальный запуск и вызывает обвинения в том, что модель остаётся слишком закрытой, чтобы считаться открытой.
На этом фоне Gemma 3 лидирует среди открытых моделей: Google удаётся удерживать преимущество в качестве и доступности, и многие эксперты считают Gemma 3 на данный момент самым сильным выбором в открытом сегменте. В то же время часть сообщества сомневается в подлинности тестов и ожидает дальнейших проверок, но факт остаётся: открытые пользователи в целом склоняются к Gemma 3 как к более надёжной альтернативе Llama 4.
Реакция сообщества на релизы Llama 4 Scout и Maverick
Реакция сообщества на релизы Llama 4 Scout и Maverick оказалась одной из самых критичных за последнее время: пользователи спорят о реальных результатах, сомневаются в корректности подач данных и в выборе бенчмарков, предполагая манипуляции и заниженные критерии. В сравнении с волной восторга вокруг Gemini 2.5 Pro обсуждения вокруг Llama 4 звучат как предупреждение: открытые веса Meta* не кажутся по-настоящему открытыми, а выглядят лицензированными под жесткие условия.
Независимые тесты, включая Arena, часто демонстрируют слабые или непоследовательные результаты Maverick и Scout, усиливая ощущение, что метрики подбираются под нужный результат. Мнения расходятся: одни видят попытку подтянуть рейтинги, другие — просто слабую реализацию. В итоге многие считают, что Meta* не оправдывает ожиданий как опенсорс-проект, тогда как Gemma 3 остаётся более надёжным примером открытой модели.
Что внутри: архитектура и масштаб Llama 4
Внутри Llama 4 Meta* выбрала путь расширения смеси экспертов и масштабирования. Scout и Maverick рассчитаны на быструю работу на мощном железе, опираясь на MoE и большие контекстные окна. Scout — 17 млрд активных параметров, 16 экспертов, 109 млрд суммарно; Maverick — 17 млрд активных, 128 экспертов, 400 млрд суммарно. Такая конструкция ориентирована на высокую производительность на HPC-оборудовании и сложно поддаётся запуску на потребительских GPU. Обещания скорости и эффективности звучат скептически для части сообщества. По независимым тестам возможность длинного контекста теоретически есть, но на практике результаты в рассуждениях и коде не подтверждают громких заявлений.
Лицензия Llama: ограничения и последствия
Лицензия на Llama запрещает крупным компаниям свободно использовать модели и требует явного указания использования, вплоть до упоминания «Llama» в заголовках и соблюдения политики использования. Эти ограничения ставят под сомнение идею полного опенсорса и создают преимущества для иностранных игроков и правительств, в частности Китая, которые могут обходить правила и выигрывать за счёт ограничений. Европейским компаниям такие условия добавляют ещё больше препятствий. В результате часть экспертов ставит под вопрос статус открытых весов: Meta* позиционирует веса как открытые, но лицензия и требования по использованию подрывают этот тезис и вызывают споры о том, насколько модель остаётся действительно открытой.
Arena и спорные бенчмарки: доверие к метрикам
Одним из самых спорных аспектов являются рейтинги Arena. Llama 4 заняла второе место с рангом 1417, но методология ранжирования вызывает сомнения: оптимизация под Arena может искажать реальные способности моделей. В независимых тестах Maverick и Scout нередко выглядят слабее конкурентов, а некоторые бенчмарки дают спорные или противоречивые выводы. Этот разнобой в данных подсказывает, что нельзя слепо доверять Arena — нужно проверять модели на собственных задачах и в реальных сценариях. В противном случае легко попасть под эффект закона Гудхарта, когда мера становится целью.
Общественные голоса и итоговые выводы
Общественные голоса продолжают звучать: независимые отзывы из Reddit, Groq Cloud и персональные бенчмарки сохраняют критическое настроение. Эксперты подчёркивают, что эти модели могут выиграть в нишах агентской работы и мультиинструментального взаимодействия, но общая картина по качеству рассуждений и генерации остаётся неполной. На сегодня Gemma 3 остаётся лидером в открытом сегменте, а Llama 4 вызывает больше вопросов, чем уверенности.
При этом сохранение привлекательной лицензии и будущие обновления могут изменить расклад, но сейчас ожидания от Meta* заметно снизились. В открытом ИИ ситуация может измениться по мере появления новых релизов и более прозрачной верификации результатов.
* Компания "Мета" - признана экстремисткой