Чья нейронка умнее? - QubStore

Чья нейронка умнее?

Фаундер агрегатора нейросетей BotHub делится наблюдениями о том, почему не существует одной универсальной ИИ-модели — у каждой свои сильные стороны.

Все современные текстовые нейросети устроены одинаково: в основе лежит архитектура трансформер, которая находится в открытом доступе. Разработали её, кстати, в Google. Всё различие между моделями заключается в подходе к обучению. Именно поэтому победителя в гонке «кто умнее» нет — есть специализация.

Если речь заходит о программировании, здесь вне конкуренции Claude от Anthropic — и это самая востребованная модель в BotHub. Её обучают последовательно: сначала простейшая арифметика, затем серьёзная литература вроде трудов Дональда Кнута. Над этим в компании трудятся около тысячи опытных разработчиков. А вот за энциклопедическими знаниями лучше идти к Gemini. Простой тест: спросите обе модели, из какой песни строчка, — Claude растеряется, а Gemini ответит без труда. Для контента 18+ ни Claude, ни Gemini не подойдут, зато Grok от Илона Маска такие запросы буквально обожает.

Разговоры о том, что китайские модели — DeepSeek, Kimi, Qwen — резко прибавили в качестве, требуют оговорки. Их главный козырь — дешевизна, но достигается она во многом за счёт того, что обучением занимаются западные ИИ: GPT, Gemini, Claude. Это обходится дешевле, чем нанимать тысячи живых специалистов. Получается, что прогресс китайских моделей напрямую зависит от успехов западных. Особенно заметно отставание в механизме рассуждений (Reasoning). Пример: на строчку из песни «Сектор Газа» топовая Kimi K3 рассуждала примитивно — «Может, Руки вверх? Нет. Пугачёва? Нет. Басков? Нет». И это при том, что по тестам она якобы на уровне Claude.

Зато Bytedance, создатели TikTok, выпустили очень сильную нейросеть для генерации видео — секрет в огромном массиве видеоданных для обучения. Здесь как нельзя кстати работает формула «данные — это новая нефть».

Отдельная история — российские нейросети. На одной конференции прозвучало громкое заявление: мол, наши математики и программисты лучшие в мире и скоро сделают ИИ, который обойдёт всех. Спорить о талантах не будем, но упущен ключевой фактор — железо. Речь о кластерах на сотни тысяч видеокарт Nvidia, AMD и Huawei, без которых ни обучение, ни работа моделей невозможны. У нас таких мощностей почти нет. Только за 2026 год США вложат в ИИ-железо 600–700 млрд долларов. Типичный американский кластер — это 20 тысяч новых H100, иногда до 100 тысяч, а у Яндекса всего 1500 старых A100. Неудивительно, что в недавнем интервью представитель компании признал: часть запросов «Алисы» будет обрабатываться на бесплатных китайских ИИ.

Ссылка на основную публикацию