СПИСОК АКТУАЛЬНЫХ MOE МОДЕЛЕЙ ДЛЯ АНОНА ПО ВЕРСИИ 2CH-LLM-THREЯDE

MOE

Что такое MOE? LLM состоит из слоев. В каждом слое есть две основные части:

  1. Attention - отвечает за то, чтобы понять, как токены связаны друг с другом в контексте.
  2. Feed-Forward Network (FFN) - большая полносвязная сеть (MLP), которая делает нелинейные преобразования и содержит большую часть параметров модели. Именно в FFN хранится большая часть того, что условно называют «знаниями» модели.
    В обычной («dense») модели каждый токен проходит через весь FFN на каждом слое. Все параметры активны каждый раз. Проще говоря: в dense-модели каждый токен на каждом слое «включает» весь вычислительный блок целиком - используются все нейроны, все веса, все параметры без исключения. Ничего не выбирается и не отключается и любой токен проходит через один и тот же полный набор вычислений.

Так вот, умницам пришла идея, что не обязательно активировать весь FFN для каждого токена. Вместо одного большого FFN в слое можно сделать несколько меньших FFN. Они и называются экспертами. Перед ними ставится небольшой модуль - router (или gating network).
Вот он и решает для каждого токена он решает, каких экспертов нужно активировать.
Что же от этого меняется ? Это резко снижает вычисления. У MoE-модели есть два числа: общий размер модели и число активных параметров - например:

%Model_name% 355B-A32B (355B- общих, 32B - активных)

Это значит, что физически модель весит как 355B (все эксперты существуют и занимают память), но во время генерации на каждый токен считаются только ~32B параметров. Для тебя это означает: требование к вычислительной мощности (GPU, скорость инференса) - примерно как у 32B модели. Требования к памяти для хранения весов - ближе к 355B модели.

Kimi-K2 и Kimi-K2.5

(от 48GB-64GB VRAM и 512GB RAM)

K 2.7

Кими, большой до 1ТБ Рам и минимум 48VRAM. Жирный, толстый, неповоротливый. Самое большое что ты сможешь запустить на данный момент локально. Ризонинг прилагается
Создана для продвинутых задач (чтобы это не значило), безусловный лидер очередного бенча. Непобедимый мастодонт, кошко-жена и миска риса прилагаются. По отзывам с 2.7 наконец может в РП. Умный, внимательный, можно гладить 900 летних вампирш подозрительной комплекции и роста.

Мнение анона: Зайдет как любителям переусложненного с точки зрения сюжета и душного рп, так и простым инджоером. Именно в точности и осведомленности ее главное преимущество, тут не то что двойные трусы, можно 150к токенов назад заложить какую-то мелочь и наткнуться на нее когда будет уместна, или развлекаться по-разному зажимая чара в локациях и наблюдать как описывает обнимашки и еблю в невероятных позах с учетом всего, включая особенности комплекции легального персонажа. Есть и минусы: русский по стилю средний, без префилла/манипуляций с нелегальными канни и рядом тем хардрефьюз.

Z.ai и GLM

В целом- очень любимы тредом. Так как почти все модели этого семейства достаточно умные и умеют в РП/ЕРП.

(от 36GB VRAM и 198GB RAM)

GLM‑5.2

Ещё больше, еще умнее. 753B- все твои, если конечно сможешь запустить. В целом аноны пользуются прошлыми версиями, дело ли в цензуре или в том что данная линейка моделей отдаляется от пользователей на сверхзвуковых скоростях - не известно.

(от 24GB VRAM и 198GB RAM)

GLM‑4.7
GLM‑4.6

ЖЛМ 4.7, 4.6. Безусловный вин и любимица треда. Споры о том какая из версий GLM (4.7, 4.6, 4.5) лучше - так и не выявили победителя, решай для себя сам. В нормальных квантах может в кодинг, может выполнять агентские задачи, РП/ЕРП годное, русский язык один из лучших. Вменяемо запускается для РП в Q2. Да, да. При этом не совсем лоботомит.

(от 16GB VRAM и 64GB RAM)

GLM-4.5-Air-106B-A12B

Младшая версия умненького 4.5 с ризонингом. Быстрая, умная. Любима анонами в РП/ЕРП. В своём размере, наверное, лучшее что можно запустить. Контекста завезли аж 130к.

(от 8GB VRAM и 32GB RAM)

GLM-4.7-Flash

Новая быстрая агентская малыха в 30b. Работает на кофеварке, достаточно умная для своего размера.

Qwen 3

Целая россыпь Квенов.

(от 24GB VRAM и 192GB RAM)

Qwen3-Coder-480B-A35B

Квен для кодинга. Огромный. Nuff said.

Qwen3.5-397B-A17B

Свеженький большеквен. Могуч, квенист. Может в РП.

(от 24GB VRAM и 128GB RAM)

Qwen3-235B-A22B
Базовый инстракт 2507
2507 с ризонингом
Теперь с распознаванием картинок

Универсальные большие Qwen. Избыточно внимательные, способны в кодинг, работу с документами, мультимодалки могут работать с изображениями. В РП источник неутихающих срачей, потому что имея ум, умение писать, слушаться промта - будет тебя ломать специфичной манерой повествования, шизой возникающей на пустом месте и дичайшим имперсонейтом (Может и будет писать за тебя). Для настоящих ценителей страданий в РП, но способна доставить при желании пердолинга.

(от 16GB VRAM и 32-64GB RAM)

Qwen3.5-122B-A10B

Свежий средний моэквенчик. Хороший выбор для РП, если предпочитаешь это делать на квеносемействе. 256к контекста, ризонинг в наличии.

Qwen3.5-27B

Оппа, а что это у нас. А это у нас плотненький квенчик. На пару с 122B в целом годная моделька для поиграть и поприключаться. Ждём тюнов.

(Dense моделька: от 16GB VRAM)

Qwen3.6-27B

Плотненький квенчик. Быстр, умен, плотен. Неплохо умеет в РП, ризонинг эпичен и соев. Плотная малыха для тех кто устал от мистралек.
На свеженькую 3.6 тюнов не подвезли, но на прошлую версию пару интересных тюнов всё таки выкатили
Q3.5-BlueStar
Тюн ориентированный на РП от зерофаты.
Qwen3.5-27B-Writer
Тюн больше ориентированный на написание в соавторстве с тобой, {{user}}.

(от 8GB VRAM и 32-64GB RAM)

Qwen3.6

Свежая линейка 3.6 Qwen'ов. Быстрее, умнее, агентистее специально для кодомакак. Теперь можно угукать на 15% качественнее, по очередным бенчам.

Qwen3-80B-A3B

Средненький MoE квенчик. Может всего понемногу. Сносно умеет в РП.

Qwen3-Coder-30B-A3B

Квен поменьше для написания некомпилируемого.

Qwen3-30B-A3B

Небольшой MOE квенчик. Вменяем, быстр. Контекст 256к. По отзывам анонов- контекст держит хорошо.

Qwen_Webworld

Линейка квенов для вебкамщиц вебмакак.

А также TTS, Image и прочее. Партия насыпала как как следует

Google & Gemma

Великий в своём датасетейшестве и ужасный в своей хитрости. Компания бобра и gmail'a. Гугель! и его локальное гемейство гемма. Быстры, умны, соевы. В представлении не нуждаются. Авторы Гемини, владельцы ютуба и просто славные и очень жадные парни.

(Dense моделька: от 16GB VRAM)

gemma-4-31B

Плотная умница. Идеальный ассистент с характером, можешь считать с ней мятные пряники, можешь наслаждаться прекрасным русским языком. Модели семейства Gemma всегда отличались крайне качественными датасетами, прекрасным языком (включая Русский. Да, да, анон. Это та из немногих моделей где не хочется разбить себе ебало от того как она пишет на нашем великом и могучем.) И конечно же цензурой. Но с Gemma 4 гугель сделал хитро. Моделька чистейший умненький ассистент, что будет бросаться на тебя в ЕРП сразу и сходу, Yes-менит по страшному. Так что не подходит для РП. Но не за то любима, а за то что умница, сообразительная и поддерживает работу с картинками.
Да, можно кумить на русском, не переживай анон. Твои 900 летние вампирши будут в восторге..

(от 8GB VRAM - 32RAM)

gemma-4-26B-A4B

MOE гемма для нищебродов. Теперь если у тебя есть картошка, можно прикоснуться к миру ЛЛМ не запуская лоботомита. Умная, быстрая. Действительно умеет в отказы, в отличии от старшей сестры. Но выход есть:
G4-MeroMero
Тюнчик MOE геммы ориентированный на РП. Меньше отказов, больше plap-plap.

Nvidia

Компания Nvidia не только задирает цены на свои видеоускорители, но и выпускает модельки.

(от 16GB VRAM и 64GB RAM)

NVIDIA-Nemotron-3

Немотрон. Moe моделька от Nvidia. В меру умна, в меру быстра. На печках от зеленого лагеря работает особенно быстро. Чистейший ассистентотрон, добавить нечего.
Может ли в кодинг? Наверное. Но есть модельки побыстрее и поменьше. Может ли в РП. Ну пожалуй может, но есть модельки что пишут качественнее. Для экспериментов пойдет, не более. Nuff Said.

Mistral

Мистральки. Компания сделавшая виновую большую Мистраль и ряд маленьких- тюны на которые выходят до сих пор. Изредка обновляет свои модельки, не так давно разродилась новым большим мистралем, теперь в MoE архитектуре под вой с болот от ценителей™ денс моделек.

(от 24GB VRAM и 256GB RAM)

Mistral Large 3 - 675B-A41B

Новый большой мистраль. Теперь в MoE. Всё так-же умеет в русский язык, но кумтюнов как его старшая сестра, не имеет.

(16GB VRAM и 64GB RAM)

Mistral Small 4-119B-A6B

И вот без объявления войны, новая 4 версия малышки мистрали. Моделька новая, мнения смешанные. Продолжаем наблюдать.
Увы чуда не случилось. Мистраль продолжает падение на дно, к великому сожалению.

Mistral Medium 128B

Медиум умницы мистрали! Dense моделька для господ с ВРАМом. Увы, уже устарела.

DeepSeek

Синий кит. Расово китайская нейросеть взорвавшая в своё время инфополе. Кто то считает что флагманская модель деградирует, кто то топит за прогресс, истинна как известно: где то рядом.

(от 48GB VRAM и 256GB RAM)

DeepSeek 3.2

DeepSeek. 3.2 В представлении не нуждается. Ризонинг на месте, вечный победитель очередных бенчей. В своём размере хорош, агент, жнец и на дуде игрец. Может и в РП, но отмечают справляется хуже чем 3.1, цензура на месте, особенно с ризонингом.

Сollections

Да и в целом у DeepSeek есть и маленькие кодерские модели, по ссылке можно посмотреть

(от 24GB VRAM и 128GB RAM)

DeepSeek 4

Наконец то вышел. DeepSeek Flash. По отзывам тредовичков наконец то вин для любителей приключаться, готовить омлет с кошкодевочкой и спасать галактику. Будь внимаетелен, анон, данная моделька очень и очень плохо квантуется, так что залетать можно только с Q3_M и не жаловаться на ошибки и шизофрению модели. Ну а если ты гордый обладатель +36VRAM и 128RAM то ьы сможешь гонять её в нормальных весах. Однозначно рекомендована для скачивания.

GROK-2

(от 48GB VRAM и 256GB RAM)

GROK-2-270B-A115B

GROK-2. Cумрачное творение Илона Маска. 128к контекста. Есть жалобы на тяжесть контекста, и на то что начинает ломаться уже на 64к. По отзывам: любит и практикует кум.

StepfunAI

(от 16GB VRAM и 128GB RAM)

Step-3.5

Очередная весьма недурственная китайская моделька. Довольны быстра и умна для своего размера. Имеет вменяемую цензуру и ризонинг. Контекста завезли аж 256K.

Step-3.7

Продолжение неплохой линейки моделей. Легкий контекст, внимание к деталям. Если ищешь MOE ассистента, обрати внимание. Моделька заслуживает его.

OpenAI

ПопенАИ, одна из причин удорожания оперативной памяти, разработчики знаменитого GPT и просто славные парни.

(от 8GB VRAM и 32-64GB RAM)

Gpt-OSS 120B

Да это же ГПТ дома, хуй там. Очень умный и быстрый ассистент умеющий в кодинг. 128к контекста прилагаются. Цензура на месте

Gpt-OSS 20B

Маленькая версия ассистента. По отзывам анонов, моделька крайне тупая.

MiniMaxAI

Очередные азиатские модельки

(от 24GB VRAM и 192GB RAM)

MiniMax-M3

Развитие линейки MiniMax. Умнее, не быстрее, цензуры меньше.

(от 16GB VRAM и 128GB RAM)

MiniMax-M2.5

Новый минимими, только быстрее, умнее и бла бла бла. На практике улучшения есть, цензуры немерено. Чистейший ассистент для кодинга и суммарайза. Но некоторые аноны отмечали, что уже на 64к контекста начинает разваливаться.

MiniMax-M2.7

Больше@быстрее@Умнее. В версии 2.7 подвезли эмоционального интеллекта, что бы это не значило. Но на самом деле модель кратно стала лучше в РП, способна выдавать шикарнейшие диалоги, следовать нарративу, и в целом умница- но на этом хорошие новости заканчиваются. Модель крайне плохо квантуется, из за чего ошибки множатся, сущности путаются и в целом деградация даже на Q3 налицо. Увы. Проявления ассистента и желание угодить пользователю в наличии. Но если есть желание попердолиться, то попробовать стоит, начинай с Q4_K_S.

Solar-Open-100B

(от 8GB VRAM и 128GB RAM)

Корейская моделька от неправильных корейцев аж100b, активных подвезли 12b.

Edit

Pub: 09 Feb 2026 15:19 UTC

Edit: 10 Jul 2026 17:40 UTC

Views: 5469