Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 108 20 27
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №254 /llama/ Аноним 04/08/26 Втр 18:18:53 1668203 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
изображение.png 1850Кб, 1920x843
1920x843
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1665553 (OP)
>>1663069 (OP)
Аноним 04/08/26 Втр 18:23:00 1668207 2
Ебать. На абуче увеличили лимит на количество форматированных блоков?
Аноним 04/08/26 Втр 18:25:37 1668210 3
gemma-color.png 16Кб, 640x640
640x640
gemma 4 12b qat для 8 гб
gemma 4 12b q6_k + mtp для 16+ гб
gemma 4 26b a4b q6_k mmap + mtp для 24+ гб
gemma 4 31b q4_k_L + mtp для 24+ гб
Все остальные существующие модели выкиньте нахуй
Аноним 04/08/26 Втр 18:26:56 1668213 4
>>1668210
> mmap + mtp
> выкиньте нахуй
Начнём с тебя
Аноним 04/08/26 Втр 18:27:02 1668214 5
>>1668210
>mtp
Говно без задач.
>qat
Еще большее говно.
Аноним 04/08/26 Втр 18:28:39 1668216 6
>>1668210
>qat
>mtp
Пережим пережимыч отупляющий и без того далеко не умницу. Серьёзно, откуда взялся форс 26б как великой умняши?
Аноним 04/08/26 Втр 18:31:24 1668221 7
>>1668216
>Серьёзно, откуда взялся форс 26б как великой умняши?
Она умняша для своего размера. Из коробки. Как только ты начинаешь что-то поверх вертеть она превращается в тупня.
Аноним 04/08/26 Втр 18:32:53 1668223 8
>>1668216
> Серьёзно, откуда взялся форс 26б как великой умняши?
Великолепна для своего размера. В пух и прах разносит плотные модели прошлого поколения, все вплоть до 32б включительно.
Аноним 04/08/26 Втр 18:36:13 1668225 9
>>1668216
Из говногайда с шапки очевидно. Абу апасные модели всем загоняет, оп в гайде рекомендует лоботомита. Вот шизы и ведутся
Аноним 04/08/26 Втр 18:38:29 1668226 10
Аноним 04/08/26 Втр 18:39:56 1668228 11
>>1668225
>оп в гайде рекомендует лоботомита
Покажи лучшую модель для конфигурации 16 + 16 или 12/8 + 32, которая будет работать также быстро и иметь столько же мозгов. Альтернатива это только моешный квен, который чуть выигрывает только в унитазно-кодинговых задачах.
Аноним 04/08/26 Втр 18:40:12 1668229 12
>>1668226
>чайный клуб, Mallorie
Это один анон, 128гб господин, да ещё ггуф и весов нет. Чел у тебя в посте 3 ошибки! Не стыдно в шизах треда не разбираться?
Аноним 04/08/26 Втр 18:41:21 1668230 13
image 67Кб, 607x1080
607x1080
>>1668214
>>1668216
>mtp
>Говно без задач
>Пережим пережимыч
Буйные снова атакуют тред. Держимся.
Аноним 04/08/26 Втр 18:46:32 1668233 14
>>1668230
Хватит чуму разносить собака ебаная. Тесты mtp показали что он в большей части нетиповых задач срезает скорость вместо увеличения. Буквально без него у тебя условные 20 токенов, с ним 17. Прирост ты получишь только спрашивая почему трава голубая а солнце зеленое.
Аноним 04/08/26 Втр 18:48:03 1668234 15
1754689033210.jfif 36Кб, 415x738
415x738
>>1668228
>12/8 + 32

12+48. Что даст лучший результат - гемма 26б или квен 122б? Допустим у меня специфичный вкус на тысячелетних вампирш с детскими телами всякую нёх с когтями/хвостами/чешуёй. Какая модель будет лучше держать образ монстровайфу не сбиваясь и не забывая, что у неё не кожа а шерсть/чешуя, что она ниггер биггер дан юзер, и имеет хвост/рога/длинную зубастую пасть? Хотя бы на дистанции в 50к контекста.
Аноним 04/08/26 Втр 18:51:34 1668236 16
>>1668234
Вопрос был про 12/8 + 32, ты притащил 12+48. Ты долбаеб, скажи честно?
Аноним 04/08/26 Втр 18:53:54 1668237 17
>>1668234
>Что даст лучший результат - гемма 26б или квен 122б?
>гемма 26б
>квен 122б
Кто сильнее - кашляющий младенец или водородная бомба?
Аноним 04/08/26 Втр 18:54:41 1668239 18
image 75Кб, 752x546
752x546
>>1668233
>Буквально без него у тебя условные 20 токенов, с ним 17
Буквально без него 25т/c а с ним 40+ т/c в моэ гемме Q8 при РП на русском. Хотя если кривыми руками настраивать, то может и да... Забываю иногда сколько в треде хлебушков. Прошу прощения.
Аноним 04/08/26 Втр 18:57:08 1668242 19
>>1668236
У него SWA. Просьба отнестись с пониманием
Аноним 04/08/26 Втр 18:59:07 1668244 20
>>1668239
Ну если это рп уровня "ты меня ебешь" то да, mtp будет работать. Даже драфтовый лоботомит на 200M параметров догадается "ты меня ебешь" ответить.
Аноним 04/08/26 Втр 19:01:53 1668245 21
>>1668244
Какое там у тебя РП уникальное, что MTP не может сделать верных предположений? Нука показывай, умник.
Аноним 04/08/26 Втр 19:09:39 1668248 22
>>1668245
У меня одна системная инструкция только 2.5к токенов весит, и то это самый "лайт" вариант из которого я вырезал более специфичные вещи потому что гемма их слишком буквально воспринимает. Мультитокен сразу же идет нахуй потому что ему нужно соблюдать верную разметку и учитывать разные параметры. Попробуй выкинуть серафину вместо нее персонажа посложнее прописать, удивишься как хорошо твой мтп работает.
Аноним 04/08/26 Втр 19:14:43 1668251 23
>>1668248
Конкретики не будет, ясно.

Хз братан, наверное у тебя все плохо, мой MTP дал прирост 30% к tg. Специально бенчи делал.
Аноним 04/08/26 Втр 19:17:03 1668252 24
>>1668248
Лолд. Ну с другой стороны я даже рад, что гейткип теперь не только по мощности железа и его стоимости, но и по скиллу чтения и навыка разбираться. Пока одни получают опыт качественного (и вдвое ускоренного) РП, другие сидят на аблитках с 0,0000001 клд, меромеро всяких и довольно урчат на 20 т/c. Все счастливы и все довольны - а это главное =)
Аноним 04/08/26 Втр 19:17:08 1668253 25
>>1668244
> Ну если это рп уровня "ты меня ебешь" то да, mtp будет работать
Ага, ведь как известно, именно на этом тренируют mtp модели. Ебанат, в голос. Каждую неделю тред не перестает удивлять манядодумками и эзотерикой я так чувствую
А то, что он семплерами вероятности сжимает и рандомайзит, из-за чего эффект mtp снижается, это так, по хуйне
Мимо тоже 30% прироста в рп
Аноним 04/08/26 Втр 19:18:23 1668255 26
>>1668229
Так, погодите. ОП == чайный клуб == меллори == н..ЭКСТРЕМИЗМ? Железо так то сходится, у всех 24+128
Аноним 04/08/26 Втр 19:19:37 1668256 27
>>1668253
>семплерами вероятности сжимает и рандомайзит
На гемме? Кекнул.
Аноним 04/08/26 Втр 19:19:53 1668257 28
>>1668236
Всм притащил? Обсуждение шло не за конкретное железо, а за народные моехи для работяг.
>>1668242
>У него SWA
Это у тебя сва. Отвечал на строчку:
>Альтернатива это только моешный квен, который чуть выигрывает
С хуя вы оба разорвались в визг?

>>1668237
>кашляющий младенец или водородная бомба
Проиграл.
Аноним 04/08/26 Втр 19:20:06 1668258 29
>>1668253
>он семплерами вероятности сжимает и рандомайзит
Или это, или слишком агрессивная выгрузка, или файнтьюн/аблитерация. На них mtp тоже херово работает.
Аноним 04/08/26 Втр 19:24:00 1668262 30
>>1668257
>Это у тебя сва. Отвечал на строчку:
Отвечал не на пост, продолжающий обсуджение двух постов, а отвечал на строчку. Вот что бывает с теми, кто сидит на гемме и прочих с SWA моделях! Задумайтесь
Аноним 04/08/26 Втр 19:24:02 1668263 31
>>1668257
>Обсуждение шло не за конкретное железо, а за народные моехи для работяг.
Ты ответил на конкретное обсуждение по конкретным категориям. И в любом случае, 122B моделька это нихуя не народная моеха для работяг. Работяги в лучшем случае сидят на 16 + 32, уж никак не на 48 гигах, это вообще что за комбинация должна быть? Две по 16 и две по 8? Или три по шестнадцать? Или одна 32 и одна 16? Много таких работяг видел?
Аноним 04/08/26 Втр 19:25:44 1668264 32
>>1668255
И он же автор гайда. Олдфаги знают, только нахуя протыков искать? Есть и есть.
Аноним 04/08/26 Втр 19:49:09 1668279 33
Привет, аноны. В треде давно не был, подскажите, пожалуйста актуальную базу для ерп 16 врам + 32 рам, хотелось бы 15к контекста но можно и 10.
Аноним 04/08/26 Втр 19:52:41 1668283 34
>>1668279
Гемма 26b и гайд для новичков в ОП-посте, где написано как её запустить. С твоим конфигом там и 64к контекста спокойно влезут.
Аноним 04/08/26 Втр 20:16:16 1668302 35
>>1668250 →
Тензорпараллелизм когда все по х4 будет нерационален, только если разблокируют шину 4.0. В пайплайн параллелизме все как обычно, генерация упирается в один поток упирается в псп врама, который быстрый. Не будет ускорения выше, но и не будет негативного импакта от шин, если только там не совсем х1 чипсетный.
Вот если все будут на х16 - уже можно попробовать, ген точно ускорится, но что будет с пп - вопрос.
мимо
>>1668226
> 69a3
Too small
Аноним 04/08/26 Втр 20:27:51 1668307 36
>>1668226
Это поинтереснее
inclusionAI/Ling-3.0-flash
Аноним 04/08/26 Втр 20:28:27 1668308 37
Аноним 04/08/26 Втр 20:41:39 1668321 38
Жора так никогда и не добавил поддержку линг флеша 2.6
Жорик — ничто, вместо крови понос
Вместо мозга пронюханный жадный нос
Вместо сердца у Жоры мусорный бак
Жора, бля, конченный, нахуй, мудак
Аноним 04/08/26 Втр 20:44:56 1668322 39
Чел который тредов 10 назад жаловался что в категории 100-200B ничего не выходит, надеюсь ты рад. Теперь у тебя каждые 3 дня новая модель выходит.
Аноним 04/08/26 Втр 20:50:46 1668327 40
Аноним 04/08/26 Втр 20:54:22 1668331 41
>>1668322
И ни у одной нет поддержки в жоре. Лол.
Аноним 04/08/26 Втр 20:55:07 1668332 42
>>1668220 →
Подробнее? Пативен вряд ли отправят, но риск бана у некоторых провайдеров есть. Правильно понимаю?
Аноним 04/08/26 Втр 21:33:23 1668356 43
Блять как же мне хочется чтобы нейронки подружили с виртуальными намордниками и всё это работало 120 раз в секунду по каждому глазу. Как только что-то такое появится вы меня не вытащите оттуда нахуй. От меня на стуле останется только лужа малафьи, я сдрочусь до последней молекулы. Когда менты будут вскрывать дверь из-за того что кум начнет стекать по потолку соседей снизу, они меня внутри не найдут. Они ничего не найдут. Только обдроченное кресло, шлем и стойку из перегоревших паскалей с распечатанными пластиковыми турбинами.
Аноним 04/08/26 Втр 21:56:11 1668371 44
>>1668234
>Какая модель будет лучше держать образ
Любая если добавить напоминалку в post-history instructions
Аноним 04/08/26 Втр 21:57:26 1668373 45
>>1668237
Ну тут кстати хуй знает, большие квены почему-то говно, хуже 27б. Я бы тут ещё задумался на кого ставить.
Аноним 04/08/26 Втр 21:59:19 1668375 46
>>1668264
>автор гайда
Он же покинул нас или я что-то путаю
Аноним 04/08/26 Втр 22:04:08 1668377 47
>>1668375
Именно так, Ватсон. Оп не может быть автором гайда, это исключено. Иначе бы он обновлялся. Плюс оп одобрял этот гайд прежде чем добавить. История дала крутой оборот...
Так где же правда?
Аноним 04/08/26 Втр 22:06:12 1668379 48
Аноним 04/08/26 Втр 22:08:56 1668381 49
>>1668356
Наверняка из скайрима уже можно сделать такую сборочку.
Аноним 04/08/26 Втр 22:12:06 1668386 50
Антохи, подскажите, как заставить модельку писать меньше текста? Я гонял тут одну карточку с чубса, и ну и это пиздец, каждый респонс по 1,5-2к токенов. Я говорю пиши меньше блять, а он мне ок, пон и высирает те же две тыщи токенов но с разбиением, типа "прошла неделя/месяц/год". Чё за хуйня блять, как заставить аутпут стабильно быть в пределах 300-500 токенов без обрывов текста и без затупов?
Аноним 04/08/26 Втр 22:12:23 1668387 51
Новая модель от лягушатников! Наконец-то comeback от Мистралей!

https://mistral.ai/news/shieldstral/
3B open-weights multimodal safety classifier that outperforms models up to 7x its size
Аноним 04/08/26 Втр 22:16:59 1668392 52
1754417631696.mp4 460Кб, 480x272, 00:00:06
480x272
>>1668387
>Наконец-то comeback от Мистралей
>3B
Аноним 04/08/26 Втр 22:17:10 1668393 53
>>1668386
В словах диапазон выставляй. ИИ не видит кол-во высранных токенов, но можешь посчитать слова.
А вообще :

Narration & Formatting:
- Balance: Maintain a 50/50 balance between dialogue and descriptive action.
- Length: Keep responses concise. Use 1 to 4 paragraphs maximum.
- Dialogue: “Use speech quotes for spoken words.”
- Thoughts: Use italics for internal monologues. (Example: I can't believe he just said that, he thought.)
- Action: Use double asterisk for making accent on specific words and loud sound/voice.
- Action: Use plain text for exposition and movement.
Аноним 04/08/26 Втр 22:18:59 1668396 54
>>1668216
>Серьёзно, откуда взялся форс 26б как великой умняши?
Оттуда же, откуда большинство анонов пришло в этот итт - из /aicg/ загона. Тут большинству нужно рп, а в нем гемма показывает себя отлично. Вот только если выйти за пределы выкручивания хвостиков лисодевочкам, то сразу видно, какое оно тупое по сравнению с квеном. А ведь скоро выходит квен 3.8, который еще сильнее даст на ротан гейме во всём кроме creative writing.
Аноним 04/08/26 Втр 22:19:48 1668397 55
>>1668386
Be concise. Write short answers.
Проверь что нет конфликтов с карточкой и самим системным промптом для нарратора.
В карточках часто добавляют назидания на стиль ответов.
Еще можешь руками пару раз обрезать ответы, тогда мб нейронка подхватит суть.
Аноним 04/08/26 Втр 22:21:09 1668398 56
>>1668379
Понимаешь, ризонинг макс добавляет в начало инструкции фразу "баля, ну ты ризонь там максимально кароч". И всё. Я префиллом ризонинга намного большего достигаю.
Аноним 04/08/26 Втр 22:21:45 1668399 57
Аноним 04/08/26 Втр 22:23:10 1668401 58
>>1668396
>то сразу видно, какое оно тупое по сравнению с квеном
А можешь привести примеры в чем он лучше (кроме очевидного кода и агентских задач)?
Аноним 04/08/26 Втр 22:26:45 1668403 59
>>1668377
>Плюс оп одобрял этот гайд прежде чем добавить.
Как будто ОП не может быть хитрым манипулятором, одобряя свой собственный гайд и делая вид, что исчез.
Аноним 04/08/26 Втр 22:33:40 1668410 60
>>1668393
Спасибо, попробую. А это лучше в промт добавить или в пх? У меня в постхистори сейчас сорта "держи персонажа, мразь". Одна инструкция не захуярит другую?
Ещё попробую ограничить лимит слов. 200 норм будет, это сколько токенов примерно? ~400? Как лучше об этом написать? Что-то типа "Limit response to 200 words or less"?
>>1668397
Не поверишь, я так и сделал. Раз срезал, два, три, четыре. Всегда работало, но в этот раз нейромозг как срал стенами текста убивая флоу, так и продолжил срать. Пришлось в тред зайти спросить.
>Проверь что нет конфликтов с карточкой
Нету. Карточка неплохая, на 2.5 токенов, без слопа, с адекватной разметкой. Хз чё моделька так перевозбудилась в этот раз.
Аноним 04/08/26 Втр 22:34:29 1668411 61
MiniMaxH300045.mp4 1286Кб, 1376x768, 00:00:07
1376x768
Аноним 04/08/26 Втр 22:39:30 1668415 62
>>1668403
Вот и я так думаю. Меллори это чайный клуб, его посты в прошлом треде были. Никуда не делся. Оп скорее всего заебался гайд поддерживать вот и слился. В эту версию верю, в ней противоречий нет. Скандалы интриги расследования.
Аноним 04/08/26 Втр 22:41:51 1668418 63
>>1668410
Пихать в систем промпт. Там подправь чуть чуть, я с черновика скопипастил, там не отредактирован и чуть лишнего, но суть я думаю понятна.
На глаз в таверне оцени, сколько тебе слов надо. удали в сообщении лишний текст. Посмотри сколько токенов сообщение занимает. И сделай диапазон от N-20% до N+20% в систем промпте.
Аноним 04/08/26 Втр 22:42:01 1668419 64
>>1668410
В карточке примеры диалогов есть? Если они через <start> подаются и там большие ответы то вот причина.
Аноним 04/08/26 Втр 22:42:04 1668420 65
>>1668192 →
Я тестил у него, нормально работает для своих размеров

>>1668206 →
Так это и есть Gemma 4 26b a4b ванильная, просто квантована до 12.4Гб
Аноним 04/08/26 Втр 22:53:48 1668431 66
>>1668398
На конкретно этом префилле проходило обучение. Расскажи, чего и каким префиллом достигаешь
Аноним 04/08/26 Втр 22:56:27 1668434 67
>>1668418
Спасибо за совет с диапазоном, это и правда лучше сработает. Всё понял, пойду чинить.
>>1668419
Нет, нету. Но тоже спасибо, теперь буду знать, что старты нужно убирать.
Аноним 04/08/26 Втр 23:05:13 1668437 68
Господа, там Квен 3.8 не обещают в формате МОЕ на 100-150B?
Я просто потыкал на апи Квен 3.8 MAX (сколько он там, 2,4Т?) и мне понравилось для ролеплея, хотелось бы получить небольшой кусочек сего локально (хуй с ней, с цензурой, у меня безъебабельный ролеплей пополам с блокнотингом).
Или будет только 27B плотняша и всё?
Аноним 04/08/26 Втр 23:05:21 1668438 69
Поставил гемму по гайду, ерп что-то не идет, очень сухо и без описаний почти, только факты. Системный промпт нужен? Может кто-нибудь поделиться?
Аноним 04/08/26 Втр 23:06:19 1668441 70
1785873877312.jpg 28Кб, 720x366
720x366
>>1668437
Обещают хуй к носу приложить
Аноним 04/08/26 Втр 23:08:39 1668444 71
>>1668441
В прошлый раз было так же, типа ни в коем случае не будет никакого квена, кроме квена3.5, иц овер. А потом взяли и выгрузили 3.6, и с этим так же будет.
Аноним 04/08/26 Втр 23:11:45 1668445 72
>>1668441
Печально сие.
Не заботятся господа хорошие о качестве моего ролеплея в автономном варианте.
А ведь могли бы увеличить количество тёплоты, лампоты и превозмогания, сгенерированных локально.
Аноним 04/08/26 Втр 23:16:34 1668449 73
>>1668431
>На конкретно этом префилле проходило обучение.

Так это даже не префилл, а тупо инструкция.
Замени его любой другой инструкцией с таким же смыслом - и наблюдай как она ничуть не хуже будет ризонить.
Аноним 04/08/26 Втр 23:17:59 1668451 74
>>1668396
Дак тупо нет ни одной модели, которая лучше геммы в соотношении интеллекта на скорость и вес модели.
Аноним 04/08/26 Втр 23:24:26 1668454 75
>>1668449
> Так это даже не префилл, а тупо инструкция
Инструкция, которая предшествует всем предыдущим, инжектится в начало. Самый настоящий префилл. Посмотри внимательнее на Жинжу, если тебе это интересно. И да, в том числе на этой инструкции в конкретном месте проходило обучение. Дипсик поддерживает структурный вывод и обучался на этом, что тоже есть в Жинже, подробнее в бумажках и статьях лабы.
>>1668126 →
> странно что Жоржанов ему противится.
Ничего подобного: https://github.com/ggml-org/llama.cpp/pull/26452
https://github.com/ggml-org/llama.cpp/issues/26369
> Support FP8 base model conversion
Все будет, но не сразу.
Аноним 04/08/26 Втр 23:27:10 1668455 76
>>1668454
> всем предыдущим
В рамках последнего инпута, конечно же. Пока меня тут снобы и любители полемики не съели.
Аноним 04/08/26 Втр 23:54:49 1668471 77
>>1668454
>Инструкция, которая предшествует всем предыдущим, инжектится в начало. Самый настоящий префилл.
Я имел ввиду что не префилл ризонинга.

>Посмотри внимательнее на Жинжу, если тебе это интересно.
Я знаю как там все устроено, я те инструкции уже внес в свою жинжу и даже добавил свои кастомные инструкции для low и medium ризонинга, написанные по аналогии. И они прекрасно работают.

> И да, в том числе на этой инструкции в конкретном месте проходило обучение.
Ты небось еще и из секты тех кто считает что пользовательские инструкции могут лоботомировать модели и потому той же аблитерации надо обязательно обучать.
Аноним 04/08/26 Втр 23:58:14 1668476 78
>>1668262
>отвечал на строчку
Как и все абсолютно здоровые люди. Только шизы с окр и гиперфиксацией отвечают на каждое слово в посте, а не на интересующую их часть. Pow core mill.
>>1668263
Ну так тут есть олигархи и с 128 и 64. У меня скромные 48. Вполне народные числа. От занимаемых плашками слотов мазерборды суть вопроса не изменилась. 26 гемму нахваливают с такой силой, что кажется будто она уделает даже крупномое и плотнях. И где обширные тесты, мнения, факты?

В прошлом треде был чел у которого 26б-умняша в восьмом кванте умудрилась проебать элементарную "" разметку, не забыв приправить текст излюбленным квеновским "—". У - умняша.
Аноним 04/08/26 Втр 23:58:23 1668477 79
>>1668471
> Ты небось еще и из секты тех кто считает что пользовательские инструкции могут лоботомировать модели и потому той же аблитерации надо обязательно обучать.
Где я в своем посте сказал что-нибудь плохое про пользовательские инструкции? Снова ищешь от кого ущемиться? Зачем? Рад, что у тебя все хорошо работает. И квант у тебя хороший. Только не взрывайся.
Аноним 05/08/26 Срд 00:03:09 1668482 80
>>1668396
> Вот только если выйти за пределы выкручивания хвостиков лисодевочкам
Ответственно заявляю что 26 для этих дел слабовата. Ты не только будешь удивляться ее забывчивости и неуместным реакциям, но и: не опишет нормально текстуру и структуру меха, не отличает глажку у кончика и основания, не понимает разницу между хвостовым и ушным мехом, вообще не понимает физику мокрого, так еще через 3 поста чар перевозбудится и прыгнет к тебе на хуй.
31 еще как-то, но тоже часто недостаточно.
мимо ценитель
Аноним 05/08/26 Срд 00:10:08 1668490 81
>>1668454
> Support FP8 base model conversion
Это не похоже на
> new ggml data format - fp8
и линк стоит на спекулятор.
>>1668476
> 26 гемму нахваливают с такой силой, что кажется будто она уделает даже крупномое и плотнях
Да потому что 12-гиговые и хуже бедолаги способны только ее запустить и она позволяет иметь хоть какое-то рп. Года два с такого перфоманса бы ахуели, да и если ты непритязательный - на безрыбье и гемма топ рп. В треде куча неофитов которым она норм, а с другими моделями сложности по железу или навыку.
Аноним 05/08/26 Срд 00:14:10 1668494 82
>>1668482
>Ответственно заявляю что 26 для этих дел слабовата.
Гемма в принципе во всем слабовата если реально смотреть на её производительность и полезность. Два её единственных плюса - приличный русский язык и очень хорошая скорость. Просто в её размере больше нет конкурентов. Квен 35B с натяжкой, потому что жрет больше и требует больше. Остальные конкуренты это старье на которое уже без слез не взглянешь.

Но даже так, русский геммы сильно быстро заебывает. Она сама по себе не может в вариативность и имеет примерно два чойса на следующий токен, так еще и русский это второстепенный для нее язык и там еще меньше разнообразия. Короче лично я вернулся на мистральский слоп до лучших времен. Пока не обновлю систему или пока не выйдет что-то еще из мелочи.
Аноним 05/08/26 Срд 00:17:34 1668499 83
>>1668482
>вообще не понимает физику мокрого, так еще через 3 поста чар перевозбудится
>пишешь: мокрый хво...
>гемма4: WET... CUNT? I GET IT! LET'S FUCK!

Ещё у геммы странная сосредоточенность на посторонних вещах. Я как-то пытался с Серафиной по душам попиздеть, просто уютный хендхолдинг в залитой солнцем роще, чистый холсом. Так гемма стала придумывать каких-то лесных существ, какие-то потусторонние силы правящие рощей, какие-то договоры на крови и ледяные ветра пронизывающие кожу. Я аж в карточку полез, чтобы проверить, нет ли там такого. Спойлер: там такого нет. Гемма с потолка начала сочинять то, чего не должно было быть, в итоге уведя повествование в дебри, в которых сама запуталась, забыв и про меня и про Серафину, начав галлюцинировать какую-то отдельную от нас историю. А мы с Серафиной би лайк: "Можно мы уже пойдём?"
Аноним 05/08/26 Срд 00:18:19 1668502 84
Дипсик действительно соевый и позитивный. Софтрефузы, редиректы на месте. Когда совсем некуда деться - выдает рефузы. Предыдущее превью было таким, 0731 и того более.
Аноним 05/08/26 Срд 00:29:29 1668512 85
>>1668494
> я вернулся на мистральский слоп до лучших времен
Держись там! Скорейшего апгрейда, а то совсем захвораешь.
>>1668499
А случаем нет никаких дополнительных и огромных инструкций и шизопромптов? Типа "пиши имеерсивно, захватывающе и много", только в виде полотна.
Хотел вот так угодить, другой бы восхитился насколько она инициативная, а ты носом воротишь. Абсолютно закономерно надо сказать, модель должно понимать настроение юзера, когда он хочет просто спокойно посидеть и поговорить, когда хочет обниматься, кумить или куда-то двигаться.
> начав галлюцинировать какую-то отдельную от нас историю
Хуясе ебать
Аноним 05/08/26 Срд 00:41:15 1668523 86
>>1668512
Нет конечно. Было бы не удивлялся бы.
>пиши имеерсивно, захватывающе
Иммерсивно и захватывающе не равно "уводи сюжет в дебри". Иммерсивно и захватывающе можно описывать даже высыхание краски, оставаясь на месте. Я поэтому и люблю хартфайр. Он натаскан на то, чтобы ты со своей вайфой сидел у костра 100к контекста и беседовал по душам.
>другой бы восхитился насколько она инициативная
Но ведь это Я инициатор и главное действующее лицо. Я задаю направление сюжету, выбирая что и куда дальше разовьётся. Если бы я хотел посмотреть тв, я бы включил тв, евпочя.
>модель должно понимать настроение юзера
У геммы свой путь. Шизопуть. И ты на нём - помеха.
>Хуясе ебать
Забавно, один раз. А потом ты приходишь в чайный клуб чтобы погладить девичьи хвостики, а вместо этого на вас падает метеорит и начинается зомби апокалипсис.
Мне так однажды наикозиейший наихолсомнейший роадтрип с вайфу гемма превратила в хоррор с элементами гуро. Говно блять. Для хоррора с гуро у меня есть специальные карточки. А эта вам не это. Эта для другого. Но для геммы всё едино.
Аноним 05/08/26 Срд 00:43:55 1668526 87
>>1668523
>100к контекста
>24b
>мистралетюн
Даже боюсь справшивать
Аноним 05/08/26 Срд 00:50:10 1668536 88
>>1668523
> Я поэтому и люблю хартфайр. Он натаскан на то, чтобы ты со своей вайфой сидел у костра 100к контекста и беседовал по душам.
Линк?
> Но ведь это Я инициатор
Это к тому, почему у других может быть совершенно иное мнение, такое наоборот по первой воспримут как манну небесную.
Аноним 05/08/26 Срд 01:16:28 1668549 89
Сегодня день рождения GPT OSS! 120б моделька в матеше и котинге ебала ВСЁ вплоть до Глм 4.7 и жирных 1Т+ моделей. Будут ли ещё такие гемы от попенов это неизвестно...
Аноним 05/08/26 Срд 01:54:41 1668557 90
MiniMaxH300049.mp4 827Кб, 608x352, 00:00:12
608x352
Аноним 05/08/26 Срд 01:59:05 1668558 91
>>1668549
> ебала ВСЁ
В перерывах глотала или сплевывала?
Аноним 05/08/26 Срд 02:05:05 1668561 92
>>1668558
Сорян, не всем интересен дроч. Как ассистент и задачерешатель оче неплохая моделька была, долгое время держалась. QAT из коробки тоже делал ее привлекательной.
Аноним 05/08/26 Срд 02:24:02 1668567 93
MiniMaxH300051.mp4 1024Кб, 608x352, 00:00:15
608x352
Аноним 05/08/26 Срд 02:36:56 1668571 94
>>1668561
Не дрочем единым, трудно представить себе задачи где она была бы настолько хороша чтобы соответствовать тому описанию. Код - слаб, довести до конца задачу у нее вызывало трудности. Дебаг или анализ готового проекта - с трудом понимает содержимое, путается, предлагает ошибочные решения. Контекстное окно на момент рилиза уже мало, четверть от него съедается максимальным ризонингом.
Аноним 05/08/26 Срд 03:10:26 1668578 95
1785888627593.png 217Кб, 1577x762
1577x762
Дособрал я это рокм под мишки, накатил жору и это пиздец.
+30% к тг, -30% к пп 🤡
Аноним 05/08/26 Срд 06:59:58 1668617 96
exllama.png 311Кб, 2191x760
2191x760
vllm-context.png 166Кб, 952x1344
952x1344
vllm-before-war[...].jpg 84Кб, 521x363
521x363
vllm-after-warm[...].jpg 38Кб, 558x370
558x370
fuck-this-shit.png 218Кб, 1872x747
1872x747
condom-for-b30-[...].jpg 2481Кб, 4000x3000
4000x3000
>>1668250 →
Пока на Gen2 x4, хотя на моих картах сейчас по x16 линий распаяно спасибо доброму человеку.

Я когда раньше тестировал TP на своих 3090/4090/5090, то пришёл к выводу, что, при Gen3 x4, тензор-параллелизм даёт профит только на плотных моделях, а вот для MoE такого канала связи мало - при пайплайн-параллелизме скорости у меня выше выходили. Жалко только, что ссылку на рентри потерял - кидал прошлой осенью бенчи на своём конфиге, так бы мог подтвердить цифры.

В случае 170HX их пока смогли анлокнуть только до Gen2. Поэтому, вероятно, TP может быть имеет смысл если их все посадить на условные x16 линий, но на моей текущей платформе я не могу себе такого позволить.

Планирую пока сидеть на пайплайн-параллелизме, а, в этом случае, PCIe-линии фактически не могут боттлнекаться т.к. активации между слоями копеечные, хоть на Gen1 x1 сажай это всё.

> будет сильно больше чем на ddr5 под разгоном
Тут хз если честно - по хорошему сравнивать надо в рамках одного движка т.к. даже на одинаковом конфиге, но на разных движках, скорости сильно отличаться могут. При этом выгрузка в RAM из +/- мейнстримных движков поддерживается только в жоре и в ktransformers. С жорой у меня много негативного опыта было в плане скоростей и качества квантов (при сравнении с квантами аналогичного размера для vllm/exllama), хотя понятно, что это, вероятно, лучший вариант для случая "1 карта + много RAM". Для ktransformers нужен гомогенный конфиг с видеокартами, с чем у меня раньше были проблемы, поэтому его толком не смотрел. Ещё буквально неделю-две назад для exllama запилили возможность выгрузки в RAM, надо разбираться.

Скидываю первые тесты при делении поровну по 6 картам на том, что было под рукой:
1. exllama Step-3.7-Flash 6.0bpw (196B A11B): при 58к контекста 1.3k pp/s, 27 tg/s
2. vllm Qwen-3.5-122B fp8 (A10B): при 50к контекста 11k pp/s да, 84 tg/s

По хорошему надо по нормальному бенчи погонять, но пока некогда было. По быстрому pp на vllm я перепроверил на нескольких длинных чатах - контекст действительно считается на уровне 10-11к токенов/сек в одном запросе, что выглядит очень вкусно.

В случае vllm там fp8 квант, а 170HX не имеет для него нативного ускорения - в идеале тут бы int4 кванты потестить. Да и что-то на полный набор VRAM загрузить, а то тот же 6.0bpw квант степа - это только около половины доступной мне сейчас VRAM.

Что-то я знатно сегодня вернее уже вчера подзаебался, пока подключал-настраивал эти 170HX, хотя там проблема больше в райзерах была и в собственной криворукости, а не в самих картах.
Аноним 05/08/26 Срд 07:11:32 1668619 97
>>1668617
Так че новая мета вот это некроговно вместо 3090? Че по игрулькам и стабл дифужену, видосы генерит?
Аноним 05/08/26 Срд 07:19:29 1668624 98
>>1668619
Воркфлоу на комфи для анимы что 8 сек на моей 5090 отрабатывал, на 170HX отрабатывает за 12 сек. Так-то неплохо с учётом того, что памяти тут в два раза больше, а цена в 3-4 раза ниже.

По остальному хз, не смотрел пока. Для видеогена возможно хопперы/блеквеллы поинтереснее будут за счёт поддержки fp8/fp4, там это сильно ролляло для того же Wan, хотя не знаю насколько это с новым MiniMax H3 актуально, не было пока возможности посмотреть его.
Аноним 05/08/26 Срд 07:52:31 1668633 99
>>1668499
>Так гемма стала придумывать каких-то лесных существ, какие-то потусторонние силы правящие рощей
Сука долбоёб.... Это в лорбуке всё. Задеваешь случайно слово активации (одно из слов "лес" насколько помню) и получаешь лором в еблет.
Пиздос, тредовики не знают как таверна работает. Отправлю вас всех в буткэмп /aicg/
Аноним 05/08/26 Срд 09:12:10 1668660 100
>>1668617
>>1668624
Ну че, выходит это всё не наёб был, прикольно за 8к таких накупить пачку.
Но для нищуков момент упущен, остаётся ждать рам за 150р/гиг опять
Аноним 05/08/26 Срд 09:20:14 1668662 101
>>1668660
Как обычно - ждуны сосут
Аноним 05/08/26 Срд 09:25:55 1668665 102
>>1668662
Ну не в этот раз. Если щас её брать это цена 64гб ддр5 в днс да и по миру, ну т.е кто хотел себе память по такой цене тот уже купил. Все ждут подешевления рам, каждая живая душа с пк, и оно наступит, как с видяшками. Не может мафия вечно наживаться на простых работягах.
Аноним 05/08/26 Срд 09:29:43 1668668 103
>>1668633
>Сука долбоёб
Зачем ты так о своих родителях. Они же старались...
>Задеваешь случайно слово активации (одно из слов "лес" насколько помню) и
Лорбук был отключен.
>Пиздос
Действительно пиздос, когда не знаешь о чём речь, но спотыкаясь бежишь доказывать, что постер в треде не прав.
Аноним 05/08/26 Срд 10:44:02 1668705 104
>>1668499
У меня 12б тройка так себя вела. Четвёрку, наоборот, приходится пинать ногами, чтобы она поднимала жопу и двигалась дальше по рп, не зацикливаясь на старых сценах. Даже с инструкциями продвигать сценарий и чаще брать инициативу в свои руки за персонажей.
Аноним 05/08/26 Срд 12:40:43 1668788 105
Анон, посоветовавший для дипсика сохранить все слои в оригинальных квантах, кроме экспертов. Сделал квант и он как будто реально меньше ошибается и чуть лучше работает. Пришлось конечно сгрузить один мое-слой на цпу и потерять примерно 0.4 т.с. и 30 пп. Зато куча освободившейся видеопамяти позволила загрузить дипсик с -np 2.

Вот рецепт, если кому надо, использовать с квантом батрухи.

^blk\.\d+\.ffn_gate_tid2eid\.weight$=i32

^blk\.[0-2]\.ffn_(gate|up|down)_exps\.weight$=mxfp4
^blk\.\d+\.ffn_down_exps\.weight$=mxfp4
^blk\.\d+\.ffn_gate_exps\.weight$=q3_K
^blk\.\d+\.ffn_up_exps\.weight$=q3_K

^token_embd\.weight$=bf16
^output\.weight$=bf16

^blk\.\d+\.ffn_gate_inp\.weight$=bf16

^blk\.\d+\.attn_compressor_(gate|kv)\.weight$=bf16
^blk\.\d+\.attn_compressor_ape\.weight$=f32

^blk\.\d+\.indexer\.proj\.weight$=bf16
^blk\.\d+\.indexer_compressor_(gate|kv)\.weight$=bf16
^blk\.\d+\.indexer_compressor_ape\.weight$=f32

^blk\.\d+\.hc_(attn|ffn)_fn\.weight$=f32
^output_hc_fn\.weight$=f32

^blk\.\d+\.attn_(q_a|q_b|kv|output_a|output_b)\.weight$=q8_0
^blk\.\d+\.indexer\.attn_q_b\.weight$=q8_0
^blk\.\d+\.ffn_(gate|up|down)_shexp\.weight$=q8_0
Аноним 05/08/26 Срд 12:52:47 1668796 106
Аноним 05/08/26 Срд 13:10:33 1668812 107
>>1668788
н*ня хуйни не посоветует
Аноним 05/08/26 Срд 13:25:14 1668824 108
>>1668788
Рад, что пригодилось.
> -np 2.
Не забудь сделать -kvu. По дефолту включается только если не трогать -np.
>>1668796
Он даже чуть лучше, потому что есть imatrix. Свой я тоже собирал с imatrix, от tarruda. Предвосхищая русикосрачи: нет, он не вредит русику. Проходили уже, были и PPL/KLD сравнения. Никакого трейд оффа нет, это просто лучший способ квантования, сложность - знать об этом и подобрать подходящий imatrix, они отличаются по архитектурам, для каждой желательно свою imatrix. Так будет эффективнее, но ни одна не навредит.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов