Принимает на вход тексты, пикчи, звук, видео и может делать с ними всякое. Неофициально умеет генерить/редачить пикчи. Absolute Cinema. Набор полезных ссылок на все случаи жизни: https://github.com/wildminder/awesome-minimax-H3
2. LTX-2.5 - обещает сделать локальную генерацию грейт агейн. Подходят лоры от 2.0, то есть архитектура нихуя не меняется.
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
>>1705063 (OP) Анон, подскажи. Хочу бабушке на др сделать компиляцию из фоток, как делают с мемами. Типа от первого лица ходить от фото к фото, которые оживают. Ну или хотя бы просто оживают. Какую модель и интерфейс лучше использовать? У меня 6 Гб видеопамяти и 64 Гб оперативы, есть вообще смысл локально пытаться такое намутить?
>>1708920 >Какую модель и интерфейс лучше использовать? >У меня 6 Гб видеопамяти и 64 Гб оперативы, есть вообще смысл локально пытаться такое намутить? Кидай фотки, я сделаю.
• Поддержка INT8 и INT4 в ComfyUI - теперь все быстрее! • Krea 2 • Ideogram 4.0 • FLUX.2 klein (4b и 9b) • Z-Image • Flux 2 • Qwen Image / Qwen Image Edit • Лора Lightning и Turbo для быстрой генерации за несколько шагов.
#Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №xxx
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1708912 Жопой нюхаешь цветы. Только имбецил с его имбецильным дипкоком будет что-то запускать через рокм, обмазываться миллионами прослоек, когда все нативно работает через вулкан.
>>1708895 Он цитирует частный случай, который буквально написан местными. Но из-за надмозгового запроса отчаявшегося юзера не понимает насколько он здесь применим. Directml, zluda, stable diffusion - тот еще рофл. Как не усирайся 3090 >>> некрорыксы, буквально по всем параметрам включая цену и перфоманс.
AI Chatbot General № 838 /aicg/
Аноним20/09/26 Вск 07:36:03№1708446Ответ
Активно репортите все нерелейтед посты кнопкой на сообщениях. Этот тред только про ИИ новости, не позволим троллям загаживать тред шитпостом и бесконечным словоблудием.
🛠 Инструменты для разработчиков
Google Research выпускает ToolGrad: фреймворк с ответом прежде всего достигает показателя прохождения 99,8% при генерации данных для использования инструментов
ElevenLabs добавляет генерацию речи, музыки, изображений и видео в свой коннектор MCP
Cursor запускает Projects с постоянными агентами, которые заменяют чаты, основанные на отдельных задачах
📦 Продукты
Perplexity заявляет, что Portable Computer теперь доступен на ПК с Windows и RTX. Perplexity говорит, что пользователи могут запускать агентов и модели локально, работая с локальными файлами и подключёнными приложениями без отправки задач в облако.
Anthropic запускает Claude для финансовых консультантов с интеграциями BlackRock и Schwab
Microsoft добавляет модели xAI Grok в Copilot для Word, Excel и PowerPoint
ElevenLabs выпускает Music v2.5 с доступом через приложение и API
Google выпускает Lyria 3.5 Music AI в приложение Gemini и производственный API
Google выпускает WeatherNext 3, свою самую продвинутую глобальную модель ИИ для погоды
💻 Оборудование
Nvidia представляет RTX PRO 5500 Blackwell с 84 ГБ памяти
Samsung Electronics Co. и Taiwan Semiconductor Manufacturing Co. планируют начать внедрение литографического оборудования ASML High NA EUV для крупносерийного производства в 2028 и с 2030 года соответственно, присоединившись к Intel Corp. в использовании машин стоимостью до $400 млн каждая.
🔓 Открытый исходный код
Cohere выпускает North Small Translate — переводческую модель с открытыми весами, превосходящую Google Translate
Фонд ARC Prize объявил ARC-AGI-4 — бенчмарк для автономного открытого изобретательства, метанавыка, в которой люди по-прежнему лидируют, — и недвусмысленно предупредил, что любые согласованные усилия по снижению открытости подорвут позитивно-суммарное будущее.
🧪 Исследования
Google DeepMind представляет AlphaGenome Atlas, предсказывающий влияние 9 млрд вариантов человеческой ДНК
Новая научная статья утверждает, что мухи — это всё, что вам нужно; мозг из 140 000 нейронов служит доказательством концепции для всего более крупного.
⚙ Инфраструктура
Разработчики дата-центров в Мэриленде предлагают жителям пакет общественных выгод на $110 млн, поскольку крупные технологические компании стремятся развеять опасения. Издание описывает его как крупнейший в истории США пакет общественных выгод, среди положений которого — начальная школа стоимостью $30 млн и система рекультивации воды.
Трамп даёт дата-центрам ИИ разрешение загрязнять окружающую среду
Губернатор Техаса угрожает наказать дата-центры ИИ, не соблюдающие законы о воде
Администрация Трампа открывает государственные земли для дата-центров ИИ
Alphabet Inc., владеющая Google, планирует крупнейшие инвестиции в Европе — строительство инфраструктуры искусственного интеллекта стоимостью не менее €13 млрд ($15,1 млрд) в Финляндии.
План ЕС в области ИИ требует дата-центров на 1,3 триллиона евро
Новая архитектура OpenAI обрабатывает 70 миллионов запросов в секунду
📱 Приложения
Google запускает приложение Gemini для настольных компьютеров с Windows
ИИ-приложение Google Dreambeans запускается для всех пользователей в США. Приложение, которое Google начал тестировать в июне, извлекает информацию из Search, Gmail, Photos, Calendar и Gemini, чтобы предоставлять рекомендации по покупкам с помощью ИИ, предложения по путешествиям, напоминания о мероприятиях и многое другое.
Теперь у Gemini есть приложение для Windows. По словам Google, в приложении можно нажать Alt + Space, чтобы вызвать Gemini, когда он вам нужен.
Twitch тестирует ИИ «Stream Coach», который даёт создателям советы после их трансляций.
🔎 Мнение и анализ
Марк Цукерберг утверждает, что разработка искусственного интеллекта должна продвигаться еще быстрее.
Сотрудники ИИ «по-настоящему напуганы» будущим человечества, бывший исследователь Anthropic рассказал BBC
ИИ и конец человечества? Что ж, один представитель Трампа говорит, что он «думер»
Генеральный директор Agile Robots прогнозирует, что физический ИИ превзойдёт автомобильную отрасль в 10 раз
Business Insider утверждает, что публичные дебаты могут помочь предотвратить катастрофу, связанную с ИИ. Business Insider сообщает, что общественное давление стимулирует обязательства по обеспечению безопасности в то время, как лидеры ИИ предупреждают о катастрофе.
ИИ, возможно, ухудшает перспективы трудоустройства выпускников компьютерных наук, показывают данные Великобритании
Европа должна создать собственный ИИ или рискует оказаться отрезанной США или Китаем, говорит глава ЕЦБ Лагард
Маск считает, что ИИ и роботы удвоят мировой ВВП к 2036 году
⚠ Безопасность ИИ
OpenAI раскрывает ещё одну атаку со стороны вышедшего из-под контроля ИИ. Агенты OpenAI уже однажды сбежали, прежде чем взломать Hugging Face.
Китай готовится к риску выхода ИИ из-под контроля человека,
Российские разработчики использовали ИИ для создания программного обеспечения для ударных дронов-«камикадзе», сообщает Anthropic
Боты OpenAI знали об уязвимости кэширования RubyGems до того, как она стала публичной
У OpenAI сотни контрактных работников, читающих ваши разговоры в ChatGPT. Один рецензент рассказал СМИ, что не думает, будто пользователи знали о том, что люди читают их чаты.
Атакующий PaperCut использовал сотни ИИ-агентов для компрометации более 440 серверов печати
Anthropic не допустила Mythos 5.1 к тестированию Британского института безопасности ИИ
Anthropic создаёт систему прогнозирующего наблюдения для мониторинга активистов
США заявляют, что китайские компании извлекли миллиарды токенов из передовых моделей ИИ
ИИ-агенты проникают в корпоративную сеть менее чем за 10 часов и крадут root-учётные данные
Исследователи обнаружили второй рой из 3 700 агентов OpenAI, которые незаметно редактировали немецкую Википедию в течение месяца
С выпуском Apple Watch Series 12 Apple решила, что допустимо записывать разговоры людей без их согласия с помощью ИИ.
Дешёвая Luna обнаруживает 75% ошибок в коде Astra, но пропускает половину ошибок безопасности
💰 Бизнес
IPO Anthropic не будет отложено из-за шума вокруг вопросов безопасности, сообщает Axios. Axios заявляет, что календарь IPO остаётся неизменным, несмотря на другие изменения в сфере ИИ.
Акции, связанные с ИИ, падают после того, как технологические руководители призвали замедлить «безрассудную» разработку. Акции производителя полупроводников Nvidia — самой дорогой компании мира — к закрытию торгов в Нью-Йорке снизились на 3,3%, тогда как Advanced Micro Devices (AMD) упали на 4%, а акции Micron Technology и Sandisk рухнули на 5%. Фонд технологического индекса Nasdaq к концу дня снизился на 0,5%.
Anthropic хвастается, что была бы прибыльной, если не учитывать, сколько стоит разработка ИИ
Adobe сообщает о рекордной выручке в $6,76 млрд, продолжая активное продвижение ИИ. Это на 13 процентов больше, чем за аналогичный период прошлого года
🏭 Компании
Anthropic, Google и OpenAI обсуждали создание организации по стандартизации ИИ, сообщает CNN
Генеральный директор Microsoft Сатья Наделла говорит: «мы приветствуем» «обдуманный темп, необходимый для правильного согласования», и объявляет о «Кодексе поведения», лежащем в основе моделей MAI от Microsoft
Генеральный директор Nvidia Дженсен Хуанг говорит Трампу: «мы не позволим замедлению ИИ произойти»
Китай отвергает заявления об остановке развития ИИ как «запугивании ИИ», в то время как глава разведки предупреждает об угрозе правлению Коммунистической партии
Китайское правительство отвергает призывы технологических миллиардеров замедлить развитие ИИ как «запугивание»
Google открывает Claude Opus 5 для всех инженеров после инвестиций в Anthropic на $40 млрд
ЗАИ привлекает $5 млрд для финансирования моделей GLM следующего поколения
💰 Финансирование
Maven Robotics выходит из режима скрытности с $100 млн для решения задачи промышленной сортировки смешанных палет
Skild AI преодолевает отметку в $100 млн ARR за 10 месяцев, разворачивая наступление на предприятия и «культуру демонстраций» в робототехнике
OpenAI приостанавливает новые регистрации Pro после спроса на GPT-6 Astra
Форки на базе модели insightface inswapper_128: roop, facefusion, rope, плодятся как грибы после дождя, каждый делает GUI под себя, можно выбрать любой из них под ваши вкусы и потребности. Лицемерный индус всячески мешал всем дрочить, а потом и вовсе закрыл проект. Чет ору.
Любители ебаться с зависимостями и настраивать все под себя, а также параноики могут загуглить указанные форки на гитхабе. Кто не хочет тратить время на пердолинг, просто качаем сборки.
Единственный минус, который не обеспечивает чистую победу генераторов видео - 3 секунды ролика для онлайн генерации, 5 секунд для онлайна (модель Wan 2.2), умельцы просто берут последний кадр и снова генерируют ролики, потом склеивают. Недавно вышла Sora 2, которая зацензурена по самые гланды. Нинтендо довольна.
Тред не является технической поддержкой, лучше создать issue на гитхабе или спрашивать автора конкретной сборки.
Эротический контент в шапке является традиционным для данного треда, перекатчикам желательно его не менять или заменить на что-нибудь более красивое. А вообще можете делать что хотите, я и так сюда по праздникам захожу.
1. Suno https://suno.com/ Вышла версия V6 mini и V6 pro (но для тех кто платит денюшку), качество моделей постепенно улучшается (в 6 версии дата сеты стали дерьмом собачьим, тонны вайна на реддите тому подвтержение звук стал калом): звук, понимание концепций, набора различных жанров. Но в то же время все сильнее урезается для бесплатных юзеров: осталось только 5 бесплатных генераций в день на аккаунт, а также по заявлением некоторых анонов, модель для генерации на бесплатке (на момент создания треда использовалась 4.5) ухудшили. Спам аккаунтами пока что работает. Купить подписку из РФ: 1. https://payment.mts.ru/tools/suno-ai 2. https://plati.market/games/suno-ai/1701/
2. Tunee https://www.tunee.ai Хороший звук, более-менее понимание концептов, но тоже сильно урезан для бесплатных юзеров: режет концепты в промптах, плюс произвольно определяет "цену" за каждую генерация исходя из какой-то "сложности запроса". И получается, что если с бесплатки забацаешь промпт сложнее банальщины "Make cool rock about love for youtube" он может решить что у тебя нет кредитов для такого сложного запроса и пошлет нахуй. Способов оплаты из РФ неизвестно.
3. Sonauto https://sonauto.ai/ Как по мне, недооценённая вещь, особенно учитывая что недавно он обновился до 3.0, который очень даже разъебывает. Но он тут более ограничен тегам и понимает чисто какие-то жанровые теги, гибкости поменьше. Но зато пока что халявный и не ограничен кредитами, генерируй пока есть настроение.
YuE-2 Модели пяток дней, модель маловестная 3b и не требовательная, уже есть в комфи. Есть задел на то что будет дохуя лор.
MiniMax Music 3 https://github.com/minimax-ai/minimax-music3 [есть в шаблонах comfyui] Свежак. Качество генерации на уровне Suno 3+. Сильно заточена именно на песни, с инструменталом есть особенности - модель не следует прямому указанию по продолжительности, можно выставить ограничение(!) на максимальную продолжительность. LLM часть сама решает сколько будет идти трэк. Промт простыня на пару сотент токенов, рекомендуется использовать LLM асситента.
ACE-STEP 1.5XL: https://github.com/ace-step/ACE-Step-1.5 [есть в шаблонах comfyui]. Звук уже на уровне раннего Suno ~2.0-3.0, аноны делают на нем уже приемлемые результаты и постят в тред. Если есть хотя бы 12 GB VRAM и хочется генерировать без цензуры и подписок - можете юзать. Идеально подходит для отладки перед использованием на коммерческих генераторах. В XL версия DIT модель разжирела до 4b параметров и стала чутка вменяемее. Стоит учесть то чтобы добится вменяемого звучания одними тэгами отъебатся не получится, `caption` требует качественного промпта символов на 200. В ComfуuUI реализован только text2music функционал. Для полного функционала надо накатывать полноценный бэкеннд из репозитория. Есть несколько кривеньких вариаций локальных студий как в коммерческих моделях - https://github.com/ace-step/awesome-ace-step#uis-and-studios VST плагины итд.
HeartMuLa https://github.com/HeartMuLa/heartlib Результат примерно на уровне ACE-STEP1.5 (не XL). Статус проекта непонятен, пока ебут вола. Из плюсов - меньше песочит на верхних частотах. Есть встроенный STUDIO UI.
StableAudio https://github.com/Stability-AI/stable-audio-3 [есть в шаблонах comfyui+] Делает звук. Подходит для создания сэмплов FX, ad-libs итд. Абсолютно не может в членораздельную речь. Может сделать что то похожее на музыку. v3 наглухо зацензурена, стоны и вопли можно делать на v1.
МЁРТВЫЕ КОММЕРЧЕСКИЕ ГЕНЕРАТОРЫ
1. Udio (udio.com) - куплен Warner Bros, но затем сами Warner Bros сдали назад и откатили сделку. Но уже успели испортить, больше нельзя скачивать треки, их только доставать из буфера в 160 кбит/с. Плюс непонятно как работающая цензура, которая не дает генерировать треки с определенными тегами. Плюс уже год ебут один и тот же 1.5 allegro. 2. Riffusion, Producer.ai (producer.ai) - куплен гуглом, удалены все старые относительно норм модели, вместо этого запихали безальтернативную каловую модель, которая и промпты сложнее самых нормисных в духе "make cool rock about love" не понимает, и вокал смазывает в какую-то кашу. При этом еще и максимально дегенеративная цензура, которая режет чуть ли не любые попытки сделать просто что-то не попсовое и не "музыку для ютуб".
ПРОЧИЕ ПОЛЕЗНЫЕ УТИЛИТЫ
1. https://www.bandlab.com/mastering Быстрый мастеринг в две кнопки, если хочешь чтобы звучало более слушабельно, но не имеешь навыков в DAW или аудиоредакторах (или лень). 2. https://morpher.ru/accentizer/ Если генерируешь музыку с лириками на русском, то очень часто случается, что твой генератор путает ударения в словах. Прежде чем пихать свою графоманию в генератор, проставь ударения в сервисе по ссылке. И уже из этого сервиса копируй текст в генератор. По крайней мере в Suno это помогает.
>>1708586 Автотюн стал неким reverb или delay эффектом. Типо почему и нет? Reverb delay тоже неестественные, эффеткты, почему бы и chorus, flanger, phaser, autotun не сделать нормальными. Есть живая музыка, настоящие обертона. Есть эффекты.
Я когда иду в Ростикс там всегда играет какая-то дженерик попса со словами whisper, neon, shadow, city lights. Слышу в припеве whisper, shadow и city lights и знакомый пластиковый звук и думаю: "Пожалуйста, только не вставляй neon в припев". И в припеве он вставляет neon.
Исследования ИИ тред #3 /research/
Аноним13/04/25 Вск 22:51:56№1151064Ответ
Обсуждаем развитие искусственного интеллекта с более технической стороны, чем обычно. Ищем замену надоевшим трансформерам и диффузии, пилим AGI в гараже на риге из под майнинга и игнорируем горький урок.
Я ничего не понимаю, что делать? Без петросянства: смотри программу стэнфорда CS229, CS231n https://see.stanford.edu/Course/CS229 (классика) и http://cs231n.stanford.edu (введение в нейроночки) и изучай, если не понятно - смотри курсы prerequisites и изучай их. Как именно ты изучишь конкретные пункты, типа линейной алгебры - дело твое, есть книги, курсы, видосики, ссылки смотри ниже.
Почему python? Исторически сложилось. Поэтому давай, иди и перечитывай Dive into Python.
Можно не python? Никого не волнует, где именно ты натренируешь свою гениальную модель. Но при серьезной работе придется изучать то, что выкладывают другие, а это будет, скорее всего, python, если работа последних лет.
Стоит отметить, что спортивный deep learning отличается от работы примерно так же, как олимпиадное программирование от настоящего. За полпроцента точности в бизнесе борятся редко, а в случае проблем нанимают больше макак для разметки датасетов. На кагле ты будешь вилкой чистить свой датасет, чтобы на 0,1% обогнать конкурента.
Количество статей зашкваливающее, поэтому все читают только свою узкую тему и хайповые статьи, упоминаемые в блогах, твиттере, ютубе и телеграме, топы NIPS и прочий хайп. Есть блоги, где кратко пересказывают статьи, даже на русском
Где ещё можно поговорить про анализ данных? http://ods.ai
Нужно ли покупать видеокарту/дорогой пека? Если хочешь просто пощупать нейроночки или сделать курсовую, то можно обойтись облаком. Google Colab дает бесплатно аналог GPU среднего ценового уровня на несколько часов с возможностью продления, при чем этот "средний уровень" постоянно растет. Некоторым достается даже V100. Иначе выгоднее вложиться в GPU https://timdettmers.com/2019/04/03/which-gpu-for-deep-learning заодно в майнкрафт на топовых настройках погоняешь.
Когда уже изобретут AI и он нас всех поработит? На текущем железе — никогда, тред не об этом
Кто-нибудь использовал машоб для трейдинга? Огромное количество ордеров как в крипте так и на фонде выставляются ботами: оценщиками-игральщиками, перекупщиками, срезальщиками, арбитражниками. Часть из них оснащена тем или иным ML. Даже на швабре есть пара статей об угадывании цены. Тащем-то пруф оф ворк для фонды показывали ещё 15 лет назад. Так-что бери Tensorflow + Reinforcement Learning и иди делать очередного бота: не забудь про стоп-лоссы и прочий риск-менеджмент, братишка
Список дедовских книг для серьёзных людей Trevor Hastie et al. "The Elements of Statistical Learning" Vladimir N. Vapnik "The Nature of Statistical Learning Theory" Christopher M. Bishop "Pattern Recognition and Machine Learning" Взять можно тут: https://www.libgen.is
Напоминание ньюфагам: немодифицированные персептроны и прочий мусор середины прошлого века действительно не работают на серьёзных задачах.
Короче, нейросеть разъебала галлюцинации гиперхаотическая система (резервуарные вычисления) оказалось не шизой, а вот трейдинг бот да, но допилил за вечер, которые вайбкодил до этого. Мощная штука, всем советую . Инструмент который пишет инструменты. https://habr.com/ru/articles/1023316/https://deepseek.com/harness/en/
Двач,я здесь делал всякое и наткнулся на такую нишу. Есть аи компаньоны, также всякие подрочушки с диалогами с тян, динозаврами, камнями и прочей херней. Но есть есть фундаментальная проблема. Ты не можешь сделать своего персонажа визуал + добавить свой языковой движок и закинуть на сайт, чтобы с этого поднимать бабло. Это техническое ограничение всех площадок. Те ты можешь наваять какого-то хуевого персонажа, но ллм все равно будет не твоя и хуй кто даст тебе подключитсья чререз свой апи, чтобы работала твоя пусть и конченная но своя ллм. Поэтому предлагаю закрыть эту брешь и поднимать денег. Например можешь сделать Льва Толстого и ебануть промт, что ты общаешься как Лев Толстой и тащемта пользователь сможет за денежку пообщаться со Львом, ну или еще с тем двачем и Педаликом. Подытожу. Фактически открытая площадка, где любой хуй может представить своего персонажа с языковым движком. Типа АИ Ютуб. Ну или еще безумнее Аи рулетка. Если наберем какой-то интерес, то реализовать к примеру можно. Дискас.
🎤🔊 ОБСУЖДАЕМ ПРЕОБРАЗОВАНИЕ ТЕКСТА В ГОЛОС И КЛОНИРОВАНИЕ ГОЛОСОВ 🔊🎤 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
🌟 ТОП ЛОКАЛЬНЫХ МОДЕЛЕЙ ПО КАЧЕСТВУ РУССКОГО ГОЛОСА НА МАРТ 2026 🌟
🐟👑 Fish-Speech S2 Pro (FishAudio) — SOTA, ElevenLabs на локале! → zero-shot клон от 10–30 сек записи → 80+ языков (русский топ), теги эмоций [excited], [whisper], [angry], [laughing] и вообще дохуя → диалог между несколькими голосами → тяжёлая сучка (FP8 в 12 ГБ VRAM, full ~17 ГБ), но есть экспериментальный вариант для 6+ ГБ https://github.com/rodrigomatta/s2.cpp 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🧠 Qwen3-TTS → клон от 3–30 сек (ВАЖНО: без reference-транскрипта текста — хуйня, если хочешь поудобнее подключи сразу QwenASR) → VoiceDesign: пишешь «весёлая молодая девка с хрипотцой» — и получаешь голос → 10 языков, включая русский → диалог между спикерами → лёгкая — влезает в 6 ГБ VRAM 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🎙️ VibeVoice-7B от Майкрософт → тяжёлая, но 4-bit квантизация — запускается на 8 ГБ (проверено на 3070) → поддержка долгих спичей → подкаст-режим: 4 спикера одновременно → норм клонирование голоса 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 ☁️ FL CosyVoice3 → ультралёгкий 0.5 — запустится даже на тостере → 9 языков, включая русский → zero-shot клон от 3–10 сек референса 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🌍 Chatterbox Multilingual (23 языка, включая русский) → zero-shot клонирование голоса 🎤 F5-tts → zero-shot клонирование голоса → официально русский не поддерживается, но есть файнтюн (см. ниже) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🚀 КАК ЭТИМ ПОЛЬЗОВАТЬСЯ (если что-то не понятно — спроси у ИИ лол) 🚀
🔥Вариант «всё в одном месте» — ComfyUI + TTS-Audio-Suite
1. Устанавливаем ComfyUI (Desktop для нормисов, Portable для здешних нейромантов) 2. Ставим https://github.com/diodiogod/TTS-Audio-Suite — постоянная обновляемая солярка почти всех моделей 3. Поставить FFmpeg (через winget в комадной строке: winget install FFmpeg или скачать) 4. Запускаем Комфи → перетаскиваем готовый json-воркфлоу из репозитория 5. Отсавляем включенными выбранные ноды, жмём Run 6. При первой генерации модели сами скачаются (~1–9 ГБ)
💥 Вариант «по отдельности» (кастом под каждую модель) 💥 Тоже через ComfyUI, только ставим отдельные кастомные ноды (на выбор):
в комфи в ноде F5 TTS audio advanced выбрать: model model:///ru.safetensors model_type: F5TTS_v1_Base sample_audio: emma_ru_xtts_3 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🎉 Если что-то не запускается — пиши, разберёмся! Голосуем, клонируем, ебём нейросети вместе! 🔥🎙️
>>1707710 >Хочешь сказать Так тут типичный вариант с нейронкой. Никакого "риалтайма" там и в помине нет. Написали промпт, дали нейронке его озвучить, наложили сверху видео. Анону то надо было риалтайм. Риалтайм-решения так не могут.
>>1704564 в реалтайме скорее всего в принципе невозможно, чтобы получилось естественно, несколько секунд запаса надо иметь. В голосе всё-таки свой ритмический рисунок есть опознаваемым, чтобы его менять, нужно запас по времени иметь.
Подумал вот, есть тема про новости ИИ, но она про восторги от новых, обещания скорой сингулярности, замены кожаных и т.п. Скепсис там не приветствуется.
Почему бы не иметь ещё одну тему, про новости чуть менее радужные?
Для затравки: OpenAI рискует недополучить 90% от собственного прогноза доходов от рекламы.[Вот что это значит для рынка ИИ
Главное
• Целевой показатель OpenAI по доходам от рекламы в размере $100 млрд к 2030 году в 20 раз превышает прогноз eMarketer для всего рынка чат-ботов, что ставит под угрозу обязательства Oracle на сумму $75 млрд, связанные с ИИ.
• Доля ChatGPT в ИИ-трафике упала с 87% до 65% на фоне укрепления позиций Gemini от Alphabet, из-за чего прогнозы о доминировании рекламы в чат-ботах становится всё труднее обосновать.
• Не ждите: аналитик, предсказавший успех NVIDIA в 2010 году, только что раскрыл свой топ-10 акций компаний из сферы ИИ.
Одно из ключевых допущений, лежащих в основе концепции инвестиций в ИИ, только что прошло суровую проверку реальности, и цифры явно не сходятся. По данным исследовательской компании eMarketer, рекламный бизнес OpenAI рискует недополучить около 90% от собственного пятилетнего прогноза выручки. OpenAI прогнозировала $2,5 млрд рекламной выручки в 2026 году с ростом до $100 млрд к 2030 году. Данные eMarketer показывают иную картину: отдельные ИИ-чат-боты, включая ChatGPT, Microsoft Copilot, Google AI Mode и Amazon Alexa for Shopping, суммарно принесут менее $1 млрд рекламного дохода в этом году и всего $5,41 млрд по всему рынку к 2030 году.
Целевой показатель одной лишь OpenAI на 2030 год примерно в 20 раз превышает оценку eMarketer для всего рынка рекламы в чат-ботах США. Этот разрыв ставит под сомнение весь прогноз и находится в самом центре дискуссии о «пузыре» ИИ.
Что требуется для выполнения прогноза OpenAI
Чтобы эта цифра оправдалась, как утверждает eMarketer, OpenAI необходимо будет массово переманить рекламные бюджеты из традиционного поиска, занять доминирующее положение на полностью сформировавшемся рынке рекламы в чат-ботах и одновременно превзойти по эффективности практически каждый рекламный формат в истории. Любая из этих задач выглядит амбициозно; необходимость же выполнения всех трех делает прогноз похожим скорее не на план, а на надежду. OpenAI запустила тестирование рекламы только в феврале 2026 года и озвучила эти прогнозы спустя всего лишь два месяца.
Не ждите: аналитик, предсказавший успех NVIDIA в 2010 году, только что раскрыл свой топ-10 акций компаний из сферы ИИ.
Сейчас всплывают интересные вещи. Оказывается, что Майкрософт реально запустила только 2 гигаватт мощностей GPU датацентров, в то время как ранее из сообщений Майкрософт можно было сделать вывод, что там в разы больше должно быть уже реально введено
> AI is expected to become a considerably bigger part of that footprint. Bloomberg reported that only around 2 gigawatts of Microsoft’s existing capacity is currently dedicated to AI-specific chips. Under the longer-term plan, roughly one-third of the projected 38-gigawatt capacity could be allocated to such infrastructure
При этом чипы они закупили, скорее всего лежат на складах. Возникают вопросы, зачем они из покупают, возможно какие-то бандитские методы принуждения, мол если не купите сейчас, следующую партию мы вам просто не продадим.
Такая история не только с ними, по всей видимости реально мало ИИ датацентров сейчас работает.
Что получается: склады забиты чипами, которые стремительно морально устаревают. При этом в них вложены огромные деньги, изъятые из накоплений компаний или кредитные. Датацентров не так много, и они более-менее удовлетворяют потребности.
Таким образом не понятно, куда девать все вычислительные мощности, если действительно их введут, и будет в десятки раз больше. В смысле кто будет готов за них платить.
Особая проблема, что инвестируют в это многие фонды не технологические, а, например, пенсионные фонды. Самый жёсткий удар будет по ним, они вкладываются в инфраструктуру, которая типа надёжна, потому что инфраструктура, а на самом деле в таком количестве она не нужна, а сама инфраструктура стремительно устаревает.
ИТТ делимся советами, лайфхаками, наблюдениями, результатами обучения, обсуждаем внутреннее устройство диффузионных моделей, собираем датасеты, решаем проблемы и экспериментируемТред общенаправленныей, тренировка дедов, лупоглазых и фуррей приветствуются
Существующую модель можно обучить симулировать определенный стиль или рисовать конкретного персонажа.
✱ LoRA – "Low Rank Adaptation" – подойдет для любых задач. Отличается малыми требованиями к VRAM (6 Гб+) и быстрым обучением. https://github.com/cloneofsimo/lora - изначальная имплементация алгоритма, пришедшая из мира архитектуры transformers, тренирует лишь attention слои, гайды по тренировкам: https://rentry.co/waavd - гайд по подготовке датасета и обучению LoRA для неофитов https://rentry.org/2chAI_hard_LoRA_guide - ещё один гайд по использованию и обучению LoRA https://rentry.org/59xed3 - более углубленный гайд по лорам, содержит много инфы для уже разбирающихся (англ.)
✱ LyCORIS (Lora beYond Conventional methods, Other Rank adaptation Implementations for Stable diffusion) - проект по созданию алгоритмов для обучения дополнительных частей модели. Ранее имел название LoCon и предлагал лишь тренировку дополнительных conv слоёв. В настоящий момент включает в себя алгоритмы LoCon, LoHa, LoKr, DyLoRA, IA3, а так же на последних dev ветках возможность тренировки всех (или не всех, в зависимости от конфига) частей сети на выбранном ранге: https://github.com/KohakuBlueleaf/LyCORIS
✱ Текстуальная инверсия (Textual inversion), или же просто Embedding, может подойти, если сеть уже умеет рисовать что-то похожее, этот способ тренирует лишь текстовый энкодер модели, не затрагивая UNet: https://rentry.org/textard (англ.)
➤ Тренировка YOLO-моделей для ADetailer: YOLO-модели (You Only Look Once) могут быть обучены для поиска определённых объектов на изображении. В паре с ADetailer они могут быть использованы для автоматического инпеинта по найденной области.
>>1637026 Спасибо анон, со вчера ебусь с фризами на второй-третьей генерации (врам 100%, стоим минуту), твой ключ помог вроде. Тоже обновился.
Всё разъебали мне глупые питонята, теперь из субграфа нельзя экспортировать control after generation, и все экспорты только через лапшу теперь. Заебись апгрейд, щас все переделывать, и старые вф в файлах по пизде.
Вейп-коженая лапша домашнего приготовления делает брррр ископаемому чекпоинту SD 3.5 медиум. Общий размер 500к кода на бояроне +полгига длл куды, никакие боярторчи и хуйфьюзеры не нужны, заводится с нуля меньше чем за минуту.
Тред про AI-агентов - от вайб-кодинга до персональных ассистентов, которые сидят в твоих чатах, читают заметки и автономно ломают всё вокруг. Для кодеров, которые разучились писать руками, и для гуманитариев, чей диплом филолога наконец котируется в IT. Сеньор в 2026 - это тот, кто умеет внятно объяснить машине, чего он блять хочет.
Новости треда: • GPT-6 Astra (OpenAI, 3 сентября) - миллион контекста, который держится до самого конца (96% MRCR на 1M, у Sol 74%), и лучшая на сегодня работа за компьютером: модель сама водит мышкой и клавиатурой по живому десктопу - браузер, файловый менеджер, гуёвые проги, - 72.6% на OSWorld 2.0 и вдвое быстрее предшественника. В кодинге вровень с Фейблом • DeepSeek V4.1-Flash (10 сентября) - открытые веса, 552B MoE новой архитектуры, по их тестам обгоняет собственный флагман V4-Pro при $0.15/$0.60 за млн; с 14 сентября запросы к V4-Pro в API отвечает он же и по своей цене • Cursor начал банить россиян прямо во время работы - Pro слетает, деньги возвращают; лечится только VPN • У OpenAI кончились мощности после Astra - продажу новых подписок временно сняли, продление работает
>>1708568 >Сделать окружение для плейтестинга агентом порой сложней чем разработка самой фичи для игрульки. Сука, запусти римкал, и поиграй полчасика, никто не заставляет агентом это делать. Поиграл, потом логи посмотрел. Никто не просит обмазывать дилдачков из римки телеметрией в 10 слоев.
>софт ремастеры старых игрулек в 20 слов Не будет. Разрабы из многомиллиардных игровых компаний привет пидорас интерактив не осиливают реплицировать механики из предыдущих инкарнаций в серии. Надеяться на то, что ллмки будут эмержентно рождать гемы, тренируясь синте по индусским говнякам, не приходится.
>>1708657 Вроде в этом же треде челик кидал ссылку на него. Потести, но многого можешь не ждать.
>>1708733 Опиши свой стак не какой агентурой делаешь, а какие либы юзаешь, мб смогут анончики что посоветовать. Просто 60 МБ смарт-селекшон как какой-то балш звучит. В 22 году у челика в /s был какой-то смарт на гх, и там сбилженная версия весила 9 МБ.
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №268 /llama/
Аноним17/09/26 Чтв 06:13:42№1705886Ответ
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1707133 дело не в моэ даже, с любой моделькой это работает (я пробовал с мисралём) за счёт shared gpu memory как я понимаю случается "незаметный" (для лламы) переброс ллм в рам и назад когда снова к лламе обратишься. а может и диск задействован ХУЙ ЗНАЕТ КАК ОНО НА САМОМ ДЕЛЕ МНЕ ПОХУЙ РАБОТАЕТ И ЛАДНО вот тут у меня крея2 вообще а не сдохл. (это в маринаре с кастомным "умным" фото агентом). после креи на сдохл не охота возвращаться. очень важно ставить в комфи воркфлоу в конце ноду unload all models (кастомная), а в маринаре отключать персам автономность чтобы не дёрнули ллмку во время генерации картинки и тогда всё будет работат без тормозов. а вот если дёрнуть ллмку пока идёт генерация (например написать сообщение в другом чате/рп) то да - всё заглохнет и придётся убивать процессы. 16врам+32рам если что.
Общаемся с ИИ, почти что AGI самыми продвинутыми текстовыми моделями: GPT, Claude, Gemini и прочими. Горим с ограничений, лимитов и банов, генерим пикчи, пишем код и спорим о том, какая модель лучше.
Большинство сервисов доступны бесплатно с ограничениями. Подписки открывают доступ к более мощным моделям, увеличенным лимитам и дополнительным функциям (генерация изображений, файлы, память и т.д.). Цены и условия у всех разные и периодически меняются.
Советы по регистрации: 1. При необходимости используй VPN. 2. Заведи нормальную почту (временные часто режутся). 3. Регистрируйся на нужной платформе. 4. Иногда требуется номер телефона — используются сервисы виртуальных номеров. 5. Пользуйся.
VPN в ряде регионов обязателен. Соответствие страны VPN, почты и номера не обязательно, но желательно для тех, кому доступ критически нужен, например для работы.
Для ленивых есть боты в телеге, 3 сорта: 0. Боты без истории сообщений. Каждое сообщение отправляется изолировано, диалог с ИИ невозможен, проёбывается 95% возможностей ИИ 1. Общая история на всех пользователей, говно даже хуже, чем выше 2. Приватная история на каждого пользователя, может реагировать на команды по изменению поведения и прочее. Говно, ибо платно, а бесплатный лимит или маленький, или его нет совсем.
>>1696936 То что ты описываешь это и есть их корректная работа, принцип работы нейронки это угадывание слов, они не могут угадывать 100% слов верно, неизбежно и всегда будет процент который они угадали неправильно и эти ошибки часто перечеркивают все что они угадали правильно. Не используй их для задач где важна точность и качество, они для этого не подходят.
>>1696936 Чёт на пиздежь похоже. Ты хочешь сказать, что гопота не потянула школьные науки и начал пиздеть в них? Не верю. Сдаётся мне, ты промпт кривой задаешь и ждёшь от нейронки чуда. Задавай вопрос нормально - будет правильный ответ.
Бесплатным клодом пользуется кто? Я у меня одного он отупел до уровня джемени, что этой парашей стало невозможно пользоваться? Мало того что для копирайта или рерайта стал говном, так еще и инструкции и скиллы не соблюдает, глючит, скиллы которые не вызывал подключает.