Machine learning Interview@machinelearning_interview P.2186

MACHINELEARNING_INTERVIEW Telegram 2186

Machine learning Interview

⚡️ Фотореализм в диффузионных моделях за 10 минут? Новый метод от Hunyuan - SRPO (Semantic Relative Preference Optimization) показывает, что это реально.

SRPO — это онлайн-фреймворк обучения с подкреплением для моделей text-image, созданный как более эффективная альтернатива GRPO-подходам. Он делает генерацию стабильнее, быстрее и дешевле.

Как это работает:
- Direct-Align: оптимизация даже на самых «шумных» шагах, без сбоев и сэкономленной памятью.
- Promptable Rewards: награды превращаются в условные сигналы. Добавьте ключевые слова к промпту — и модель сразу усиливает реализм без дополнительного обучения.
- Эффективность: 75-кратный прирост производительности, результаты за 10 минут на 32 GPU (обгоняет DanceGRPO).
- Качество: повышенный уровень реализма и эстетики для FLUX.1-dev без новых данных.
- Надёжность: отсутствие reward hacking, работа с готовыми reward-моделями и устранение пересыщения изображений.

Подробнее:

🟢

Проект: https://tencent.github.io/srpo-project-page/

🟢

Статья: https://arxiv.org/abs/2509.06942

🟢

Модель: https://huggingface.co/tencent/SRPO

🟢

Код: https://github.com/Tencent-Hunyuan/SRPO

@machinelearning_interview

#SRPO #DiffusionModels #AI #ReinforcementLearning #TextToImage

Please open Telegram to view this post

VIEW IN TELEGRAM

❤9🔥7👍4🥱2

www.tgoop.com/machinelearning_interview/2186

4.52K viewsSep 16 at 09:40

tgoop.com/machinelearning_interview/2186

Create: 2025-09-16
Last Update: 2025-10-12 20:09:45

⚡️ Фотореализм в диффузионных моделях за 10 минут? Новый метод от Hunyuan - SRPO (Semantic Relative Preference Optimization) показывает, что это реально.

SRPO — это онлайн-фреймворк обучения с подкреплением для моделей text-image, созданный как более эффективная альтернатива GRPO-подходам. Он делает генерацию стабильнее, быстрее и дешевле.

Как это работает:
- Direct-Align: оптимизация даже на самых «шумных» шагах, без сбоев и сэкономленной памятью.
- Promptable Rewards: награды превращаются в условные сигналы. Добавьте ключевые слова к промпту — и модель сразу усиливает реализм без дополнительного обучения.
- Эффективность: 75-кратный прирост производительности, результаты за 10 минут на 32 GPU (обгоняет DanceGRPO).
- Качество: повышенный уровень реализма и эстетики для FLUX.1-dev без новых данных.
- Надёжность: отсутствие reward hacking, работа с готовыми reward-моделями и устранение пересыщения изображений.

Подробнее:
🟢Проект: https://tencent.github.io/srpo-project-page/
🟢Статья: https://arxiv.org/abs/2509.06942
🟢Модель: https://huggingface.co/tencent/SRPO
🟢Код: https://github.com/Tencent-Hunyuan/SRPO

@machinelearning_interview

#SRPO #DiffusionModels #AI #ReinforcementLearning #TextToImage

BY Machine learning Interview

Share with your friend now:
tgoop.com/machinelearning_interview/2186

Open in Telegram

Telegram News

Date: 2025-10-12|

1What is Telegram Channels? Hashtags are a fast way to find the correct information on social media. To put your content out there, be sure to add hashtags to each post. We have two intelligent tips to give you: Add the logo from your device. Adjust the visible area of your image. Congratulations! Now your Telegram channel has a face Click “Save”.! Informative 2How to set up a Telegram channel? (A step-by-step tutorial)
from us

Telegram Machine learning Interview
FROM American