Ssylka

Может ли Janus-Pro составить конкуренцию Dall-E 3 в генерации изображений?

DeepSeek выпустила генеративную модель Janus-Pro с открытым исходным кодом, которая, по заявлению разработчиков, превосходит Dall-E 3 и Stable Diffusion в некоторых бенчмарках. Модель представлена в двух вариантах: с 1 и 7 миллиардами параметров. Janus-Pro способна понимать текст и изображения, а также генерировать изображения по текстовым описаниям.
Может ли Janus-Pro составить конкуренцию Dall-E 3 в генерации изображений?
Изображение носит иллюстративный характер

Технически, Janus-Pro использует раздельные методы кодирования для мультимодального понимания и генерации изображений, применяя SigLIP кодировщик для извлечения семантических признаков и VQ токенизатор для преобразования изображений в дискретные токены. В бенчмарках GenEval и DPG-Bench модель Janus-Pro-7B продемонстрировала более высокие результаты, чем Dall-E 3 и Stable Diffusion 3 Medium, что свидетельствует о ее способности следовать инструкциям и генерировать изображения.

Несмотря на заявленные успехи, качество сгенерированных Janus-Pro изображений вызвало сомнения. Нарушения пропорций лиц и тел, а также трудности с рендерингом текста, ставят под вопрос утверждения о превосходстве над Dall-E 3. К тому же, разрешение изображений ограничено 384x384 пикселями, что может сказываться на детализации.

Janus-Pro доступен для скачивания и использования на Hugging Face, где можно также опробовать демо-версию. Модель поддерживает как научное, так и коммерческое использование. Однако, как показала практика, заявленные возможности не всегда соответствуют действительности, и для получения качественных изображений может потребоваться дополнительная настройка. Несмотря на это, появление таких открытых моделей подстегивает развитие ИИ в области генерации изображений.


Новое на сайте

18817Искусственный интеллект в математике: от олимпиадного золота до решения вековых проблем 18816Радиоактивный след в Арктике: путь цезия-137 от лишайника через оленей к коренным народам 18815Критическая уязвимость WatchGuard CVE-2025-14733 с рейтингом 9.3 уже эксплуатируется в... 18814Что подготовило ночное небо на праздники 2025 года и какие астрономические явления нельзя... 18813Зачем нубийские христиане наносили татуировки на лица младенцев 1400 лет назад? 18812Как увидеть метеорный поток Урсиды в самую длинную ночь 2025 года? 18811Кто стоял за фишинговой империей RaccoonO365 и как спецслужбы ликвидировали угрозу... 18810Как злоумышленники могут использовать критическую уязвимость UEFI для взлома плат ASRock,... 18809Как наблюдать максимальное сближение с землей третьей межзвездной кометы 3I/ATLAS? 18808Передовая римская канализация не спасла легионеров от тяжелых кишечных инфекций 18807Способен ли вулканический щебень на дне океана работать как гигантская губка для... 18806Зонд NASA Europa Clipper успешно запечатлел межзвездную комету 3I/ATLAS во время полета к... 18805Может ли перенос лечения на первую половину дня удвоить выживаемость при раке легких? 18804Новая китайская группировка LongNosedGoblin использует легальные облачные сервисы для... 18803Генетический анализ раскрыл древнейший случай кровосмешения первой степени в итальянской...