Superare i Limiti dell’AI: Janus-Pro Unifica Comprensione e Generazione

DeepSeek-AI ha recentemente annunciato il rilascio di Janus-Pro, un avanzato framework autoregressivo progettato per unificare la comprensione e la generazione multimodale. Questo modello affronta le limitazioni degli approcci precedenti separando la codifica visiva in percorsi distinti, pur mantenendo un’architettura trasformatore unificata per l’elaborazione. Tale disaccoppiamento allevia il conflitto tra i ruoli del codificatore visivo nella comprensione e nella generazione, migliorando al contempo la flessibilità del framework. huggingface.co

Janus-Pro è costruito sulla base dei modelli DeepSeek-LLM-1.5b e DeepSeek-LLM-7b. Per la comprensione multimodale, utilizza SigLIP-L come codificatore visivo, supportando input di immagini fino a 384 x 384 pixel. Per la generazione di immagini, impiega un tokenizzatore con un fattore di downsampling di 16. Questa configurazione consente al modello di gestire efficacemente sia la comprensione che la generazione di contenuti visivi. arxiv.org

Le prestazioni di Janus-Pro sono state valutate su diversi benchmark. Nel test MMBench per la comprensione multimodale, la variante da 7 miliardi di parametri ha raggiunto un punteggio di 79,2, superando modelli come Janus (69,4), TokenFlow-XL (68,9) e MetaMorph (75,2). Nelle attività di generazione di testo in immagine, Janus-Pro ha ottenuto un’accuratezza complessiva dell’80% nel benchmark GenEval, superando DALL-E 3 (67%) e Stable Diffusion 3 Medium (74%). Inoltre, il modello ha raggiunto un punteggio di 84,19 nel benchmark DPG-Bench, dimostrando la sua capacità di gestire prompt complessi con allineamento semantico intricato. arxiv.org

L’architettura di Janus-Pro è progettata per decodificare la codifica visiva per compiti di comprensione e generazione, garantendo un’elaborazione specializzata per ciascuno. Il codificatore per la comprensione utilizza il metodo SigLIP per estrarre caratteristiche semantiche dalle immagini, mentre il codificatore per la generazione applica un tokenizzatore VQ per convertire le immagini in rappresentazioni discrete. Queste caratteristiche vengono poi elaborate da un trasformatore autoregressivo unificato, che integra le informazioni in una sequenza di caratteristiche multimodali per i compiti successivi. arxiv.org

La strategia di addestramento prevede tre fasi: pre-addestramento prolungato su dataset diversificati, fine-tuning efficiente con rapporti di dati regolati e raffinamento supervisionato per ottimizzare le prestazioni attraverso le modalità. L’aggiunta di 72 milioni di campioni di dati estetici sintetici e 90 milioni di dataset di comprensione multimodale migliora significativamente la qualità e la stabilità dei risultati di Janus-Pro, garantendo affidabilità nella generazione di immagini dettagliate e visivamente accattivanti. arxiv.org

Janus-Pro è disponibile su GitHub sotto licenza MIT, con l’utilizzo del modello regolato dalla DeepSeek Model License. Gli utenti possono fare riferimento al repository per le istruzioni di configurazione. huggingface.c

NEWS AIopenmind su:

#newsChatAIopenmind (1)3D (9)6G (4)Accademia di Comunicazione (4)Acer (1)Adobe (43)Aeronautica (10)Africa (3)Agenti AI (24)Agenti autonomi (1)Agenzia delle Entrate (1)Agenzia Spaziale Europea (ESA) (1)Agenzia viaggi (1)AGI (Intelligenza artificiale generalizzata) (13)AGID (1)Agricoltura (2)Amazon (45)Ambiente (4)AMD (2)Android (6)Animali (6)Animazione (5)Anthropic (32)Anziani (1)App (12)Apple (75)Archeologia (3)Architettura (4)Archivi storici (1)Armi (4)Arredamento interni (2)Arte (30)Assistente vocale (6)Astronomia (2)Asus (2)AT&T (1)Audi (1)Audio (58)Autoapprendimento (1)Avatar (7)Aviazione (1)Avvocati (2)Aziende (24)Banca (4)Bard (3)Biblioteca (1)Bill Gates (2)Bing (9)Biologia (1)Birra (1)Blockchain (2)Boston Dynamics (2)Calcio (2)Canva (7)Cattolicesimo (3)Certificazioni (1)Cesintes (1)chataudio (1)Chatbot IA (54)Chip (3)Cina (79)Cinema (11)Claude (20)Clima (5)CNR (1)Coca-Cola (1)Commercio (2)Commissione Europea (2)Compagnie aeree (1)Computer (6)Computer quantistici (40)Computer Vision (3)Comuni italiani (1)Comunicazione (10)Comunicazioni vocali (2)Concorso bellezza AI (1)Consiglio d'Europa (1)Contabilità (2)Convegno (13)Copilot (6)Copyright (20)Criptovalute (1)Cybersecurity (4)Dalle-2 (3)Dark web (3)Data center (12)Dating (1)Deepfake (3)Design automobilistico (3)Design Industriale (6)Diritti Autore (1)Disney (1)Doppiaggio (1)Drone (1)Droni (1)Dropbox (1)E-commerce (1)eBay (1)Editing fotografico (3)Editoria (13)Editoriale AIopenmind (1)Email (1)ENEA (2)Esercito (2)Et (0)Etica (177)Europol (3)Eventi (7)Evento (8)Facebook (4)FakeNews (20)Falegnameria (1)Fauna selvatica (1)Film (6)Finanza (14)Finanziamenti Italia (4)Firefly (3)Firefox (1)Fondo Monetario Internazionale (1)Formazione (40)Fotografia (116)Francia (6)Free lance (1)G7 (1)Gaming (1)Garante privacy (21)Giappone (12)Giochi (10)Giornalismo (21)Giustizia (2)Google (376)Governo (7)Governo Italiano (3)Grafica (6)Grok (1)Guerra (16)Guida autonoma (8)Hong Kong (3)Hugging Face (5)IBM (8)Illustrazioni (1)iMessage (1)Immobiliare (1)India (5)Indossabili (4)Influencer (1)Informazione (10)Inghilterra (12)INPS (2)Intel (9)ISO (1)Istruzione (17)Jailbreaking (1)Kamala Harris (1)Lavoro (63)Libri (3)Linguistica computazionale (10)Linkedin (9)Linux (1)Luma AI (1)Maltrattamento infantile (1)Marina (1)Marketing (112)Medicina (36)Mercedes-Benz (1)Meta (117)Metaverso (17)Meteo (1)Microsoft (212)Midjourney (18)Mobilità sostenibile (2)Moda (6)Modelli AI (99)Motori di Ricerca (13)Mozilla (2)Museo (1)Musica (41)NASA (1)Nato (2)Natura (3)Natural Language Processing (2)Nazioni Unite (1)NBA (1)NFT (3)Nvidia (52)Occhiali (7)Occhiali Intelligenti (2)Occhiali Smart (1)Oculistica (1)Odore (1)OMS (1)ONU (1)Open Source (5)OpenAI (321)Opera (14)Opera Browser (1)Oppo (3)Oracle (3)Orologio (1)Parlamento Europeo (4)Patente di guida (1)Pensieri (1)Perplexity (14)Pianeta (2)Plugin (1)Polizia (2)Ponti (1)Presentazioni aziendali (4)Privacy (31)Programmazione (12)Prompt (5)Pubblicazione (1)Pubblicità (19)QR Code (1)Qualcomm (5)Ray-Ban (7)Realtà mista (4)Reddit (7)Relazioni internazionali (2)Relazioni Pubbliche (3)Religione (1)Report (131)Ricerca scientifica (9)Riconoscimento emotivo (1)Risorse online (100)Ristorazione (3)Robotica (59)Runway (13)Salute (12)Samsung (14)Sanità (19)Satelliti (2)Sceneggiatura (1)Semiconduttori (2)SEO (3)Shopping online (4)Sicurezza (28)Sicurezza informatica (82)SMS (1)Snapchat (10)Soccorso (1)Società (12)Software (4)Sport (3)Spotify (5)Stability (4)Stable Animation SDK (1)Stable Diffusion (12)Stampanti (1)Standard (4)Startup (402)streaming live (1)Supercomputer (5)Superintelligenza (3)Sviluppatori (1)Sviluppo sostenibile (1)Synthesia (1)Taiwan (4)Taxi (2)Telecomunicazioni (4)Telegram (3)Televisione (1)Tesla (10)TikTok (11)Torah (1)Traduttore AI (7)Trasporti (2)Truffa (2)Twitter (13)Ucraina (3)Udito (1)UE (13)UNESCO (3)UNICEF (1)Unione Europea (27)Università (5)Uomo (1)USA (62)Vaticano (5)Video (129)Videocomunicazione (4)Videogiochi (4)Vigili del fuoco (1)Violenza domestica (1)Visualizzazione dati (1)Vodafone (1)Vogue Business - As Gen Z matures (0)Volkswagen (1)VPN (3)Website (12)WhatsApp (11)Wikipedia (1)Wordpress (3)X (13)xAI (1)Xiaomi (1)Yahoo (3)Youtube (19)Zoom (6)



AI open mind

Insieme per riflettere sull’intelligenza - umana e artificiale - tra studi, esperienze, democrazia e innovazione.

OpenAI rivoluziona l’addestramento AI: promossa la libertà intellettuale su temi controversi

OpenAI ha recentemente annunciato un significativo aggiornamento al suo "Model Spec", il documento che definisce le linee guida per l'uso e l'addestramento dei suoi...

#weeklynewsNISQ-AIopenmind 2025 Febbraio 16

Quantum computing, perché è necessario riprendere il discorsoDarren Thomson di Commvault esplora l'importanza del quantum computing e il suo potenziale impatto sulla tecnologia.BitMat Quantum Computing:...

Un trucco nell’URL per ripulire le tue ricerche su Google

Nel maggio 2024, Google ha introdotto una significativa modifica al suo motore di ricerca, implementando le cosiddette "panoramiche AI" che forniscono risposte generate dall'intelligenza...

Mi sono imparato la scienza?

Fahrenheit.iit e il potere della narrazione. Mercoledì 13 marzo, ore 17:00 in Accademia di Comunicazione e in streaming Registrati La narrazione può essere la lama...

Iscrizione NEWSLETTER

I dati da Lei forniti non saranno comunicati ad altri soggetti terzi e non saranno trasferiti né in Stati membri dell’Unione Europea né in paesi terzi extra UE.

Visita le sezioni del sito

Link utili

Casi studio, contributi

AI governance: A research agenda, Governance of AI program, Future of Umanity Institute, University of Oxford, Dafoe A., 2017 Artificial intelligence (AI) is a po-tent...

Libri

Ricerche

Piattaforme Corsi Gratuiti

White paper, guidelines