Geometry, Audio, Isaac in pensione


Perceptron Mk1.5 è ora disponibile in generale, e la cosa interessante non è la tabella dei benchmark — è ciò che ritorna nel corpo della risposta. Chiedi a un normale modello visione-linguaggio dov’è il carrello elevatore e ottieni una frase. Chiedi a Perceptron Mk1.5 su un fotogramma video e, accanto alla sua prosa, puoi ottenere geometria interpretabile dalla macchina: un punto, un bounding box, un poligono, una clip o un elemento <track> che porta osservazioni spaziali con timestamp su tutto il file. Questa è la differenza tra un modello che descrive una scena e un modello che un controllore robotico può consumare senza una seconda fase di parsing. È il diretto successore di Perceptron Mk1, la prima release dell’azienda a maggio 2026, ed è stato rilasciato il 25 settembre insieme al ritiro dei checkpoint Isaac 0.1 e 0.2 che lo hanno preceduto.

Cosa restituisce effettivamente Mk1.5

Il modello è un sistema di ragionamento embodied per agenti fisici. Sul fronte degli input accetta testo, immagini, video e audio. Sul fronte degli output produce testo più annotazioni strutturate opzionali: punti, box, poligoni, clip e tracce. L’output di tracciamento è l’elemento su cui vale la pena soffermarsi. I documenti di Perceptron descrivono un blocco <track> le cui voci contengono sia un’osservazione spaziale sia il timestamp a cui appartiene, così una clip di 60 secondi viene restituita come una sequenza di posizioni degli oggetti nel tempo anziché come un’unica stima mediata della scena.

Un secondo dettaglio che conta per chiunque integri questo in una pipeline con più di un asset: Mk1.5 supporta un asset_idx campo, così una singola richiesta può fare riferimento a più immagini o video e indirizzarli separatamente. Se il tuo compito è confrontare una foto di riferimento con un fotogramma live di una telecamera — un ciclo di controllo difetti, una fase di verifica dell’assemblaggio — questo va in una sola chiamata, non due.

Il modello supporta anche risposte vincolate, sia JSON Schema che regex, ed è così che si trasforma “più o meno ci siamo” in uno schema che il codice a valle può convalidare. La chiamata di funzioni è supportata nelle chat completions, e il server MCP ospitato di Perceptron ora usa per impostazione predefinita perceptron-mk1.5; passando model: “perceptron-mk1” in modo esplicito è come si fissa l’impostazione predefinita precedente.

La scheda tecnica, e quanto costa

Vale la pena enunciare chiaramente questi numeri, perché sono modesti in punti che un lettore potrebbe non aspettarsi. La finestra di contesto è di 36.864 token — non un milione, non 256K. L’output massimo è di 8.192 token. Non è un modello a cui affidare un video di due ore e un manuale di 300 pagine. È dimensionato per un compito di percezione ristretto con una risposta strutturata.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install “perceptron>=0.4.0”, the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• Contesto — 36.864 token, rispetto alla finestra da 32K con cui è stato distribuito Perceptron Mk1
• Output massimo — 8.192 token
• Input — testo, immagini, video, audio (WAV, MP3, FLAC)
• Input in cache — $0,0375/M, un quarto della tariffa standard di input di $0,15/M
• Output — $1,50/M
• Controllo del ragionamento — reasoning_effort impostabile su high, medium, low, minimal o none, con valore predefinito high

Quell’ultima riga è una modifica incompatibile mascherata. Mk1.5 sostituisce il vecchio vision_config.enable_thinking booleano con reasoning_effort, quindi qualsiasi richiesta costruita per il modello precedente deve essere modificata, non semplicemente reindirizzata. Il valore predefinito high merita attenzione per un motivo diverso: se non imposti il campo, stai pagando il percorso di ragionamento più costoso a ogni chiamata.

Audio e video che include la propria colonna sonora

L’input audio è davvero una novità qui. Perceptron lo accetta in tre modi — inline input_audio, un audio_url, oppure un audio_file_id — con un limite massimo di 16.384 token audio per elemento. La documentazione lo stima a circa 21,8 minuti di parlato, a circa 750 token al minuto, un budget ragionevole per una registrazione di passaggio di consegne o un registro di manutenzione.

Più insolito è il percorso video. Per impostazione predefinita, Mk1.5 legge il video come fotogrammi e ignora la traccia audio. Impostando vision_config.enable_audio_in_video: true si riattiva la colonna sonora, ed è l’impostazione che serve per tutto ciò in cui il rumore è il segnale — una macchina che suona male prima di apparire sbagliata, un’istruzione vocale impartita fuori campo, un allarme in sottofondo durante un sopralluogo. È disattivata per impostazione predefinita, quindi un video con un difetto udibile verrà analizzato in silenzio come un film muto, a meno che tu non richieda il contrario.

Il quadro comparativo, con le fonti rese esplicite

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

Ogni dato riportato di seguito proviene dall’annuncio di Perceptron stesso ed è stato misurato da Perceptron. Non esiste una voce nell’indice di Artificial Analysis né un punteggio di arena per Mk1.5 o il suo predecessore, quindi in questo confronto non c’è alcun numero di terze parti da contrapporre ad essi. Considera i dati come un’affermazione di un fornitore sul proprio prodotto, non come un risultato neutrale.

Sul tracciamento egocentrico delle mani il divario è ampio e specifico: Mk1.5 ottiene 0.9433 su hand_box contro 0.4467 di Gemini 3.1 Pro e 0.6179 del miglior Gemini nella run di Perceptron, che l’annuncio identifica come Gemini 3.8 Flash. Sono questi il +111% e il +53% con cui si apre il post di lancio, ed è il singolo numero più forte della release.

Sulla comprensione generale dei video egocentrici il quadro è molto più vicino. Perceptron riporta EgoSchema a 80,40 per Mk1.5 contro 81,20 per Gemini 3.8 Flash — una perdita di 0,80 punti — mentre dichiara un vantaggio del 12% sul sottoinsieme EgoSchema-hard a 63,75. Un modello che vince in modo decisivo sulla geometria fine della mano e perde di stretta misura sul benchmark di comprensione ampia è un tipo specifico di strumento, e viene venduto come tale.

La segmentazione di oggetti video si attesta a 0,647 center-F1 e 0,628 point-HOTA su Molmo2-Track. Perceptron afferma che è in testa su Molmo2-Track, Ref-DAVIS17 e ReasonVOS, mentre è indietro rispetto a MolmoPoint-8B su MeViS valid_u. Nel confronto con la linea vision di Qwen, il paragone sul tracking merita una lettura attenta: l’annuncio elenca Qwen3-VL-8B a 0,180 center-F1 dal suo paper, e Qwen3.5-27B a 0,530 e 0,476 — checkpoint diversi, configurazioni di valutazione diverse, e un numero da paper che si trova nella stessa colonna di quelli misurati. Non è una riga paragonabile a parità di condizioni.

I risultati audio sono riportati come DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 e AVHBench 80,56, senza alcuna riga di confronto allegata. Sulla ricerca multimodale con gli strumenti abilitati, Mk1.5 totalizza 56,0 su LiveVQA-W grazie a un voto di maggioranza su quattro campioni, contro 53,2 di Gemini 3.8 Flash con grounding su Google Search, 51,0 di GPT-6 sol con la ricerca web di OpenAI e 33,2 di GPT-5.2 online. Perceptron rivendica inoltre un guadagno di 36,1 punti su MMSearch una volta attivati gli strumenti. Il voto di maggioranza su quattro campioni è una tecnica legittima e favorisce il punteggio rispetto a una singola passata greedy, quindi 56,0 e 53,2 non sono misurati allo stesso modo.

Latenza, e come è stato misurato il 4,7×

L’affermazione sulla velocità è quella che più probabilmente verrà citata senza il suo contesto, quindi ecco il contesto. Perceptron riporta fino a 4,7× più veloce end-to-end dalla mediana di tre esecuzioni su una singola H100, usando prompt LMArena limitati a risposte di 256 token, più MIA-Bench e Video-MME con Perception Test. Il 4,7× è il caso chat: da 5,2 secondi a 1,1. La risposta a domande sulle immagini passa da 1,7 secondi a 0,51, ovvero circa 3,3×. Un video di 60 secondi elaborato otto alla volta passa da 19 secondi a 9,1, all’incirca 2,1×.

Quindi il moltiplicatore di punta è il migliore dei tre, non il caso tipico. Su una singola H100, sulle risposte brevi, il percorso chat è davvero 4,7× più veloce. Sul carico di lavoro video che un agente incarnato eseguirebbe davvero, è più vicino a 2×. Entrambi sono buoni numeri; solo uno dei due è quello di punta.

Isaac 0.1 e 0.2 sono stati ritirati lo stesso giorno

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Il changelog di Mk1.5 contiene una seconda voce datata 25 settembre, ed è quella che ha mordente per chiunque sia già in produzione. Gli ID modello isaac-0.1, isaac-0.2-1b e isaac-0.2-2b-preview sono stati ritirati dall’API Perceptron. Non compaiono più in GET /v1/models, sono spariti dal server MCP ospitato, e le richieste che li nominano ora falliscono con HTTP 404 model_not_found.

C’è un secondo cambiamento di comportamento nascosto nella stessa voce che morderà il codice che non ha mai menzionato i modelli Isaac: gli ID di modello sconosciuti ora restituiscono 404 invece del precedente 400. Qualsiasi logica di retry, ramo di errore o regola di allerta che corrispondeva a un 400 per un nome di modello errato ora non corrisponde più a nulla. Il percorso di migrazione fornito da Perceptron è perceptron-mk1.5.

Dismettere una famiglia di modelli lo stesso giorno in cui rilasci il suo sostituto è una storia di migrazione pulita e una brutale. Se hai fissato Isaac perché funzionava, hai una scadenza che è già passata.

Dove eseguirlo e come provarlo senza scommetterci sopra.

La disponibilità avviene tramite l’API del fornitore stesso e diverse piattaforme di terze parti. Attualmente OrcaRouter non instrada Perceptron Mk1.5 — il modello non è nel nostro catalogo — quindi l’indicazione onesta è di rivolgersi direttamente a api.perceptron.inc, che è esattamente lo scopo dell’SDK e della variabile d’ambiente PERCEPTRON_API_KEY.

Ciò che vale comunque la pena dire, perché si applica alla decisione più che al modello: un checkpoint vecchio di due giorni su una finestra di 36.864 token con un valore predefinito di reasoning impostato su high è esattamente il profilo di qualcosa che non dovresti mettere su un percorso di produzione senza prima averlo visto. Eseguilo prima sui tuoi frame, e misura due cose in particolare — se gli output strutturati sopravvivono ai tuoi casi limite reali, e quanto reasoning_effort: “high” ti costa per chiamata rispetto a passare a medium o low. La seconda è una modifica di una sola riga con un effetto diretto sulla tua fattura, ed è l’esperimento più economico di questa release.

Il modello più ampio in cui questo si inserisce — modelli di percezione che restituiscono geometria anziché aggettivi — è uno che OrcaRouter è costruito per assorbire. Una sola API copre oltre 200 modelli, con i prezzi di listino dei fornitori trasferiti a un ricarico dello 0%, così una variazione di prezzo da parte di un fornitore su uno qualsiasi di essi è attiva dalla nostra parte lo stesso giorno, e il failover automatico significa che una chiamata di percezione può ricadere su un secondo modello invece di far fallire la richiesta. Se Mk1.5 è l’unica cosa che supera la tua soglia di accuratezza, nulla di tutto ciò ti aiuta oggi. Se è un candidato tra diversi, eseguire il confronto attraverso un unico endpoint costa meno che collegare un secondo SDK per scoprirlo.

Cosa è e cosa non è questa release

Perceptron Mk1.5 è uno strumento specializzato, con un insieme insolitamente onesto di limiti al seguito. Restituisce coordinate, non solo una descrizione. Legge l’audio, inclusa la colonna sonora di un video se la attivi. È veloce nelle risposte brevi in chat. È anche un modello da 36.864 token con un tetto di output di 8.192 token, prezzato a $0,15 e $1,50, valutato interamente dal suo stesso fornitore e venduto da un’azienda che ha ritirato la generazione precedente nella stessa voce di changelog.

Se il tuo problema è “trova la mano, tracciala lungo la clip, dimmi dove è andata e quando”, il numero di hand-box è quello da testare. Se il tuo problema è la comprensione video ampia rispetto a un generalista di frontiera, il dato EgoSchema — 80,40 contro 81,20 — suggerisce che stai comprando uno specialista all’incirca alla pari, e la motivazione per cambiare deve venire dall’output strutturato e dalla latenza, non dalla precisione.




#Adessonews seleziona nella rete articoli di particolare interesse.
Se vuoi leggere l’articolo completo clicca sul seguente link

Source link

🚀 #Finsubito | Gruppo Retefin

Affianchiamo imprese e professionisti in tutta Italia nell’accesso alle migliori opportunità di Finanza d’Impresa, Finanza Agevolata, Sostenibilità e Compliance. 🇮🇹

💼 Operiamo esclusivamente attraverso mediatori e operatori autorizzati, offrendo un servizio professionale, trasparente e orientato alle reali esigenze della tua impresa.

✨ Consulenza gratuita e zero costi di istruttoria: analizziamo la situazione della tua azienda, individuiamo le opportunità più adatte e ti supportiamo nella valorizzazione del tuo profilo finanziario e aziendale nei confronti di banche e partner.

📈 Dalla diagnosi iniziale alla strategia finanziaria, siamo al tuo fianco per trasformare le esigenze della tua impresa in concrete opportunità di crescita, investimento e sviluppo.

🔎 Scopri come possiamo supportare la tua impresa. 👉 Contattaci per una prima valutazione.

เติมเกม