Snilld

Photon-1 prætræner på rå video uden action-labels ifølge Induction Labs

MarkTechPost gengiver Induction Labs’ præsentation af imagination models og testsystemet Photon-1: en sparse 106B-A5B MoE-transformer prætrænet på 18 års computerskærm-video med et next‑latent‑prediction‑mål og FSQ‑komprimering. De kvantitative tal stammer fra Induction Labs’ egen rapportering via MarkTechPost og er ikke uafhængigt verificeret.

26. juli 2026 Peter Munkholm

MarkTechPost rapporterer, at Induction Labs har offentliggjort en arkitektur kaldet imagination models, der ifølge virksomheden prætræner på rå video uden action‑labels. Testsystemet omtales som Photon‑1. Ifølge MarkTechPost er idéen at lære at forudsige næste tilstand i et latentrum i stedet for at koble video til handlinger under selve prætræningen.

Næsten alle konkrete nøgletal i artiklen her gengives fra Induction Labs via MarkTechPost. Der fremgår ikke uafhængige tredjepartsverifikationer i den primære kilde.

Formålet med imagination models ifølge kilden

MarkTechPost beskriver, at en imagination‑model forudsiger fremtidige frames autoregressivt med en next‑latent‑token‑prediction‑målsætning. Under prætræning genereres der ikke pixels; alt modelleres i et lært repræsentationsrum. Ifølge Induction Labs er pointen, at evnen til at fuldføre opgaver kan opstå ved at forudsige fremtidige tilstande, selv om modellen ikke ser handlinger under prætræning. De kalder det en implicit policy, gengivet af MarkTechPost.

MarkTechPost skriver også, at Induction Labs formulerer det sådan: modellen lærer begreber om, hvad en person er i gang med, frem for at have en etiket for hvert enkelt museklik. Det er Induction Labs’ udsagn, som kilden gengiver.

Banner
Makro af metalplade med slid og et ætsede 8×5‑punktmønster som metafor for komprimerede FSQ‑tokens, indigo og cyan lys.

Modelstørrelse, korpus og objektiv

Ifølge MarkTechPost er testmodellen Photon‑1 en sparse 106B‑A5B mixture‑of‑experts transformer. Træningskorpuset beskrives som 18 års computer‑demonstrationsvideo. MarkTechPost angiver, at prætræningen bruger et next‑latent‑token‑prediction‑mål, hvor alt foregår i latente repræsentationer under prætræning. De oplysninger stammer fra Induction Labs via den primære kilde.

MarkTechPost fremhæver, at Induction Labs’ påstand om implicit policy‑læring udspringer af denne opsætning, hvor modellen lærer fra forudsigelse af tilstande uden eksplicitte handlingslabels i korpus. Der er ikke anført uafhængige verificeringer heraf i kilden.

FSQ‑komprimering og latente tokens

Ifølge MarkTechPost afhænger arkitekturen af en vision‑encoder, der bruger finite scalar quantization. Hver frame komprimeres, som Induction Labs oplyser det, til 960 diskrete tokens. Hvert token beskrives som en 8‑dimensionel vektor, hvor hver dimension kan antage fem værdier: −1, −1\/2, 0, 1\/2, 1. Det svarer til et kodebogsrum på 5^8 mulige koder. Tallene stammer fra Induction Labs via MarkTechPost.

Den rapporterede størrelse er cirka 2,2 KB pr. frame. MarkTechPost gengiver også, at Photon‑1 bruger en differential latent‑encoder, der indkoder frames parvist, så latenter beskriver forskelle mellem frames frem for fulde billedindhold. Ifølge Induction Labs giver repræsentationen over 100× bedre kompression end eksisterende OCR‑ og multimodale repræsentationer, samtidig med at tekst, layout og tilstandsændringer bevares. Det er virksomhedens tal, gengivet via kilden, uden uafhængig verifikation i artiklen.

Rapporterede benchmarks og omkostninger

På en intern computer‑use‑benchmark rapporterer Induction Labs ifølge MarkTechPost, at Photon‑1 slår Gemini 3.1 Flash‑Lite, bruger langt mindre prætræningscompute og koster omtrent tre gange mindre at serve. Der er tale om Induction Labs’ egne målinger, gengivet af MarkTechPost, og den primære kilde anfører ikke tredjepartsevalueringer.

For at vurdere de rapporterede komprimerings‑ og serving‑tal peger MarkTechPost på Induction Labs’ udsagn. Kilden fremlægger ikke åbne beskrivelser af baselines, datasæt, evalueringsmetrikker eller den præcise måleprotokol, som ville muliggøre uafhængig replikation på nuværende tidspunkt.

Banner
Procesøjeblik: mekanisk afspiller ruller en kugle på en kort bane i et testrum, operationsleder i silhuet i baggrunden, indigo/cyan tone.

Hvad der er sikkert, og hvad der afventer verificering

Følgende forhold tilskrives eksplicit Induction Labs via MarkTechPost: imagination‑arkitekturen prætræner på rå video uden action‑labels; Photon‑1 beskrives som en sparse 106B‑A5B MoE‑transformer; træningen beskrives som 18 års computer‑demonstrationsvideo; prætræningsmålet er next‑latent‑token‑prediction; hver frame komprimeres til 960 FSQ‑tokens med 8×5 værdier; cirka 2,2 KB pr. frame; differential latenter; samt den interne sammenligning, hvor Photon‑1 ifølge virksomheden slår Gemini 3.1 Flash‑Lite og er cirka tre gange billigere at serve.

Uafhængig verifikation af disse tal og effekter fremgår ikke af MarkTechPost‑artiklen. De bør derfor læses som leverandørdata, indtil tredjepartsmålinger eller åbne evals foreligger.

Datagrundlag i korte træk

MarkTechPost gengiver, at Photon‑1 ifølge Induction Labs er trænet på 18 års computer‑demonstrationsvideo. Kilden beskriver, at modellen lærer i et repræsentationsrum under prætræning, hvor den ikke genererer pixels. Yderligere detaljer om datasammensætning ud over den tidsmæssige skala fremgår ikke fuldt ud i den tilgængelige gengivelse, og er derfor ikke refereret her.

Sammenligningstallet mod Gemini og hvad der mangler

Det centrale sammenligningstal i kilden er, at Photon‑1 ifølge Induction Labs slår Gemini 3.1 Flash‑Lite på en intern benchmark og er cirka tre gange billigere at serve. Uden offentlig adgang til benchmark‑suite, workloads, målemetrikker, hardware‑opsætning og compute‑regnskab kan tallene ikke direkte sammenlignes på tværs af miljøer. MarkTechPost præsenterer dem som virksomhedens egne resultater.

Photon-1 prætræner på rå video uden action-labels ifølge Induction Labs - billede 3

Åben vægt‑debatten som kontekst

Artificialintelligence‑news rapporterer, at en række større virksomheder og organisationer i USA har underskrevet et åbent brev, der opfordrer beslutningstagere til at beskytte open‑weight‑modeller. Det er et generelt branchetræk, som ikke er specifikt knyttet til Photon‑1 i kilderne her, men det danner en relevant baggrund for uafhængig evaluering, når vægte udgives offentligt.

Hvad der er værd at holde øje med

For læsere, der følger udviklingen, peger den foreliggende kildedækning på et behov for: åbne evaluerings‑suites til implicit policy‑læring fra video, uafhængige replikationer af de rapporterede FSQ‑ og differential‑latent‑gevinster, samt tredjeparts sammenligninger mod etablerede modeller på klart definerede workloads. Det vil gøre status på de leverandør‑rapporterede tal mere gennemskuelig.

Foreløbig bygger fortællingen om Photon‑1 og imagination‑modellerne på Induction Labs’ oplysninger, gengivet af MarkTechPost. De tekniske elementer og rapporterede tal er præsenteret med tydelig kildeangivelse, mens ekstern bekræftelse afventer uafhængige målinger.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?