Dobrodošli· četvrtak, 30. juli 2026.
Vijesti
Tehnologija

Tether Data izbacuje AI iz oblaka: vision model od 460 miliona parametara radi direktno na telefonu

Tether Data je open-sourceovao VisionPsy-Nano, vision-language model od 460 miliona parametara za pametne telefone, koji je pobijedio konkurente na 16 od 17 benchmarka.

Foto: Bitcoin.com News

Redakcija ACX+ACX+ Magazin · prije 2 h
3 min čitanja

Tether Data je otvorio kod (open-source) vision-language modela od 460 miliona parametara napravljenog da radi direktno na pametnim telefonima umjesto oslanjanja na cloud servere. Model VisionPsy-Nano, koji je u srijedu objavio QVAC, istraživački AI ogranak kompanije, može analizirati slike, dokumente i grafikone, pa odgovarati na pitanja bez slanja izvornog materijala udaljenom sistemu. Telefon obrađuje i ulaz i odgovor, što softveru omogućava da radi offline i zadrži podatke na uređaju.

QVAC navodi da je model Tether AI Researcha zabilježio najviši ukupni rezultat među vision-language sistemima sa manje od 500 miliona parametara, pobijedivši konkurentske modele na 16 od 17 benchmarka. Model je postigao normalizovani rezultat od 62,3, u poređenju sa 59,6 za LFM2.5-VL-450M kompanije Liquid AI i 52,5 za SmolVLM2-500M Hugging Facea. Raniji QVAC-ov osnovni model nanoVLM-460M-8k imao je rezultat 54,9. QVAC takođe navodi da je model nadmašio konkurente slične veličine u prosjeku za 7,4 odsto na testovima vizuelnog rezonovanja, a na benchmarcima MM-IFEval i POPE i modele više nego dvostruko veće od sebe, uključujući izdanja Qwena i InternVL-a.

Izdanje dolazi u dvije verzije: standardna daje prednost tačnosti, dok Flash žrtvuje mali dio kvaliteta za brže odgovore. QVAC kaže da Flash zadržava oko 99 odsto performansi punog modela, uz prvi izlaz do 23 puta brži od SmolVLM2-500M na Android telefonima i do 36 puta brži na iPhoneu 15. Brzina odziva je bitna na mobilnom hardveru: kompaktan model može dobro proći na testovima, a da se i dalje čini nepraktičnim ako korisnik mora čekati obradu slike. Sistem podržava i analizu dokumenata i optičko prepoznavanje karaktera (OCR), izvlačeći tekst i strukturu iz finansijskih izvještaja, dijagrama i infografika.

Prenošenje obrade slika iz data centra na telefon nosi stroga ograničenja oko memorije, toplote, potrošnje baterije i računarske snage, a kompaktni modeli često gube tačnost na gustim grafikonima, tabelama ili skeniranim dokumentima. QVAC-ovi rezultati sugerišu da je model zadržao veliki dio te sposobnosti ostajući dovoljno mali za potrošačke uređaje. Lokalna obrada znači i da se dokumenti ne moraju uploadovati, a softver nastavlja raditi bez mrežne konekcije. Developeri modelu mogu pristupiti kroz Hugging Face Transformers, kvantizovanu GGUF verziju za llama.cpp ili vLLM backend za serversku upotrebu većeg obima. QVAC je objavio i benchmark konfiguracije kroz VLMEvalKit, čime spoljni istraživači mogu ponoviti testove. Obje verzije nose Apache 2.0 licencu, koja dozvoljava komercijalnu upotrebu, izmjene i redistribuciju.

Izvršni direktor Tethera Paolo Ardoino rekao je da izdanje podržava kompanijski zaokret ka lokalnim, efikasnim AI sistemima: „Postizanje najboljeg kvaliteta i performansi u klasi na opštim vision zadacima sa svega 460 miliona parametara dokazuje da je lokalni, visokoefikasni AI održiv put.“ Model slijedi više QVAC izdanja od oktobra 2025. godine, uključujući sintetičke trening skupove podataka, cross-platform razvojni SDK i medicinske modele za telefone i nosive uređaje. Tether svoju AI ekspanziju finansira profitima iz USDT stablecoin biznisa, a investirao je i u AI infrastrukturu, biotehnologiju i robotiku, uključujući Series C investiciju u NEURA Robotics vrijednu do 1,4 milijarde dolara.

Izvor: Bitcoin.com

Izvor: Bitcoin.com