Expertiză · Modele AI personalizate
Alegem modelul pe măsurătoare, nu pe reputație — și spunem de la început când răspunsul corect este să nu antrenăm nimic.
Lucrarea are patru părți: măsurăm modelele candidate pe datele tale, alegem între configurare, căutare în documente și reglaj fin, verificăm drepturile de utilizare ale datelor, apoi punem consumul sub buget pe cheie. Nu am antrenat până acum niciun model în producție și o spunem înainte să întrebi.
Construit dejaPartea de măsurare și operare este construită și rulată, cu rezultate păstrate: un banc de probă propriu care a comparat opt sisteme de recunoaștere a vorbirii pe aceleași 200 de enunțuri românești, cu interval de încredere și diferențe pe perechi, plus o descompunere a latenței vocale în șase segmente care se însumează la total cu abatere sub o milisecundă. Partea de operare este un gateway propriu cu 44 de modele configurate, chei per proiect cu listă albă de modele și buget, și o consolidare zilnică a consumului pe utilizator × cheie × model. Partea pe care NU am făcut-o — reglajul fin propriu-zis — e scrisă ca atare: conducta e pregătită și costată, dar nu a rulat niciodată pe GPU. Serviciul rămâne „livrat” pentru că lucrarea pe care o vindem este alegerea informată și operarea, nu antrenarea.
Cele mai multe proiecte de „model personalizat” nu au nevoie de un model antrenat. Au nevoie de modelul potrivit, cu instrucțiunea potrivită, peste datele potrivite, cu un cost pe apel pe care cineva îl urmărește. Lucrarea începe cu întrebarea pe care puțini o pun: cum arată succesul, măsurat cum, pe ce set de cazuri? Fără răspunsul ăsta, orice comparație de modele e o discuție de gusturi.
Măsurăm noi, nu preluăm cifrele furnizorilor. Când am avut nevoie să știm ce recunoaște cel mai bine româna vorbită, am rulat opt sisteme pe aceleași 200 de enunțuri, cu același normalizator, cu interval de încredere prin bootstrap și cu diferențe calculate pe perechi. Rezultatele au fost incomode: sistemul pe care îl foloseam în producție avea 26,26% rată de eroare pe cuvânt, iar un model mic, de 110 milioane de parametri, rulat pe procesor, avea 6,83%. Am publicat și partea neplăcută — pe acuratețea în română pierdem la diferență mare față de furnizorii comerciali.
A doua parte a lucrării e alegerea între trei drumuri care se confundă des: configurarea modelului (instrucțiune, unelte, parametri), căutarea în documentele tale, și reglajul fin. Ordinea în care le încercăm nu e o preferință, e economie: primele două sunt reversibile într-o după-amiază, a treia cere date, drepturi, GPU și o măsurătoare înainte și după. Recomandăm reglajul fin doar când avem dovada că primele două nu ajung.
A treia parte, cea care rămâne după ce lansezi: costul pe apel. Modelele trec printr-un gateway propriu, unde fiecare cheie are listă albă de modele, buget și perioadă. Consumul se consolidează zilnic pe utilizator, cheie și model, ceea ce înseamnă că întrebarea „de ce a crescut factura luna asta” are răspuns pe rânduri, nu pe presupuneri.