Експертиза · Індивідуальні моделі AI
Ми обираємо модель за вимірюванням, а не за репутацією — і від самого початку кажемо, коли правильна відповідь — не тренувати нічого.
Робота має чотири частини: ми вимірюємо кандидатні моделі на ваших даних, обираємо між конфігурацією, пошуком у документах і тонким налаштуванням, перевіряємо права на використання даних, а потім ставимо споживання під бюджет на ключ. Ми ще не тренували жодної моделі в продакшені, і говоримо це до того, як ви запитаєте.
Вже збудованоPartea de măsurare și operare este construită și rulată, cu rezultate păstrate: un banc de probă propriu care a comparat opt sisteme de recunoaștere a vorbirii pe aceleași 200 de enunțuri românești, cu interval de încredere și diferențe pe perechi, plus o descompunere a latenței vocale în șase segmente care se însumează la total cu abatere sub o milisecundă. Partea de operare este un gateway propriu cu 44 de modele configurate, chei per proiect cu listă albă de modele și buget, și o consolidare zilnică a consumului pe utilizator × cheie × model. Partea pe care NU am făcut-o — reglajul fin propriu-zis — e scrisă ca atare: conducta e pregătită și costată, dar nu a rulat niciodată pe GPU. Serviciul rămâne „livrat” pentru că lucrarea pe care o vindem este alegerea informată și operarea, nu antrenarea.
Більшості проєктів «індивідуальної моделі» не потрібна навчена модель. Їм потрібна правильна модель, з правильною інструкцією, поверх правильних даних, із вартістю за виклик, яку хтось відстежує. Робота починається з питання, яке мало хто ставить: як виглядає успіх, як саме виміряний, на якому наборі випадків? Без цієї відповіді будь-яке порівняння моделей — це розмова про смаки.
Ми міряємо самі, а не беремо цифри постачальників. Коли нам потрібно було знати, що найкраще розпізнає румунську мову в усному мовленні, ми запустили вісім систем на тих самих 200 висловлюваннях, з тим самим нормалізатором, з довірчим інтервалом через bootstrap і з парними різницями. Результати були незручні: система, яку ми використовували в продакшені, мала 26,26% частки помилки на слово, а маленька модель із 110 мільйонів параметрів, запущена на процесорі, мала 6,83%. Ми оприлюднили і неприємну частину — за точністю в румунській мові ми значно програємо комерційним постачальникам.
Друга частина роботи — вибір між трьома шляхами, які часто плутають: налаштування моделі (інструкція, інструменти, параметри), пошук у ваших документах і fine-tuning. Порядок, у якому ми їх пробуємо, — не вподобання, а економія: перші два можна повернути назад за післяобід, третій потребує даних, прав, GPU і вимірювання до та після. Ми рекомендуємо fine-tuning лише тоді, коли маємо доказ, що перших двох недостатньо.
Третя частина, яка лишається після запуску: вартість за виклик. Моделі проходять через власний gateway, де кожен ключ має білий список моделей, бюджет і період. Споживання консолідується щодня за користувачем, ключем і моделлю, а це означає, що запитання «чому цього місяця виріс рахунок» має відповідь по рядках, а не за припущеннями.