Экспериментируем с предлагаемым API-интерфейсом Cross-Origin Storage в Transformers.js.
Transformers.js предоставляет веб-разработчикам простой способ использовать возможности преобразователей в своих веб-приложениях с помощью конвейеров для конкретных задач. Чтобы запустить вывод в браузере, разработчики создают экземпляр конвейера() и указывают задачу, для которой они хотят использовать конвейер. В качестве конкретного примера в следующем фрагменте показано, как настроить конвейер автоматического распознавания речи (ASR). импортировать {конвейер} из 'https://cdn.jsdelivr.net/npm/@huggingface/transformers@4.2.0'; const asr = конвейер ожидания ('автоматическое распознавание речи', 'Xenova/whisper-tiny.en', {устройство: 'webgpu'},); const result = await asr('jfk.wav'); консоль. журнал (результат); Проблема с кэшем. В исходном коде вы заметили, что в качестве модели я указал Xenova/whisper-tiny.en, что является очень достойным выбором для обычных задач автоматического распознавания английской речи. Фактически, это даже модель по умолчанию в соответствии с разрешением модели по умолчанию Transformers.js, согласно связанному отрывку. Ресурсы модели. Когда вы запускаете этот пример в браузере, Transformers.js автоматически загружает и кэширует соответствующие ресурсы модели и файлы Wasm. На следующем снимке экрана показан раздел хранилища кэша Chrome DevTools после посещения приложения. Когда вы перезагружаете страницу, ресурсы обслуживаются из Cache API, и модель почти мгновенно возвращает результаты. Однако, поскольку Xenova/whisper-tiny.en является популярной моделью (и, как упоминалось ранее, даже моделью ASR по умолчанию в Transformers.js), вы вполне можете себе представить, что ее будет использовать не одно приложение, которое вы посещаете. Чтобы смоделировать эту ситуацию, вот тот же пример приложения, что и раньше, но обслуживаемый из другого источника. Когда вы посещаете это другое исходное приложение, вместо того, чтобы его можно было использовать почти мгновенно, браузеру вместо этого приходится снова загружать и кэшировать все ресурсы модели, даже если они побайтно такие же, как и раньше. Даже в этом игрушечном примере это добавляет до 177 МБ дублирующейся загрузки и хранения, как вы можете проверить в разделе «Хранилище» на панели приложений Chrome DevTools. Вы можете себе представить, что это быстро складывается. Ресурсы среды выполнения Wasm Но становится еще хуже. Давайте добавим к игрушечному примеру второй конвейер: анализ настроений. Анализ настроений по умолчанию использует модель Xenova/distilbert-base-uncased-finetuned-sst-2-english. Если модель не указана, разрешение модели по умолчанию Transformers.js автоматически выберет ее за вас. const классификатор = конвейер ожидания ('анализ настроений'); константное настроение = ожидание классификатора (result. text); консоль. журнал (настроения); Две совершенно разные модели искусственного интеллекта, но они зависят от одного и того же файла времени выполнения ort-wasm-simd-threaded.asyncify.wasm WebAssembly (Wasm) размером 4733 КБ из базовой библиотеки времени выполнения ONNX, на основе которой построен Transformers.js. Откройте расширенную демонстрацию в другом источнике, и на вкладке «Сеть» вы заметите, как среда выполнения Wasm снова загружается и кэшируется. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.