NVIDIA выпустила open-source примеры на C++, которые ускоряют локальный ИИ-инференс на Windows и Linux через ONNX Runtime и NVIDIA TensorRT RTX execution provider.
Каждый пример разделяет экспорт модели и её развертывание: Python-экспортёр конвертирует чекпоинты Hugging Face в ONNX-артефакты, после чего инференс выполняется через нативный C++ CLI на основе API сессий и тензоров ONNX Runtime.
Поддерживаются задачи автоматической распознавания речи (OpenAI Whisper, NVIDIA Parakeet TDT, NVIDIA Nemotron ASR Streaming), интерактивной сегментации (Meta SAM 2.1) и генерации изображений по промпту (FLUX.2-klein-4B).
Измерения производительности на DGX Spark показывают ускорение GPU в диапазоне от 39x реального времени для Nemotron ASR Streaming до 206x для Parakeet TDT, а Meta SAM 2.1 достигает 38,3 FPS на GPU против 0,5 FPS на CPU.
Пример FLUX.2 демонстрирует графическую интеграцию через Vulkan и DirectX с возможностями ONNX Runtime 1.25, а также показывает, как посттренировочное квантование с NVIDIA Model Optimizer создаёт полноценную замену в формате ONNX, требующую никаких изменений в коде приложения.
Это краткое изложение. Полный текст статьи доступен на сайте источника:
Читать полностью на NVIDIAКак это касается вашего бизнеса
Изменения на рынке важны, когда руководитель видит их в показателях своей компании. Радар управления каждый день собирает брифинг: 10 приоритизированных сигналов о главном за 24 часа.
