Перейти к основному содержимому
AXIOMA AI
Все новости
Рынок AI

NVIDIA представила C++-примеры для локального ИИ с TensorRT RTX

NVIDIA представила C++-примеры для локального ИИ с TensorRT RTX
206x
ускорение GPU для Parakeet TDT на DGX Spark

NVIDIA выпустила open-source примеры на C++, которые ускоряют локальный ИИ-инференс на Windows и Linux через ONNX Runtime и NVIDIA TensorRT RTX execution provider.

Каждый пример разделяет экспорт модели и её развертывание: Python-экспортёр конвертирует чекпоинты Hugging Face в ONNX-артефакты, после чего инференс выполняется через нативный C++ CLI на основе API сессий и тензоров ONNX Runtime.

Поддерживаются задачи автоматической распознавания речи (OpenAI Whisper, NVIDIA Parakeet TDT, NVIDIA Nemotron ASR Streaming), интерактивной сегментации (Meta SAM 2.1) и генерации изображений по промпту (FLUX.2-klein-4B).

Измерения производительности на DGX Spark показывают ускорение GPU в диапазоне от 39x реального времени для Nemotron ASR Streaming до 206x для Parakeet TDT, а Meta SAM 2.1 достигает 38,3 FPS на GPU против 0,5 FPS на CPU.

Пример FLUX.2 демонстрирует графическую интеграцию через Vulkan и DirectX с возможностями ONNX Runtime 1.25, а также показывает, как посттренировочное квантование с NVIDIA Model Optimizer создаёт полноценную замену в формате ONNX, требующую никаких изменений в коде приложения.

Это краткое изложение. Полный текст статьи доступен на сайте источника:

Читать полностью на NVIDIA

Как это касается вашего бизнеса

Изменения на рынке важны, когда руководитель видит их в показателях своей компании. Радар управления каждый день собирает брифинг: 10 приоритизированных сигналов о главном за 24 часа.