OpenAI* представила результаты тестирования собственного чипа Jalapeño для инференса — запуска уже обученных ИИ-моделей. По данным компании, в тестах на моделях GPT-OSS 120B*, DeepSeek R1 670B и Kimi K2.5 1T Jalapeño показал в 1,5–1,9 раза больше ИИ-работы на ватт и в 1,7–3,6 раза меньшую задержку ответа, чем системы на базе Nvidia GB200 и GB300.

Для интерактивных сценариев разница оказалась еще больше: OpenAI сообщает о 2,1—4,1-кратном преимуществе по производительности. На самой крупной из протестированных моделей, Kimi K2.5 с 1 трлн параметров, Jalapeño показал примерно в 1,5 раза больше производительности на ватт и в 3,4 раза меньшую задержку, чем система сравнения.
Тестирование проводилось с использованием бенчмарка SemiAnalysis InferenceX. В нем Jalapeño сравнивали с системами Nvidia GB200 и GB300 на 3 моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Приведенные показатели — результаты, опубликованные OpenAI.
Зачем OpenAI собственный чип
Jalapeño предназначен не для обучения новых моделей, а их запуска и обслуживания пользовательских запросов. На этапе инференса модель генерирует ответы, пишет код, обрабатывает изображения или выполняет задачи ИИ-агента.
Для OpenAI эффективность такого оборудования напрямую связана с затратами на работу сервисов. Чем больше запросов можно обработать при том же энергопотреблении и чем меньше задержка ответа, тем эффективнее используется вычислительная инфраструктура.
По словам руководителя аппаратного направления OpenAI Ричарда Хо, Jalapeño должен одновременно решать 2 задачи:
- Обеспечивать высокую пропускную способность.
- Быстро отвечать на отдельные запросы.
Обычно увеличение числа одновременно обрабатываемых запросов требует компромисса по задержке, но архитектура Jalapeño рассчитана на сочетание этих показателей.
- Как устроены нейросети простыми словами и почему сейчас на них строят новые онлайн-сервисы.
- Пошагово показывают, как из обычной идеи сделать рабочий сайт: от текста и дизайна до первых пользователей.
- Как подключить оплату и платную подписку, чтобы сайт или сервис могли приносить деньги автоматически.
- Как собрать бота в популярных мессенджерах, который отвечает людям и принимает оплату без участия владельца.
- Какие реальные способы заработка используют участники: от первых продаж в течение недели до стабильного дохода с цифрового актива.
Уже начали обучение 12 350 человек
В некоторых тестах разница достигла десятков раз
OpenAI также приводит результаты при одинаковом времени между выдачей отдельных токенов. В таком режиме Jalapeño показал особенно большую разницу с системами Nvidia.

Для GPT-OSS 120B чип обеспечил примерно в 53,7 раза большую пропускную способность, а для DeepSeek R1 — более чем в 100 раз большую, если сравнивать при одинаковом времени между токенами. Это не означает, что Jalapeño в обычной работе в 50 или 100 раз быстрее Nvidia: речь идет о специальном режиме сравнения при одинаковом показателе задержки между токенами.
Именно поэтому эти цифры стоит рассматривать отдельно от основных показателей производительности на ватт и общей задержки.
Как устроен Jalapeño
OpenAI разрабатывает Jalapeño совместно с Broadcom. Проект рассчитан на инференс больших языковых моделей и оптимизирован под особенности их работы.
Одна из задач архитектуры в том, чтобы сократить перемещение данных между компонентами системы. При генерации ответа значительная часть нагрузки связана не только с вычислениями, но и с передачей данных между памятью, вычислительными блоками и другими компонентами.
Jalapeño использует 6 стеков памяти HBM4. Общий объем составляет 216 ГБ, а пропускная способность памяти достигает 15,4 ТБ/с. Сам чип рассчитан на мощность около 700 Вт.
OpenAI также использует локальное хранение состояния модели, включая KV-cache, ближе к вычислительным блокам. Это должно уменьшить объем перемещаемых данных и снизить задержки при генерации ответа.
Когда Jalapeño появится в работе OpenAI
OpenAI планирует начать развертывание Jalapeño в конце 2026 года, в небольших объемах. Более масштабное внедрение ожидается в 2027 году.
При этом компания не собирается полностью отказываться от оборудования Nvidia. Jalapeño предназначен для инференса, тогда как для обучения моделей OpenAI по-прежнему требуется другая вычислительная инфраструктура. Кроме того, компания продолжает использовать оборудование партнеров.
Пока результаты Jalapeño нельзя считать окончательным доказательством преимущества над будущими поколениями Nvidia. Тесты показывают показатели конкретной системы в конкретных условиях и основаны на данных OpenAI. Но уже сейчас они дают представление о том, зачем компании вроде OpenAI разрабатывают собственные ускорители: контролировать стоимость инференса, энергопотребление и задержку при работе больших ИИ-моделей.
*Цифровые продукты компании OpenAI — недоступны в РФ.