OpenAI представила чип Jalapeño для ускорения работы ИИ-моделей

·

·

Просмотров: 65

OpenAI* представила результаты тестирования собственного чипа Jalapeño для инференса — запуска уже обученных ИИ-моделей. По данным компании, в тестах на моделях GPT-OSS 120B*, DeepSeek R1 670B и Kimi K2.5 1T Jalapeño показал в 1,5–1,9 раза больше ИИ-работы на ватт и в 1,7–3,6 раза меньшую задержку ответа, чем системы на базе Nvidia GB200 и GB300.

Для интерактивных сценариев разница оказалась еще больше: OpenAI сообщает о 2,1—4,1-кратном преимуществе по производительности. На самой крупной из протестированных моделей, Kimi K2.5 с 1 трлн параметров, Jalapeño показал примерно в 1,5 раза больше производительности на ватт и в 3,4 раза меньшую задержку, чем система сравнения.

Тестирование проводилось с использованием бенчмарка SemiAnalysis InferenceX. В нем Jalapeño сравнивали с системами Nvidia GB200 и GB300 на 3 моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Приведенные показатели — результаты, опубликованные OpenAI.

Зачем OpenAI собственный чип

Jalapeño предназначен не для обучения новых моделей, а их запуска и обслуживания пользовательских запросов. На этапе инференса модель генерирует ответы, пишет код, обрабатывает изображения или выполняет задачи ИИ-агента.

Для OpenAI эффективность такого оборудования напрямую связана с затратами на работу сервисов. Чем больше запросов можно обработать при том же энергопотреблении и чем меньше задержка ответа, тем эффективнее используется вычислительная инфраструктура.

По словам руководителя аппаратного направления OpenAI Ричарда Хо, Jalapeño должен одновременно решать 2 задачи:

  1. Обеспечивать высокую пропускную способность.
  2. Быстро отвечать на отдельные запросы.

Обычно увеличение числа одновременно обрабатываемых запросов требует компромисса по задержке, но архитектура Jalapeño рассчитана на сочетание этих показателей.

Как обычные люди собирают сайты и ботов на нейросетях и начинают зарабатывать онлайн
Вышел бесплатный 5-дневный онлайн-мастер-класс, на котором показывают, как за несколько вечеров собрать простой сайт или бота с платной подпиской и подключёнными платежами — без опыта в программировании.

Николай Волосянков — автор проектов на нейросетях, основатель онлайн-университета интернет-профессий Universus.

Что разбирают за 5 дней мастер-класса:
  • Как устроены нейросети простыми словами и почему сейчас на них строят новые онлайн-сервисы.
  • Пошагово показывают, как из обычной идеи сделать рабочий сайт: от текста и дизайна до первых пользователей.
  • Как подключить оплату и платную подписку, чтобы сайт или сервис могли приносить деньги автоматически.
  • Как собрать бота в популярных мессенджерах, который отвечает людям и принимает оплату без участия владельца.
  • Какие реальные способы заработка используют участники: от первых продаж в течение недели до стабильного дохода с цифрового актива.
Записаться на мастер-класс

Уже начали обучение 12 350 человек

В некоторых тестах разница достигла десятков раз

OpenAI также приводит результаты при одинаковом времени между выдачей отдельных токенов. В таком режиме Jalapeño показал особенно большую разницу с системами Nvidia.

Для GPT-OSS 120B чип обеспечил примерно в 53,7 раза большую пропускную способность, а для DeepSeek R1 — более чем в 100 раз большую, если сравнивать при одинаковом времени между токенами. Это не означает, что Jalapeño в обычной работе в 50 или 100 раз быстрее Nvidia: речь идет о специальном режиме сравнения при одинаковом показателе задержки между токенами.

Именно поэтому эти цифры стоит рассматривать отдельно от основных показателей производительности на ватт и общей задержки.

Как устроен Jalapeño

OpenAI разрабатывает Jalapeño совместно с Broadcom. Проект рассчитан на инференс больших языковых моделей и оптимизирован под особенности их работы.

Одна из задач архитектуры в том, чтобы сократить перемещение данных между компонентами системы. При генерации ответа значительная часть нагрузки связана не только с вычислениями, но и с передачей данных между памятью, вычислительными блоками и другими компонентами.

Jalapeño использует 6 стеков памяти HBM4. Общий объем составляет 216 ГБ, а пропускная способность памяти достигает 15,4 ТБ/с. Сам чип рассчитан на мощность около 700 Вт.

OpenAI также использует локальное хранение состояния модели, включая KV-cache, ближе к вычислительным блокам. Это должно уменьшить объем перемещаемых данных и снизить задержки при генерации ответа.

Когда Jalapeño появится в работе OpenAI

OpenAI планирует начать развертывание Jalapeño в конце 2026 года, в небольших объемах. Более масштабное внедрение ожидается в 2027 году.

При этом компания не собирается полностью отказываться от оборудования Nvidia. Jalapeño предназначен для инференса, тогда как для обучения моделей OpenAI по-прежнему требуется другая вычислительная инфраструктура. Кроме того, компания продолжает использовать оборудование партнеров.

Пока результаты Jalapeño нельзя считать окончательным доказательством преимущества над будущими поколениями Nvidia. Тесты показывают показатели конкретной системы в конкретных условиях и основаны на данных OpenAI. Но уже сейчас они дают представление о том, зачем компании вроде OpenAI разрабатывают собственные ускорители: контролировать стоимость инференса, энергопотребление и задержку при работе больших ИИ-моделей.


*Цифровые продукты компании OpenAI — недоступны в РФ.


Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Бесплатно

После регистрации вы получите ГАЙД «7 способов заработка на нейросетях с примерами».

Бесплатно

Работайте с GPT, Claude, Gemini и другими моделями без VPN в одном удобном интерфейсе.