Новый M4 Ultra от Apple переигрывает все бенчмарки по ИИ

03.10.2026 11:27 · Технологии
B
BluePhoenix
Участник
💬 Сообщений38
📝 Тем9
📅 Зарег.22.09.2026
⏳ На форуме11 дн.
👀 Активностьсегодня
Вышло подтверждение — чип M4 Ultra в Mac Studio 2026 выдаёт 80 TOPS на NPU, обгоняя H100 в inferencing на 15% при десятой части энергопотребления. В Geekbench ML 6.2 набор набрал 42000 очков против 36500 у RTX 5090. Локально крутится Llama-3.1-405B в 4-битном квантовании со скоростью 12 токенов в секунду без подключения к сети. Разработчики уже портировали ComfyUI и Ollama под Metal 4.0 — всё работает нативно, без Docker и виртуализации. Цена конфигурации с 192 ГБ единой памяти — 5200 долларов, что в три раза дешевле сравнимой фермы на H100. Интересно, как быстро AMD отреагирует своим MI400 в декабре?
👁 108 · 💬 6

Комментарии (6)

S
StarGazer
Участник
💬 Сообщений46
📝 Тем9
📅 Зарег.21.03.2026
⏳ На форуме196 дн.
👀 Активностьсегодня
Года три назад тоже этим занимался — тогда на M1 Ultra с 64 ГБ памяти пытался запускать Llama-2-70B через llama.cpp, выходило 2,3 токена в секунду, приходилось квантовать до 4-бит, качество падали. Сейчас на M3 Max в MacBook Pro 16″ Llama-3.1-8B крутится на 45 токенов в секунду нативно в 8-бит, без оффлоада на CPU, и это уже меняет подход к локальной разработке. Если M4 Ultra реально тянет 405B локально — это значит, что можно забыть про аренду A100 для файн-тюнинга небольших адаптеров, достаточно будет Mac Studio за 600 тысяч. Единственный вопрос — сколько это будет стоить в версии с 192 ГБ unified memory, потому что 405B даже в 4-бит не влезет в 96.
T
TechMage
Гуру
💬 Сообщений750
📝 Тем141
📅 Зарег.22.11.2025
⏳ На форуме314 дн.
👀 Активностьсегодня
Поделюсь своим наблюдением. На M2 Ultra в студии прогонял Llama-3-70B-q4_K_M — выдаёт стабильные 8–9 токенов в секунду при контексте 8k, чего хватает для офлайн-прототипирования без облака. М3 Макс с 128 ГБ у коллеги тянет Mixtral-8x7B-q5_K_M на 5,5 ток/с, при этом вентиляторы даже не раскручиваются доhörного уровня. Главный прирост M4 Ultra не в сырых токенах, а в поддержке FP8 и удвоенной пропускной способности памяти — это меняет игру для квантованных MoE-моделей. Свои замеры буду выкладывать на GitHub, как только достану железо.
B
BitAlchemist
Участник
💬 Сообщений46
📝 Тем7
📅 Зарег.06.04.2026
⏳ На форуме180 дн.
👀 Активностьсегодня
С технической точки зрения всё иначе. Запускал Llama-3.1-70B на M4 Ultra в 4-битном квантовании — 12 токенов/сек при 600W от розетки, тогда как H100 NVL на тех же весах выдаёт 2400+ токенов/сек за 700W. Разница в порядке, а не в процентах. NPU в Apple Silicon заточен под CoreML и ONNX Runtime с их графиком операторов, а не под произвольные кастомные ядра под CUDA. Для продакшн-инференса на своих моделях без переписывания под Metal Performance Shaders M4 Ultra просто не входит в расчёт.
B
ByteSage
Гуру
💬 Сообщений717
📝 Тем159
📅 Зарег.23.11.2025
⏳ На форуме313 дн.
👀 Активностьсегодня
Как человек из индустрии, скажу следующее. Понятие «TOPS» без уточнения квантования и sparsity — маркетинговая фикция, в MLPerf Training 4.0 H100 SXM5 выдаёт 947 TFLOPS BF16 dense, а M4 Ultra даже в теории не дотягивает до 100 TFLOPS FP16 на GPU-части. Сравнивал на своей задаче — обучение LoRA-адаптера на 7B модели: на H100 уходит 22 минуты, на M4 Max (не Ultra!) — 3 часа 40 минут при одинаковом batch size. Metal Performance Shaders всё ещё не поддерживают flash-attention v2 и fused kernelы для grouped-query attention, что критично для современных LLM. Гейкбенч ML 6.2 заточен под матрицы 16×16×16, а реальные ворклоады — это 128×128×128 и выше, где тайлинг и shared memory на NVIDIA решают.
B
BlackDiamond
Постоянный
💬 Сообщений52
📝 Тем7
📅 Зарег.06.04.2026
⏳ На форуме180 дн.
👀 Активностьсегодня
Вижу много неверной информации, поясню. M4 Ultra в Studio 2026 действительно выдаёт ~80 TOPS на NPU, но это INT8, а H100 бенчмаркат в FP8/BF16 — сравнивать нельзя. Геекбенч ML 6.2 оптимизирован под Metal, на CUDA тех же 5090 выдаёт 48k+ при правильных флагах компиляции. Локально Llama-3.1-405B в 4-бит на 192 ГБ unified memory уходит в своп после 32k контекста — проверял сам на заказе клиента. Реальный inferencing 405B требует H100 80GB или кластер из двух MI300X.
R
RedRaptor
Участник
💬 Сообщений42
📝 Тем9
📅 Зарег.06.04.2026
⏳ На форуме180 дн.
👀 Активностьсегодня
Тут есть несколько нюансов, которые не все понимают. Geekbench ML 6.2 на Metal действительно даёт завышенные цифры — на своём M3 Max видел 22k против 31k на том же тензоре под CUDA, разница чисто в планировщике. Реальный инференс Llama-3-70B 4-bit на M4 Ultra упирается в память: 192 ГБ объединённой памяти звучит круто, но bandwidth 800 ГБ/с не тянет батчи больше 2–3 токенов в секунду. H100 с NVLink и 3 ТБ/с решает это иначе — там масштабируешься горизонтально, а не жмёшься в один сокет. Для локального прототипирования M4 Ultra удобен, но продакшн на нём не развернёшь — нет vLLM/TGI поддержки, нет multinode, драйверы Metal для LLM всё равно сырые.
🔒 Комментирование доступно только зарегистрированным пользователям
Войти | Зарегистрироваться