Материал для ML-инженеров, indie-разработчиков AI-приложений и IT-директоров, которые выбирают железо до WWDC и релиза M5. Мы сравниваем M4, M5 (прогноз) и M2 по реальным сценариям inference — не по синтетическим бенчмаркам. Внутри: три системных ограничения, две таблицы решений, шесть шагов runbook, цитируемые цифры и сценарий «сначала аренда — потом покупка» через LeanVPS.
Технический принцип: почему NPU не решает задачу LLM
Apple Silicon для self-hosted LLM работает по цепочке GPU + unified memory: веса модели, KV-cache и activations делят один пул RAM без копирования между CPU и discrete GPU. MLX от Apple и Ollama/llama.cpp в macOS идут именно этим путём. NPU (Neural Engine) оптимизирован под Core ML и системный Apple Intelligence; для произвольных Llama-weights адаптация фреймворков отстаёт, и прирост от M5 NPU в community-тестах оценивается в 10–18% — при том что цена SKU может вырасти на 15–20%.
Следствие для архитектора: +8 ГБ памяти ценнее +1 поколения NPU. Модель 13B Q4 занимает 8–10 ГБ только весами; macOS, IDE и RAG-индекс съедают ещё 4–6 ГБ. На 16 ГБ машине swap резко режет tok/s — это не «медленный чип», а физика пропускной способности памяти.
Три болевые точки: не поддавайтесь маркетингу M5
- 1. Потолок — память, не TOPS. 7B Q4 ≈ 4–5 ГБ, 13B ≈ 8–10 ГБ. На 16 ГБ при активном RAG и IDE swap неизбежен. M5, если сохранит политику «512 ГБ SSD в базе, память — доплата», ухудшит TCO относительно дисконтированного M4_24.
- 2. NPU ≠ основной ускоритель LLM. MLX и Ollama масштабируются через GPU-ядра и bandwidth. Удвоение NPU в M5 (~75 TOPS vs 38 у M4) не линейно ускоряет ваш Llama 3.1, пока фреймворк не маршрутизирует слои на ANE.
- 3. Скрытая цена ожидания M5. После WWDC до массовых поставок mini часто проходит 3–6 месяцев. Проект с локальным inference не может простаивать: аренда M4 на 2–3 месяца дешевле простоя команды и дешевле покупки «на вырост» с последующим обесцениванием.
Матрица M2 vs M4 vs M5: локальный LLM inference
| Параметр | Mac mini M2 | Mac mini M4 | Mac mini M5 (прогноз) |
|---|---|---|---|
| GPU-ядра | 10 | 10 (новая arch) | 10+ |
| Unified memory BW | 100 GB/s | 120 GB/s | ~130 GB/s |
| NPU TOPS | 15.8 | 38 | ~75 |
| Реком. модель | 7B Q4 | 7B–13B Q4/Q5 | 13B–14B чуть быстрее |
| Цена входа | дисконт | от ~$499 street | +15–20% premium |
| Цена/качество LLM | устаревает | лидер 2026 | флагманский premium |
Таблица решений: память × размер модели
| Память | Стабильный размер | tok/s (7B Q4, ориентир) | LeanVPS |
|---|---|---|---|
| 16 GB | 7B–8B, одна сессия | ~35–45 | M4_16 |
| 24 GB | 13B–14B, multi-agent | ~40–55 | M4_24 ★ |
| 32 GB+ | 34B quantized (эксп.) | зависит от Q | по запросу |
Инженерный вывод: M4 быстрее M2 на ~20% по bandwidth; относительно прогнозируемого M5 отстаёт лишь на ~10% в tok/s, но может быть дешевле на $150+ в эквивалентной конфигурации. Для production RAG выбирайте память, не поколение чипа.
Шесть шагов: локальный LLM за две недели
- Зафиксируйте модель и границы данных. Список семейств (Llama 3, Qwen 2.5, DeepSeek) и политика: данные не покидают хост. Ollama — универсальный старт; MLX — если стек Apple-native.
- Выберите память от модели. Proof-of-concept 7B → 16 ГБ; RAG + 13B production → 24 ГБ. Не форсируйте 13B на 16 ГБ — получите swap, а не «медленный M4».
- Арендуйте M4 и измерьте. SSH на LeanVPS,
brew install ollamaилиpip install mlx-lm; один и тот же prompt-set для tok/s и time-to-first-token. - Baseline на бизнес-prompt. 100 типовых запросов, P50/P95 latency; сравните с cloud API ($0.15/1M input tokens для GPT-4o mini) — break-even часто через 2–3 месяца при высоком объёме.
- Мониторинг памяти. Отдельный каталог для weights;
htop+ порог 85% RAM → upgrade тарифа до M4_24. - Решение buy vs rent. Проект <6 месяцев — продлевайте аренду; стабильная нагрузка 12+ месяцев — покупайте M4 по акции или ждите M5 после нормализации цен.
Цитируемые цифры для engineering memo (15 июня 2026)
- Скорость inference: M4_24 + Llama 3.1 8B Q4 — community ~45–55 tok/s; M2 тот же сетап ~30 tok/s. Разница — bandwidth и архитектура GPU, не только NPU.
- Cloud vs local: при ~5M tokens/день cloud mini-tier ≈ $750/мес; аренда M4_24 LeanVPS от $96.5/мес — окупаемость 2–3 месяца при стабильной нагрузке.
- TCO аренды: шесть месяцев M4_24 ≈ $579 vs retail Mac mini M4_24 $699+ плюс риск простоя до M5 — экономия порядка 40% на коротком горизонте.
- M5 premium: прогноз +15–20% к MSRP при +~10% tok/s на GPU-path — ROI откладывается до падения street price.
FAQ: частые вопросы инженеров
- Какой максимум модели на M4? 16 ГБ — 7B–8B Q4/Q5; 24 ГБ — 13B–14B с запасом под RAG. 32B+ требует Mac Studio класса (64 ГБ+).
- M5 сделает M4 «мусором»? Для Ollama/MLX — нет в горизонте 2026–2027. M5 — для NPU-heavy Apple Intelligence; M4 остаётся sweet spot по цена/память/скорость.
- Нужен ли свой Mac или хватит аренды? Для валидации размера модели и prompt pipeline — аренда M4_24 за день; покупка — после подтверждения load profile.
Итог и покупка: сначала докажите load, потом capEx
Вывод 2026: удвоение NPU в M5 — хорошая новость для экосистемы Apple, но победитель локального LLM определяется unified memory и bandwidth. Mac mini M4 с 24 ГБ — лучший баланс скорости, наличия и цены; M5 имеет смысл после стабилизации MSRP, если ваш продукт критически зависит от ANE.
Рекомендуемое действие: откройте страницу заказа LeanVPS, выберите M4_24 — SSH в тот же день, bare-metal Mac mini, Ollama/MLX по вашему runbook. Прогоните 100 бизнес-prompt, зафиксируйте tok/s и TCO; если нагрузка стабильна 12+ месяцев — покупайте M4 по акции или переходите на M5 с цифрами в руке. Тарифы — на странице цен; проект завершился — отмена без sunk cost в железо.
Арендуйте M4_24 — Ollama / MLX в тот же день
24 ГБ unified memory, bare-metal Mac mini, SSH за 30 мин. Проверьте размер модели — потом решайте: M4, M5 или продление аренды.