今天所有的差异,都是几次关键选择累积的结果。看懂选择,才能看懂结果。
芯片的动态功耗近似为 P ∝ C × V² × f(电容 × 电压平方 × 频率)。关键在于,频率要往上走,电压也得跟着抬高——所以频率和功耗是超线性关系。跑 5.0GHz 和跑 3.0GHz 的功耗差距,远不止 1.7 倍。
苹果从 iPhone 时代就在做"低功耗优先"的芯片,2020 年把这套芯片整个搬进了 Mac。
| 机型(同为 Mac mini 产品线) | 待机 | 满载 |
|---|---|---|
| Mac mini (2024) M4 · 16GB | 4 W | 65 W |
| Mac mini (2024) M4 Pro · 64GB | 5 W | 140 W |
| Mac mini (2023) M2 · 24GB | 7 W | 50 W |
| Mac mini (M1, 2020) · 16GB | 6.8 W | 39 W |
| Mac mini (2018) Intel 六核 i7 3.2GHz | 19.9 W | 122 W |
同一条产品线,Intel 时代满载 122W,M4 是 65W。这不是"系统优化"能解释的差距,是芯片代际的差距。
Mac mini M4 的实测噪音阶梯(第三方实验室,15cm 距离测量):
| 状态 | 风扇转速 | 噪音 | 体感 |
|---|---|---|---|
| 待机 | 1000 RPM | 24.1 dB(A) | 等同于环境底噪,听不见 |
| 游戏负载 | 约 1250 RPM | 24.9 dB(A) | 勉强可闻 |
| CPU 满载 | 约 1800 RPM | 30.3 dB(A) | 耳语级 |
| 压力测试峰值 | 2950 RPM | 45.1 dB(A) | 安静房间内明显可闻 |
| 物理上限(需手动触发) | 4900 RPM | 59.4 dB(A) | 很吵 |
一台高性能 Windows 台式机的热量来源:
几百瓦的热量塞进一个机箱,除了大风量主动散热,物理上没有别的办法。
共同的父亲是 Darwin。XNU 内核 = Mach 微内核(进程、内存、进程间通信)+ BSD 层(POSIX 接口、网络、文件系统)+ IOKit(驱动)。XNU 是 "X is Not Unix" 的递归缩写。macOS 是通过 The Open Group UNIX 03 认证的正式 UNIX。
| macOS | iOS | |
|---|---|---|
| 界面 | Aqua:窗口、鼠标、多任务 | SpringBoard:触屏、前台单任务 |
| 权限 | 可访问底层 UNIX API,可 root,可安装任意来源应用 | 应用不能访问底层,无 root,只能访问自己的沙盒目录 |
| 分发 | 任意渠道 | App Store 强制(越狱除外) |
| 内核源码 | XNU 开源 | 不开源 |
| 内存管理 | 有交换空间,策略宽松 | 几乎无交换空间,策略严格 |
Windows NT 从 1993 年第一版起的设计目标就是跨硬件可移植:x86、MIPS、DEC Alpha、PowerPC、Itanium,后来加 ARM64。为此整个内核用 C/C++ 写,硬件差异全部下放到硬件抽象层(HAL)。
同时它必须背负向后兼容:
这套包袱换来了什么:任何厂商做一台 x86 机器,装 Windows 就能用;几十年前的软件今天大概率还能跑。这是人类历史上规模最大的兼容性工程之一。
代价是什么:微软无法像苹果那样,为降低 20W 功耗就重新定义整个软硬件接口。它改动任何一层,都要考虑全球几十亿台设备和无数第三方驱动。
大模型推理的核心约束,往往不是算力,是"模型能不能完整装进显存"。
token 生成速度主要由内存带宽决定,所以带宽直接等于可用推理速度。第三方整理的参考值:M4 Pro 约 273 GB/s,M4 Max 约 546 GB/s,M4 Ultra 约 800 GB/s。
Agent(能自主执行任务的 AI)跟聊天机器人不一样:它不等你下指令,它在后台一直跑。这对硬件提出了全新的要求。
| 需求 | 传统高性能台式机 | Mac mini M4 |
|---|---|---|
| 7×24 开机 | 待机 60–100W 是常态 | 官方标称待机 4W |
| 安静 | 风扇常转 | 待机噪音 = 环境底噪 |
| 体积 | 机箱占地方 | 机顶盒大小 |
| 免维护 | 灰尘、硅脂、水冷 | 无维护项 |
这个成本让"一直开着"从奢侈变成默认选项。
内存容量直接决定你能跑多大的模型,这是硬约束,其他都是软的。
| 统一内存 | 能跑什么 | 参考速度 | 适合谁 |
|---|---|---|---|
| 16 GB | 7B Q4 | 约 40 tok/s | 轻量助手、简单编码 |
| 24 GB | 13B Q4 / 7B fp16 | 约 55 tok/s | 开发者的甜蜜点 |
| 64 GB | 70B Q4 / 32B 舒适 | 约 25 tok/s(70B) | 重度 RAG、Agent 流水线 |
别忘了留余量:系统本身要占内存,浏览器开几十个标签能吃掉 4–8GB。16GB 的机器实际能给模型的只有 12GB 左右。一旦触发 swap(内存换出到磁盘),速度是断崖式下跌,不是线性变慢。
推荐策略:Ollama 和 MLX 并行装、分工用——前者当日常 API 服务,后者干重活和基准测试。
本文所有具体数字均标注来源。分级标准:强 = 官方或实验室实测且有第二来源印证;中 = 技术文档或百科类,可信但未独立复核;弱 = 单一来源,已在正文标注。
阅读量按「同一访客每天计一次」统计,点赞存在你的浏览器里。