端侧ML工程师: 软件工程师的新疆域
一览这个职业
来源与参考 (8)
- https://www.indeed.com/hire/job-description/software-engineer
- https://www.aha.io/roadmapping/guide/agile-development/what-is-the-role-of-a-software-engineer
- https://jessup.edu/blog/engineering-technology/what-do-software-engineers-do-on-a-daily-basis/
- https://www.computerscience.org/careers/software-engineer/
- https://www.mtu.edu/cs/undergraduate/software/what/
- https://www.bls.gov/ooh/computer-and-information-technology/software-developers.htm
- https://www.baesystems.com/en-us/who-we-are/electronic-systems/engineering-careers/software-engineering
- https://www.snhu.edu/about-us/newsroom/stem/what-does-a-software-engineer-do
为什么这个领域重要
几年前,推理还是GPU服务器的活儿。到了2026年,默认值正在向设备端迁移。llama.cpp与GGUF格式让本地跑LLM变得简单。Q4量化把模型压到FP16大小的约四分之一,于是7B模型能装进4GB内存,而几乎每个新的开源权重发布后数小时内就会出现对应的GGUF版本。手机上也一样。Meta的MobileLLM 125M在iPhone上每秒约出50个token,Llama 3.2的1B与3B、Gemma 3从270M起、Qwen2.5的0.5B与1.5B等小模型都以4比特量化在真机上运行。端侧解码每个token不到20ms,而云端往返要200到500ms。语音也是同样的结构。参数82M、权重约327MB的开源TTS模型Kokoro,在包括Apple Silicon的普通CPU上跑得比实时还快,登上TTS Arena榜首,许可证是Apache 2.0。
这为何变成招聘,是因为三条商业动机叠在一起。第一是隐私。数据不离开设备就无法被泄露,没有服务器日志、没有数据驻留问题、没有被攻破的面。随着GDPR执法趋严、美国州级隐私法激增、Apple的追踪限制落地,「把用户数据送到服务器做AI处理」成了可度量地更差的默认做法,而端侧推理从一开始就不触碰这些法规。第二是成本。云端推理按请求计费,而把推理推到用户已经拥有的硬件上,流量增长也不会抬高推理账单。第三是延迟与离线。实时翻译和AR这类需要即答的功能扛不住网络往返,能离线工作的功能则是硬差异化点。在BAT这样的大厂,ML平台团队正单独开出端侧的方向,隐私敏感的医疗与金融科技公司会优先招这项技能。
所需技能
这个职务处在ML系统知识与原生、移动工程重叠的狭窄山谷里,两边都得懂。第一,量化。INT8与INT4是入门,你要在llama.cpp支持的从1.5比特到8比特的整数量化里做取舍。降到4比特能把内存砍到四分之一,但精度在哪里崩、哪些任务4比特够用、哪些需要8比特,都靠实测得知。把「训练用16比特、部署用4比特」为何成为行业标准吃透,是出发点。
第二,运行时与后端。LLM选llama.cpp与ggml,iOS和Apple Silicon用Core ML,Android用TFLite,跨平台用ONNX Runtime。核心是在真机上基准测试过,同一个模型在给定任务下哪个后端更快。移动端内存带宽为每秒50到90GB,而数据中心是2到3TB,差距在30倍以上,即便高端手机可用RAM也不到4GB,于是热降频与电池都成了变量。你还要跟进像Qualcomm MX与ARM SME这类把Transformer推理装进CPU的指令扩展。实际上有个0.8B模型在骁龙7 Gen 1上完全离线跑完五阶段流水线,约60秒完成。若目标是浏览器,就叠上WebGPU与Transformers.js,一行device: 'webgpu'便能开出比WASM快最多100倍的路径。
第三,部署与优化。如何把几百MB的权重送到设备、端侧缓存、内存预算、冷启动与回退,以及为保护模型而用的TEE,都在职责之内。正如Kokoro所示,一个选得好的小模型在CPU上也能胜过云端API,所以真正的武器是把小模型贴着设备磨快,而不是把重模型做大。
职业路径
入口通常有两条。ML工程师往设备部署深入,或者移动、系统工程师补上推理。无论哪条,第一关是一样的:挑一个公开的量化模型,放到真机手机或笔记本上跑,亲手测延迟、内存与电池,再写成文。有这样一个项目,作为初级作品集就足够显眼。到了中高级阶段,在真实产品里跑过端侧推理的履历就是武器。「不把敏感数据送服务器、在设备上处理,消除了合规风险」「把推理搬到设备,月度GPU账单降了X%」这类成果能直接换成谈判筹码。
调过量化损失、选过后端、设计过模型下发与离线回退的经验,把这一档拉开。再往上开出两个方向。一是端侧AI平台架构师,负责全公司的设备推理标准与模型下发流水线。二是直接为llama.cpp、Core ML工具链这类开源生态贡献,攒下名声。这是个人才池还薄的新领域,现在进来并做出参考案例的人,未来几年很可能凭稀缺性得到回报。