我是岑砚,一个在算法架构岗位上熬过十年、见证过三轮“智能浪潮”的底层工程师。工作名片上写得好听:Chief AI Architect,真正的日常则更接地气——处理崩掉的训练任务、安抚被模型“气到”的产品经理,还要向老板解释:“是的,它叫大模型,但不等于万能模型。”
很多人最近被“制造人工智能”这个词包围了:大模型、智能体、AGI、深度学习、算力竞赛……信息多到让人焦虑,却又感觉自己没真的摸到门道。这篇文章,我想做一件简单的事:站在一个行业内部从业者的角度,把“制造人工智能”这件事拆开讲清楚——到底在干什么、需要什么、能做到哪、做不好会踩什么坑。
不是给你灌鸡汤,也不是给你讲玄学,而是:如果你真打算下场,要有一个相对清醒、可操作的认知。
在公司里,只要有人说要“搞个智能”,我第一反应一定是反问:“你说的是哪一种智能?”
现在“人工智能”这个词被严重滥用,从内部视角看,大致可以粗暴地拆成三层:
- 解决单一任务的小模型
- 比如:垃圾邮件分类、图片里识别猫狗、为客服做意图识别
- 典型技术:传统机器学习 + 小型神经网络
- 需要的数据量:从几千到几十万级样本
- 适合的场景:有一个明确任务、业务可控、预算有限
- 大模型与多模态系统
- 比如:ChatGPT类对话模型、能看图写文案的模型、能写代码的模型
- 典型技术:大规模预训练语言模型(LLM)、多模态模型
- 数据量:动辄万亿 token,外加图像/音频数据
- 计算成本:2025–2026 年,训练一个 1000 亿参数级别的模型,常见估算是 2000–6000 万美元的算力成本(视精调策略和硬件价格波动而定)
- 更长期的通用智能探索
- 比如:能跨任务迁移、能长期规划的智能体系统
- 核心玩法:模型 + 工具调用 + 记忆 + 环境交互
- 现在更多还在探索阶段,落地时往往是“多模型+工作流”的工程组合
对普通企业、创业团队乃至想入行的个人来说,“制造人工智能”的真正决策,从来不是“我想搞 AI 吗”,而是:
我是要造一个能帮我解决具体问题的“模型产品”,
还是要参与到底层通用模型的竞赛?
这两件事的投入、门槛和回报完全不在一个量级。
外面看到的是模型参数、发布会、炫酷 Demo,内部最明显的感受只有四个字:钱、算力、人、数据。
钱:模型体量越大,烧钱速度越像在倒水根据 2026 年公开的多家机构测算与财报数据(包括英伟达、几家云厂商和开源社区的估算),大致可以勾勒出一条现实曲线:
- 10 亿参数级模型:
- 训练成本可以压到几十万到一两百万人民币
- 对中小公司可接受
- 100 亿参数级:
- 若从零训练,算力 + 存储 + 网络成本加起来往往是千万级
- 很多公司会选择在公开预训练模型上做精调
- 1000 亿参数级:
- 真正能从零训练的,大多是头部科技公司或巨头实验室
- 单次训练成本到了“失败几次就影响年度预算”的程度
这就是为什么你看到的现实是:大模型圈里,“从零造轮子”是极少数,绝大多数是在现有轮子上改装。
算力:GPU不再只是显卡,是一种“货币”
到了 2026 年,行业内部最常见的吐槽是:“GPU 比人难招。”
- 英伟达 H100 / B100 级别的高端卡,依然是很多大模型训练的主力
- 一些新兴算力芯片厂商也在切入,但生态和工具链还在补课
- 对很多团队来说,“能拿到稳定云算力”本身就是护城河
你可能会问:那我不做那么大的模型,算力压力会小很多吗?是,会小不少,但也有现实门槛:
- 就算是做一个中等规模的行业模型,日常训练 + 推理,也需要稳定的 GPU 集群
- 控制不了算力成本,很难做到持续迭代
- 训练中断、排队资源、显存不够这些问题,会极大拖慢交付节奏
内部真实感受是:技术路线讨论得再热闹,落地阶段 30% 的问题都和算力调度有关。
人:懂业务、懂工程、懂模型的复合型人才极其稀缺2026 年的人才市场,一个很明显的现象是:
- 单纯会调包、堆模型的人越来越多
- 能从业务目标出发设计数据、设计评估指标的人,依然非常稀缺
企业在“制造人工智能”的过程中,往往会踩这两个坑:
- 过度依赖少数“明星工程师”:
- 某个大牛走了,整个智能项目就半瘫痪
- 忽视数据工程和评估工程岗位:
- 以为请几个算法工程师就行,结果项目质量难以上一个台阶
一句不那么好听但很真实的话:大部分失败的 AI 项目,不是死在模型,而是死在人和组织上。
数据:不是“有很多”,而是“有用、可用、用得起”数据的四个维度,在内部经常被反复讨论:
- 质量:标注是否一致?有没有系统偏差?
- 覆盖度:真实业务中的长尾情况,是否在数据中出现过?
- 合规:是否涉及隐私?跨境数据有没有政策风险?
- 成本:清洗、标注、存储、访问,这些都是持续支出
2025–2026 年,许多国家都在完善数据合规和模型治理的法规。这意味着:你能不能用某些数据来“制造人工智能”,不只是技术问题,更是法律问题。
行业内部看久了,会有一个共识:与其一上来就幻想“造出下一个通用大模型”,不如先把一个小而清晰的智能场景做透。
假设你是一个中型企业的技术负责人,或者一个对人工智能认真感兴趣的开发者,下面这个路径,是我们内部常给初创团队的建议,做了一点简化:
第一步:把问题压缩到一句清晰的话不是“我要做一个智能客服”,而是类似这种级别的描述:
“把我们 70% 重复、标准化的客服问题自动化处理掉,要求准确率达到 90% 以上,出错率不能比人工高。”
这句话里要包含:
- 可衡量目标(比如 70%、90%)
- 对错误的容忍度
- 和当前人工方案的对标
没有这一步,后面所有的“制造”都是瞎忙。
第二步:用现成大模型当“大脑”,先搭一个粗糙但能用的版本2026 年,开源和商用大模型的生态已经非常丰富:
- 开源侧:LLaMA3、Qwen、Gemma、Mistral 等系列在持续更新
- 商用 API:OpenAI、Google、Anthropic 加上本土头部厂商,都有完整的 API 生态
- 很多平台提供“免训练”的智能体搭建功能,可以让模型调用工具、连接知识库
内部真实策略往往是:
- 用商用大模型 + 自家数据,快速做一个 MVP(最小可用版本)
- 把真正有价值的业务数据收集起来
- 再判断是否需要自己维护模型、做精调,甚至自建模型
这种方式的好处:
- 大幅降低前期试错成本
- 可以用真实用户反馈来校正方向
- 方便你向公司解释 ROI(投入产出)
第三步:从“会用”到“敢改”,引入精调和工具编排当你跑通了最初的版本,问题通常会变成:
- 模型很聪明,但不稳定
- 业务知识更新之后,模型反应慢
- 不同用户、不同场景的表现差异大
行业内常见的升级手法,会围绕这几个方向展开:
数据增强与向量检索(RAG)
- 用向量数据库存业务知识(文档、历史记录、FAQ 等)
- 模型回答问题时,先检索相关知识,再生成回答
- 这样可以减少“瞎编”,保证内容更贴近你公司的实际
指令精调 / 轻量精调(LoRA 等)
- 在开源模型上用你的业务数据做小规模精调
- 训练成本可以控制在几万到几十万级别
- 对中小团队来说,比从零训练可控得多
工具调用与工作流编排
- 让模型不仅“说话”,还可以调取系统 API、调用外部工具
- 例如:查订单、改地址、触发报表生成等
- 这部分更偏工程,要有一个靠谱的后端团队配合
做到这里,你就不再只是“调用一个智能接口”,而是开始真正意义上的——制造属于你自己业务的智能系统。
从我们看到的行业项目来看,“制造人工智能”在 2025–2026 年有几个明显聚焦点:
1.行业模型:大脑通用,习惯各有各的
大型通用模型已经足够成熟,反而让“行业模型”变得更现实。
常见需求包括:
- 医疗:辅助阅片、病案结构化、用自然语言查询病历
- 金融:智能风控、投顾助手、复杂合同比对
- 制造:设备异常预测、工艺参数优化、生产过程问答
这类项目的特点是:
- 不一定要做参数特别大的模型
- 必须深度理解行业语境和规则
- 安全性和合规要求甚至比准确率更重要
很多时候我们说的“制造人工智能”,本质是在做:行业知识 + 通用模型 + 安全边界 的组合工程。
2.智能体:从单轮回答,走向能执行任务
到 2026 年,“AI Agent(智能体)”已经不再是新词,落地形态比两年前成熟很多:
- 在客服里:可以主动追问、补充信息,而不是被动问答
- 在办公场景:帮你整理邮件、安排日程、拉取数据、自动写会议纪要
- 在开发协作中:能参与代码 Review,发起自动测试任务
行业内部的共识是:真正的智能感受,往往不是来自模型的“说得多像人”,而是来自“它帮我少干多少重复的事”。
3.内部知识与流程的智能化改造
许多公司现在做的,并不是一个“对外的智能产品”,而是对内部流程做大规模的智能化改造:
- 把所有业务文档、规范、流程、会议记录接入一个企业级大模型系统
- 员工用自然语言就能查询、生成、对比、总结
- 新人入职培训时间缩短,跨部门协作效率提升
这类项目的效果,往往不会出现在对外发布会上,但对公司内部的生产力提升非常直接。从内部视角看,这种“看不太出风口味道”的项目,往往更稳定、更持久。
说了这么多“怎么做”,也得坦白说说“怎么别做”,这些是我这几年见到频率几乎快刷屏的坑:
把“制造人工智能”当成一场一次性的采购很多公司会用“上一个 AI 项目”的思路来推进:
- 买一套系统
- 做一轮集成
- 开发布会
- 项目结束
结果半年后,业务变化了、数据变了、用户习惯变了,但系统还停在原地。内部大家都明白,这是一种对智能系统的误解:
模型不是一次性买断的产品,更像是一个需要持续喂养和训练的“活系统”。
如果公司没有心理准备把这件事当作长期能力来建设,不如从一开始就缩小范围,做一些“小而确定的智能改造”,反而更划算。
迷信参数规模,忽视场景契合度“参数越多越好用”的时代早就过去了。2025–2026 年很多对比测试都显示:
- 对某些聚焦场景,经过精调的中等规模模型 + 好的数据可能比盲目接一个超大模型效果还好
- 成本却低得多,响应速度更快
所以行业内部现在更关注的问题是:
- 你要解决的问题,到底需要多大的模型?
- 有没有更轻的方式达到“足够好”的效果?
- 延迟、成本、合规,你最在意哪一个?
忽略评估体系,用“感觉”判断智能这点在实际项目里非常常见:
- Demo 很惊艳,大家都觉得“好厉害”
- 真正上线后才发现:在关键指标上,比原本流程还差
更健康的做法,是在一开始就设定清晰的评估维度:
- 客观指标:准确率、召回率、错误率、响应时间、任务完成率
- 主观指标:用户满意度、客服/运营的主观评价
- 风险指标:是否出现不该出现的内容、是否有合规风险
内部很多做得好的团队,会专门配一个“评估工程”小组,来设计和维护这些指标。这比多招几个调参工程师要值钱得多。
站在 2026 年回头看,行业这几年的变化,有一个很强烈的感受:
人工智能慢慢从一个“独立的高科技项目”,变成了一种基础能力。
就像当年的互联网、移动应用一样——起初大家会专门搞一个“互联网项目组”、“APP 项目组”,后来逐渐融入了所有业务。
“制造人工智能”,如果你把它理解成:我要造一个惊艳全世界的超级模型,那这条路会非常窄,竞争也异常残酷。
但如果你把它理解成:
我要让我的业务、我的产品、我的日常工作从此拥有一层可持续进化的“智能能力”。
那事情会变得清晰很多:
- 不一定要从零造模型,可以从会用开始,逐步深入
- 不一定要大而全,可以抓一个真实的痛点,认真解决
- 不一定要赌未来十年的一次成功,而是通过不断的小步迭代,让自己站在浪潮里,而不是浪潮外
从我这个长期泡在一线的工程师视角看,“制造人工智能”最值得期待的地方,不只是技术,而是它逼着我们反复问自己:
- 我们真正想解决的问题是什么?
- 哪些工作应该交给机器,哪些创造力仍然握在自己手里?
- 面对一个会越来越聪明的世界,人类的价值要落在哪里?
如果这篇文章能让你在动手之前,多问自己几遍这些问题,那它就完成了我写它时的全部目的。
