我叫苏砚,某家头部互联网公司的算法工程总监,带着一支一百多人的团队,被外界简单归类成那群“在办公室里制造人工智能”的人。

外面看,我们仿佛每天在“创造未来”;里面看,我们更像在给一个极度挑剔的孩子喂食:你喂的数据不干净,它当天就给你闹情绪;你给的算力不够,它立刻变得“又笨又慢”;你不设好边界,它可能一边回答用户问题,一边“乱讲”。这篇文章,想给你看的不是神话,而是我日常在做的、和“制造人工智能”真正相关的决策、权衡和坑。

如果你是企业决策者、产品负责人、技术管理者,或者准备入行的人,这篇文字会尽量把我们在一线做的事拆开,让你知道:要落地一个真的能用的“人工智能”,你到底要准备什么、担心什么,以及该如何少踩一些昂贵的坑。

“制造人工智能”到底在制造什么?

外界常问我:“你们公司现在到底是在制造人工智能,还是在堆一些会说话的玩具?”

先把定义说清,不然所有讨论都漂在空中。

从我在行业里的经验,所谓“制造人工智能”,在工程层面更多是在制造三个东西的组合:模型、数据、场景。

  • 模型,是那堆看起来高大上的“Transformer、LLM、多模态架构”,本质是一张复杂函数。
  • 数据,是喂给这个函数的“世界”,决定它能理解什么、习惯什么、误解什么。
  • 场景,是你让它活在哪儿:客服?编程助手?工业质检?医学影像?不同场景对“聪明”的定义完全不同。

2026 年,各大公开报告给出的趋势都非常一致:

  • 参数规模已经不再是唯一核心,比如 OpenAI、Google、国内多家机构都在更强调“效率”和“对齐”;
  • 行业数据更重要,例如金融、医疗、制造业公司在内部搭建的“行业私有模型”,在垂直任务上明显优于通用大模型;
  • 以我自己的感受,现在的竞争,从“谁的模型更大”转向“谁更能把模型精细地塞进一个业务场景里”。

当有人说他们在“制造人工智能”,你可以追问一句:

制造人工智能:一个算法工程总监的真实生存指南

你是在制造一个“能活在业务里的大脑”,还是只是在做一个看上去聪明的 demo?答案往往决定这个项目一年后是还在迭代,还是已经悄悄下线。

决策者最关心的那三个残酷问题

我跟企业客户聊“制造人工智能”项目时,发现无论行业差异多大,最后都会落在三个问题上:

  1. 要花多少钱,值不值?
  2. 安全、合规会不会出事?
  3. 真的能替代/增强人,而不是增加麻烦?

先说投入。2026 年,如果你要从零做一个具备实用能力的专属模型,不算极端规模,粗略预算常见是这样的感受:

  • 一次像样的数据清洗+标注,动辄几百万起步,大量人工和工具协同。
  • 模型训练,如果用主流云厂商的 GPU 集群,即便是中型项目,算力账单到上线时有很大概率来到千万级别。
  • 期间还会夹杂着各种隐形开销:数据安全体系、审计系统、评测平台、中台服务等等。

于是很多老板问我:“既然通用大模型已经那么强了,我是不是只要买 API,用 prompt 堆一堆就行?”

这一点上,我的观点比较稳定:如果你的业务没有特别强的专业性和合规要求,API+精心设计的业务层,往往是更划算的选择。把钱投在“拼装”和“治理”上,比一头扎进从零训练模型,更现实。

但只要涉及金融风控、医疗诊断、政企业务、核心工业控制等高风险场景,我会有点保守:

  • 通用大模型往往训练于开放网络数据,对你的行业规则不敏感;
  • 合规审计要有足够的可控性,模型可解释、数据来源可追踪;
  • 一旦出现“幻觉”或违规输出,处罚、舆情和用户信任损失是很难量化的。

所以制造人工智能的关键决策之一,是清醒地界定:哪些能力可以托管给通用大模型,哪些必须握在自己手里。这一步如果糊涂,后面都在补漏洞。

数据,不是“越多越好”,而是“越像你的业务越好”

很多人以为我们在内部开会时讨论的是“要不要上 10 万张卡训练一个巨无霸模型”。过去一年我花在“数据”上的时间,远比在“模型结构”上的多。

让模型真正“像你的人”,常常靠的是数据的“气质匹配”。

举个我们内部做客服机器人的真实经历:

  • 公司最早直接用通用大模型接在客服入口上,效果一开始惊艳:用户各种问,它都能接住;
  • 三个月后,投诉开始出现:
    • 有的回答“过于热情”,给用户承诺了业务上根本做不到的方案;
    • 有的在不确定时,把 B 方案当成 A 方案来讲;
    • 偶发“自创政策”,声称系统已支持某个功能,结果造成批量误导。

我们回溯数据才发现:

  • 通用网络数据中的客服话术以“安抚+承诺”为主,偏“讨好型”;
  • 我们真实业务里,对于金融合规、风控等环节更强调“清晰边界和风险提示”,偏“谨慎型”。

于是我们重做了一件看似无聊但极耗时的事情:

  • 从真实客服记录中筛选出高满意度对话,做成高质量语料库;
  • 对敏感问题、边界场景、投诉场景做了专项标注;
  • 把这套“业务气质”通过微调和对齐训练,强行灌输给模型。

再上线,事故率明显下降。用户不一定觉得“更聪明”,但明显“更像我们自己的客服”。制造人工智能时,最容易被低估的,是这种气质、价值观层面的对齐,而不是参数量。

2026 年,行业里不少公司已经开始把“对齐团队”当成必备职能:

  • 有做安全审查的;
  • 有专门负责“语气风格”的;
  • 有负责伦理问题和偏见检测的;这些人不需要会写模型代码,却在根本上决定了你制造出来的“人工智能”,到底是一个什么性格的“同事”。
模型不是孤岛,它要嵌进一整套系统里活着

很多管理者会误以为:“我买了某个大厂的大模型能力,接个 SDK,就算完成了智能化。”

从工程的角度看,模型只是一个“核”,不搭配周边系统,它活不过试运营阶段。

例如现在常见的企业级“制造人工智能”项目,通常还需要一堆基础设施:

  • 知识库|用于存储企业内部文档、政策、FAQ,配合检索增强(RAG)让模型“说话有依据”;
  • 日志与审计系统|记录每一次模型调用的输入输出,方便追责与定位问题;
  • 模型评测平台|定期用一批固定测试集跑,监控能力是否退化、是否引入新的偏差;
  • 权限与脱敏体系|控制谁能访问什么数据,哪些字段必须做脱敏;
  • 人机协同流程|比如客服场景中,当模型置信度低于阈值时,自动转人工接管。

从 2026 年我在项目里的实际观察,那些被夸为“智能转型做得好”的公司,有一个共同点:他们管理层已经不再把“模型”当成一个单一产品,而是当成整个业务系统中的一个“新角色”。这个角色需要考核、需要监管、需要培训,也需要和人类协作。

当别人问你:“你们公司有没有在制造人工智能?”你可以反问自己:

  • 你有能力在生产环境里持续监控它的表现吗?
  • 你有机制在它犯错时,快速止损并更新它的“认知”吗?如果没有,那你拥有的更像是一个随时可能被关掉的 demo,而不是一个真正融入组织的“智能同事”。
那些被夸大的“替代人类”,和真正发生的职位变形

站在一线,我很少再用“取代”这个词。更常见的,是岗位内部的“拆解和重组”。

以我们团队为例,2026 年的变化非常明显:

  • 传统“纯算法工程师”减少,更多人需要先懂业务再做算法规划;
  • 标注岗位发生变化,一部分转向做“数据策展人”,负责从海量数据中挑选、设计和维护高价值样本;
  • 客服团队中出现了“机器人教练”角色,专门通过监控机器人对话、标记问题、写提示词和策略,来“训人+训机”。

对外部企业来说也是类似的故事。一个典型的客服中心改造案例里,我们测算过:

  • 引入大模型辅助后,简单问题由模型直答,人类专注复杂和情绪问题;
  • 运营半年后,客服总人数下降并不夸张,更多是岗位技能结构改变;
  • 客服被要求具备使用内部 AI 工具、调试话术和反馈模型问题的能力。

也就是说,制造人工智能本身并不会简单砍掉一个岗位,而是改变这个岗位的工作内容和能力要求。

如果你是个人从业者,我会更建议你这样看这个变化:

  • 问问自己:我的工作里,哪些环节是高度重复、可以被模式化的?
  • 把这些环节“交出去”,而在人的注意力上,转向更难标准化的部分:沟通、判断、博弈、选择。

从我们内部的实践来看,真正被边缘化的,是抵触使用工具、拒绝学习新协作方式的人,而不是某个传统岗位的名称本身。

想在企业里“制造人工智能”,可以少走的几条弯路

聊到这,你可能已经有点画像:如果你准备在企业里推进一个“制造人工智能”的项目,应该从哪走起,才不至于把预算烧在不必要的炫技上。

我把这些年踩过的坑压缩成几条经验,更偏“生存指南”而不是教科书步骤:

一,不要一上来就问要用哪个模型,先问:你能承担多大失败成本。

  • 高风险场景(医疗诊断、金融决策等)更适合从小闭环、灰度环境做起,用人监督;
  • 低风险场景(内部知识问答、办公自动化)可以更大胆,用通用模型试错,再逐步专门化。

二,不迷信“最新”,迷信“可控”和“可维护”。每年都会有更大的模型、更炫的能力出现,这是行业常态。但企业系统一旦上线,稳定演化比追最前沿更关键:

  • 有没有能长期维护的团队;
  • 模型切换、升级时会不会引发大量兼容性问题;
  • 供应商是否能和你的安全体系、运维体系打通。

三,提前把“失败”的出口设计好。这点说得现实一点:

  • 项目做不下去时,哪些组件是可以沉淀复用的(数据、工具链、知识库);
  • 哪些采购能转向其他用途(算力、平台服务);
  • 哪些指标能说服公司:“这次试验虽然没有达到最初雄心,但产生了可观的中间价值”。

我见过太多项目,技术上其实不算惨烈,但由于没有被设计成一个“可被总结、可被拆解复用”的工程试验,最后被整体贴上“失败”的标签,导致几年内没人敢再动这个方向。

而真正成熟的组织,会把“制造人工智能”当成一个持续增长的能力,而不是一次性赌注。

站在 2026 年,我们离“真正的人工智能”还有多远?

从业十年,我对“通用人工智能”这种宏大概念的兴趣越来越淡,对“让一个具体场景更聪明一点”的兴趣越来越浓。

2026 年的现实是这样的:

  • 在多轮对话、文案创作、代码辅助等领域,大模型已经达到“高位均衡”:边际提升变贵,但业务价值仍然可观;
  • 多模态能力(图像、文本、语音融合)开始扎实落地在制造质检、医学影像辅助评估等场景里,效果比很多人想象的更务实;
  • 监管和伦理讨论越来越细致,尤其是在欧盟、东亚等地区,这直接影响“你能做什么、多久上线”。

站在我这个一线“制造人工智能”的人的视角,反而更清晰了一点:

我们并没有在制造一个神,而是在一点点制造可以合作的“工具人格”。

它可以帮你写代码、撰写报告、审查合同、分析数据,但它不是决策者。它像一个始终在线、反应极快但有时会固执的同事,需要你给清楚边界,也需要你愿意在它犯错时教它一遍。

如果你打算在自己的公司、团队或职业生涯里,认真地踏进“制造人工智能”这件事,也许可以先记住三句话:

  • 不要被神话吓住,行业内的人每天也在被 bug 和数据折磨;
  • 不要只盯着技术名词,真正决定成败的是你想解决的业务问题;
  • 不要把它当敌人,也不要当救世主,把它当成一个有潜力但还不成熟的同事,培养它、利用它,也管住它。

这,大概就是我这几年在一线“制造人工智能”的全部底色。