全部文章

会什么正在被抹平,招人改看素质和态度

会什么正在被 AI 抹平,所以我改看素质和态度:社招让他讲一次跑通的闭环,讲到下一次怎么更好;校招看聪明和听懂陌生问题的速度。附我怎么问,和我框错过的一条准入线。

手绘:面试桌两侧各坐一人,左边一叠简历上的全栈被划掉,中间是个人工作流、产品、行业三站连成的循环箭头,写着下一次更好,右边的人头顶问号,标着听懂陌生问题

面试刚结束,会议工具比我先出结论:人岗匹配度 85 分,建议录用。

这个分我没用。同一份转写里,ReAct 被写成了前端框架 React,几个工具名也认岔了。它读的是这样一份稿子,又说不出 85 分是怎么算出来的。

那是 2026 年 8 月,坐我对面的是一位做行业 Agent 交付的资深全栈,这里叫他老周。我最后用来下判断的,是他讲的一件事:他做的那个 Agent 换过三次架构,每一次是被什么问题逼出来的。

AI 时代招人,看的是素质和态度,不是他现在会什么。 会什么正在被模型抹平;素质和态度抹不平。社招和校招只是落点不同:社招落到他跑通过哪种能迭代的闭环,校招落到聪明和对陌生问题的理解速度。

我在带一个做 AI Agent 交付的小团队,社招在面,校招生也在带。2026 年 9 月 15 日早上,我把招人的想法口述了一遍。这篇是那段口述,加上 8 月以来面试笔记里攒下的做法。只谈要用 AI 交付结果的工程和产品岗。

会什么,正在一样一样被抹平

面试是在有限的时间里找信号。这几年好几个老信号在变弱,各有各的原因,得分开说。

先没用的是能被模型直接顶掉的那两类。 一类是带回家的题:Anthropic 工程博客 2026 年 1 月发文说,他们的带回家技术测评先是 Claude Opus 4 超过了大多数候选人,后来 Opus 4.5 连最强的候选人也追平,只好换成新颖的谜题。另一类是产出量:代码生成变便宜以后,提交数、代码行数只能说明他在忙,说明不了做得好。

简历上的技能栈跟着一起贬值。人人都写全栈,前端、后端、模型、部署列满一页。有模型顶着,往下再多写两行不难。我这边收到的简历,这一栏已经分不出人。

年限是另一回事,它本来就不太说明问题,和 AI 无关。Sackett 等人 2022 年重新估算了各种选人方法的效度,工作年限从 .18 降到 .07,结构化面试从 .51 降到 .42,仍排第一。这个下调来自重新估算。

还有一类人最容易被误判:传统互联网里交付经验多、默默钻研技术、很靠谱的那种。这些优点没有失效,只是不保证他在 Agent 这一波找得到发挥的地方。靠谱还是要的,光有靠谱不够。

存量的技能会被抹平,剩下能看的只有素质和态度。 素质是他遇到没做过的事能不能想明白、做出来;态度是他为什么要把这件事做成。这句是我的判断,不是研究结论:被追平的只是限时的测评题,简历那一栏分不出人也只是我手上这些简历。

已有的能力仍然算数,只是换了个位置:端到端把一件事做成过、计算机基础扎实,这类条件是准入线,不成立就做不成事,不过就不用往下看;过了线,决定录不录的才是素质和态度。准入线怎么考、我又怎么把它画错过,后面会专门讲。

先说过线之后看什么。社招有履历可挖,素质和态度各自有落点。

素质看什么:讲一个闭环,讲到下一次怎么更好

我说的闭环,是一件事有头有尾,还能迭代:做完这一轮,下一轮开始时比这一轮做得好。或者在一个范围里,把一件事完整交付出去。

我按大小分三种:

  • 个人工作流的闭环:他自己干活的方式,一轮一轮变顺。
  • 产品的闭环:做出来有人一直在用,用出来的问题回到下一版。
  • 行业的闭环:在一个行业里,把客户的事从一句抱怨做到上线、被持续使用。

三种没有高低。我要的是他讲得出具体的一次:从一句模糊的抱怨,到需求和边界,到实现、上线、被人一直用,还说得清哪一步差点崩。停在 Demo 的不算。

老周讲的是一个行业闭环。他给几家客户做私有化部署的 Agent,一个人在维护。

第一版几乎不用模型,走固定流程。这个选择是他从客户那边推出来的:这类客户不接受结果不对再点一次重试,结果必须确定。后来用户开始多轮追问、只说半句话,固定流程接不住,他换成让模型自己循环调工具。再后来,模型一旦选错工具,后面整条流程全跑偏,第一个字出来还慢。他改成先用小模型判断意图,只给这一类任务装上对应的工具和做法,再进循环。

还有个小动作我印象很深。推荐问题原来是循环里的一个工具,提示词写着结束时调用,可模型有时就是不调。他把它挪出循环,做成一个单独的节点。

每次换架构,他都说得出是被哪件事撞出来的。 这就是素质:他判断得出问题出在哪,也改得动。只报框架名字、讲不出为什么换的,我叫它框架陈列。

要说清楚:闭环这个看法没有研究直接证实,是我自己的框架。上面那份效度重估里排第一的是结构化面试这套方式:同一条主线,同一把尺子,一路追到具体的一次。它支持我把案例追深,不代表闭环就是被验证过的指标。

态度看什么:代表作,和价值驱动从哪天开始

同样的活,有人做完就完了,有人会追着把它做成一件事。差别在态度,我用两个问题去找。

第一个问题是代表作:你做成过的那件事是什么,带来了什么业务结果,产生了什么价值。人人都说自己是全栈,代表作说不了谎。

代表作不一定是自己做成的大项目。我更看重让别人不出错的东西:工具、门禁、模板、评测集。不看年限,看这个。老周以前听大家老抱怨不想维护各自那层接口聚合服务,就把十几个业务的这一层收成一个统一托管、靠配置就能用的引擎。那件事不在 Agent 场景里,但说明他会定标准,不只执行标准。

第二个问题是起点:你从什么时候开始,是冲着一件事的价值去做的。工作一两年的人不一定已经这样,很正常。问这句也不是刁难,不少人是工作几年后的某一刻才转过来的,我自己也是。职级和晋升速度证明不了判断力,判断力要单独考。

态度还要拿事实压一压。数字要能还原:分子、分母、口径、他自己的贡献边界。老周说了一个很漂亮的收入数字,售前、方案、销售各占多少我没问清,就标成不可核,不进判断。倒是他主动说,客户买单的两个主要原因,一个是之前攒下的信任,一个是客户内部的数据,都不算他的技术贡献。他自己把功劳往小里说,这比数字可信。

校招:聪明,和听懂陌生问题的速度

校招生没有代表作可挖,看的还是这两样,只是得换个地方看:素质看聪明和听懂陌生问题的速度,态度看自驱力,看他讲一件事时肯不肯自己往前多走一步。

先说素质这一半。学校背景是一道筛选,我承认用它,但只当初筛,不当结论。Sackett 那篇把认知能力测验的效度从 .51 下修到 .31,不同族群之间的分数差距也大(那篇讨论的是美国黑人与白人群体),有公平代价。聪明要看,不能只看这一道,更不能把学校当成聪明本身。

校招我最看重的,是面对一个陌生场景的需求,他能不能很快 get 到我在说什么。 我会挑一个他没做过、能往深里走的话题,一路问下去。Anthropic 把带回家的题换成新颖谜题,理由也是这个:出的题要模拟没见过的活。他们那篇只说了题该怎么出,没验证过理解速度能预测一个人后来走多远。学生没做过的事最多,所以我拿它当主要信号,这一步是我自己的判断。

再说态度这一半。我拿身边最想一起干活的同事对照:努力、靠谱、有创造力,而我最想弄明白的是他的自驱力从哪来。热情主动可遇不可求,我不打算在一小时里测准它。Levashina 和 Campion 2007 年发现,超过 90% 的本科求职者在面试里有过美化自己的行为(美国的本科求职者样本)。美化不等于编造,但聊得热情,确实说明不了干活主动。主动性我不单独打分,只看他讲一件事时,有没有自己补上下一步。

学生不一定知道自己要什么,也不一定准备了开源项目。这很正常,我不强求,也不因为没有就扣分。

基础照考,AI 让它更要紧

素质里有一块是硬的:计算机基础。这一条社招校招都考,它就是上面说的那条准入线。靠 AI 学一样新东西,这块最容易学得空。Anthropic 2026 年 1 月发布了一个52 人的随机对照,以初级工程师为主,学的是一个陌生的 Python 库:用 AI 帮忙的一组事后测验平均 50%,手写的一组 67%,差距最大的是调试题。它测的是学完之后的短期掌握,说明不了所有人的基础都在变空,用 AI 时自己主动去弄懂的人也不一定这样。

所以我照考:不预告,问一个他很久没碰过的基础问题,看他能不能当场归纳、抽象出来,很快答上。背下来的标准答案我不看。这道题是我自己的考法,没有研究说这么考就准。它是准入线,不是加分项:答不上来,后面的闭环讲得再好也不用往下走。

面试里我怎么问

面前我只准备一条主线,再带三句随身追问:

  1. 给我那一次具体的。
  2. 你怎么知道它是对的?
  3. 我复述一遍,你看对不对。

追问也有代价。Levashina 那篇还发现,追问会让人美化得更多。所以追出来的故事,最后要落回能核的东西上:数字、口径、哪一步是他自己做的。

主线里固定有一问:系统坏了但没报错,发生过吗?报错的故障好办,坏了没人知道的才可怕。我想听他怎么发现的、后来加了什么。

面的时候不打分、不查表。判断挪到面完,对着逐字稿写。开头那个 85 分,就是这么被放下的。

交底放全场最后。老周那场,我在面试最后讲了我们在做什么、我怎么看 AI 原生的工作方式。讲完再问同类问题,拿到的只能是他刚听来的答案。所以交底之后,我不再问认知类的题。

候选人面试时能不能用 AI,各家规定不一样,我不站队,只看他怎么验证 AI 给的东西。 会不会用是技能,验不验得出来是素质。老周说 AI 生成的代码很难逐行看,他就用一份中间文档去核对 AI 的改动符不符合预期。这就是验证。候选人愿意给看 AI 工作记录,我也只看他怎么定义问题、补上下文、验证、纠错、复用,不看提示词多长、用了多少 Token。

我自己框错过一条线

准入线的判据是:这条不成立,这个人就做不成事。它挡在前面,防止被别的亮点带偏。除了上面说的端到端和基础,我还列过一条:AI 只用来生成代码,不校验、不沉淀,就不用往下看。

老周差点被它挡住。我问他有没有一个不用管、每天自己在跑的 AI 工作流。他想了一下,说既然要想,那就是没有。可他在校验,上面那份中间文档就是;他也在沉淀:自己建了一个只有他一个人的群当收件箱,周末让 Codex 读群消息整理成文档,再用命令行更新自己的目标。这就是一个个人工作流的闭环。

他缺的是让 AI 在他不在场时一直跑下去。那是长板。缺了它,他照样做得成事,所以够不上准入线。把长板当准入线,会误杀人。 我把这条改窄了:AI 是他工作流的一部分,而且他会验证、会沉淀。准入线要卡在验证和沉淀上,不是卡在他每天用不用 AI。

三个反方

拿学校背景当聪明的代理,会误杀,也不公平

对,而且这条我回应不全。学校在初筛就会刷掉人,被刷掉的人进不了后面的追问,这一刀的误杀后面补不回来。我能做到的是只让学校管初筛,不管结论:进了面试的人,结论落在追问陌生需求时他理解得多快。初筛这一刀怎么少误杀,我还没有好办法。

闭环和代表作,对工作一两年的人太苛刻

闭环分层看。工作一两年,跑通过一个个人工作流的闭环也算。老周那个收件箱就够格。

素质和态度都是虚的,最后还是看谁会说

这是最难的一条。我的办法是把这两个词落到能核的东西上:素质落到他讲得出的那一次具体的事,态度落到代表作和数字口径。核不动的一律不进结论,会说也说不进去。

这套看法在哪不成立

  • 只谈要用 AI 交付结果的工程和产品岗。纯研究岗、纯运营岗我没想过。
  • 闭环三分法和价值驱动起点,是我的经验框架,没有找到研究直接证实。上面引的效度数字都是跨岗位平均,不是技术岗专属。
  • 校招这一半,我还没按这套完整面过一场。社招的做法是 8 月的面试里改出来的。
  • AI 时代到底该考察什么,我自己还在想。这是 2026 年 9 月的版本。

收口

一句话:会什么会被抹平,素质和态度不会,所以我把面试的重量全压在后两样上。

落到动作就三条:

  1. 少问他会什么技术。让他挑一件做成的事,一直追问到这件事怎么让下一次做得更好。追不到下一次的,就还没闭环。
  2. 校招问一个他没做过的问题,看他多快听懂我要什么;基础不预告,照考。
  3. 讲不出具体的一次、数字核不动、换架构说不出原因,出现一个就先别下结论。面完再判断,摘要给的分不算数。

参考

  1. Sackett, Zhang, Berry & Lievens: Revisiting Meta-Analytic Estimates of Validity in Personnel Selection(JAP 2022,作者稿)(查阅 2026-09-15)— 结构化面试 .51→.42 排第一;工作年限 .18→.07;认知能力测验 .51→.31,群体差异大。
  2. Anthropic Engineering: Designing AI resistant technical evaluations(查阅 2026-09-15)— 带回家的测评被模型追平,改成模拟没见过的活。
  3. Levashina & Campion 2007: Measuring faking in the employment interview(查阅 2026-09-15)— 超过 90% 的本科求职者有美化行为;追问会增加美化。
  4. Anthropic: How AI assistance impacts the formation of coding skills(查阅 2026-09-15)— 52 人随机对照,学陌生 Python 库,50% 对 67%。

选择 打开esc 关闭