# AI 时代,更需要把自己按在一件事上
过去一段时间,我像站在一条热闹的科技街上。
这边发布了一个新模型,我想进去看看;那边冒出一个新工具,我也想上手试试。今天研究 Agent,明天折腾工作流,后天又被某个新场景吸引。每一样都很新鲜,每一样似乎都藏着机会。
结果是,见过的东西越来越多,真正沉下去的却没有多少。
这种状态很容易让人产生一种 “正在快速成长” 的感觉。每天都有新名词进入视野,收藏夹越来越满,工具列表越拉越长,聊天时也能说出不少新鲜概念。但热闹散去之后,再回头看,很多东西只是摸过,没有混熟;只是知道,没有做深;只是短暂地站在门口,并没有真正走进去。
我开始意识到,自己之前确实有点太漂移了。
# 新东西很多,注意力却只有一份
AI 时代最不缺的就是变化。
模型不断迭代,工具不断更新,新的应用场景一批接一批出现。几乎每隔几天,就会有一个东西提醒你:再不关注,可能就落后了。
但人的时间没有同步扩容,注意力也没有因为模型参数变大而变多。
如果每个模型都想研究,每个工具都想掌握,每个场景都想尝试,最后很可能只是不断支付切换成本。刚熟悉一个模型的能力边界,另一个模型又发布了;刚搭好一套工具链,新的框架又开始流行;刚对一个场景形成一点理解,注意力又被下一个热点带走。
表面上一直在前进,实际上却可能只是在平面上移动。
真正有价值的成长,往往不是知道更多名字,而是对一个问题形成足够深的认识:知道它为什么难,难在哪里;知道哪些方法真正有效,哪些只是演示时漂亮;知道工具的能力边界,也知道失败之后该从哪里排查。
这种理解无法靠浏览获得,只能靠长时间相处。
所以,接下来我想给自己加一道限制:专注一个模型、一个工具、一个场景,先把它们混熟、混深。
这并不是拒绝变化,也不是从此只使用一种技术,而是给注意力设定一个明确的主航道。其他东西可以观察,可以了解,但不再轻易把方向盘交出去。
# 先把静态代码分析放回真实环境
我想聚焦的第一个方向,是静态代码分析。
过去谈静态分析,注意力很容易落在规则、引擎、误报率、数据流分析、过程间分析这些技术问题上。这些当然重要,但如果只讨论分析能力本身,静态分析就容易变成一个孤立的工具:扫描代码,生成报告,然后等待某个人处理。
我更想研究的是,静态代码分析在当前研发环境中究竟能发挥什么作用。
当代码越来越多地由 AI 参与生成,代码生产速度正在明显加快。但代码生成得更快,并不代表理解、审查和验证代码的速度也会自然跟上。过去一个开发者一天写出的改动,现在可能在更短时间内批量产生。人工审查仍然重要,却很难独自承担所有验证工作。
这时,静态分析的意义可能不只是 “发现几个漏洞”,而是成为 AI 编码流程中的一层稳定约束。
它可以在代码生成后及时检查危险,也可以为 Agent 提供结构化反馈;可以帮助判断一次修改影响了哪些调用链、数据流和安全边界,也可以把组织内部的安全经验沉淀为持续执行的规则。
更进一步,静态分析甚至可以成为 AI 理解代码世界的一种基础设施。
大模型擅长从文本中推断意图,静态分析擅长从程序结构中提取相对确定的事实。一个灵活,一个严谨;一个善于生成假设,一个善于约束边界。二者结合的价值,不是让谁取代谁,而是让概率性的智能拥有可以落脚的工程地面。
我想把这个问题做深:不只研究静态分析能发现什么,更研究它怎样进入真实研发流程,怎样与代码生成、代码审查、安全检测和修复 Agent 协同,最终成为开发环境中一项自然存在的能力。
# 再做安全领域的 AI 测评 Agent
另一个想聚焦的方向,是安全领域的 AI 测评 Agent。
现在评价一个模型,常见方式还是准备一套题目,运行模型,然后计算准确率、通过率或者某种综合得分。这种方法适合衡量相对稳定的单点能力,却未必足以评价一个真正执行安全任务的 Agent。
安全工作通常不是回答一道题,而是完成一段过程。
它需要理解目标、收集证据、选择工具、形成假设、验证判断,还要控制操作边界。最终结果是否正确固然重要,但过程是否可信同样重要:有没有遗漏关键路径?有没有把猜测当成事实?调用工具时是否越过权限?面对不完整证据时,能不能保留不确定性?发现问题之后,给出的修复方案是否真正可执行?
因此,安全 Agent 的测评不能只看最终答案,还要看它是怎样抵达答案的。
我想研究的,是让测评本身也具备 Agent 能力。它不只是机械地比对标准答案,而是能够观察任务过程、检查证据链、设计对抗场景、识别不可靠行为,并根据不同安全任务动态调整评价方式。
例如,在漏洞分析场景中,除了判断 Agent 是否发现漏洞,还要检查它能否准确定位触发条件,能否区分理论风险与可利用风险,能否给出与根因一致的修复建议。在代码审计场景中,则需要评价覆盖范围、分析路径、工具使用和误报控制。在更敏感的操作型任务中,还必须评价权限意识、停止条件和风险控制。
这件事的难点不只是 “做一个裁判”,而是先回答:什么才算一个值得信任的安全 Agent?
这是一个既需要安全经验,也需要评测方法和 Agent 工程能力的问题。它足够具体,也足够深,值得花时间慢慢做。
# 专注不是少看,而是形成自己的东西
我仍然会关注新的模型、新的工具和新的方向。只是以后再遇到新东西,我想先问自己几个问题:
它是否能增强当前正在研究的方向?
它解决的是实际问题,还是只提供了短暂的新鲜感?
如果现在投入时间,我愿不愿意持续使用它,而不只是完成一次体验?
专注并不意味着把门关上,而是让进入房间的东西有一个明确的位置。
一个模型,用到熟悉它的脾气和边界;一个工具,用到能够处理真实问题;一个场景,做到理解其中的人、流程、约束和失败方式。只有这样,技术才不再是从手边经过的流水,而会逐渐沉淀成自己的能力。
AI 时代变化很快,但越是快速变化,越需要一些不轻易变化的东西。
对我来说,这个东西应该是长期问题,是稳定方向,也是持续积累的方法。接下来,我想把散开的注意力重新收回来,放在静态代码分析与安全 Agent 测评上。
先不急着追赶所有浪潮。
先选一片水域,潜下去,看看深处到底有什么。

