当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
🏷️ AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同
⚡ 快手短视频脚本 | 时长:30-40秒
【封面字幕】(大号字体,居中)
别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难
【口播文案】(接地气风格,口语化)
老铁们,今天聊个硬核的——当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
核心就三点:
① (从正文提取第一个关键信息)
② (从正文提取第二个关键信息)
③ (从正文提取第三个关键信息)
懂的点个赞,不懂的评论区问我,下条见!💪
🏷️ 推荐标签:AI, Agent, 组织变革, DevOps, 平台工程, 人机协同
【微博短帖 | 140字以内核心版】
别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难:当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
#AI #Agent #组织变革
【微博长帖 | 可配图 9 宫格版】
别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
#AI #Agent #组织变革 🔗 https://www.infoq.cn/article/hLA2I6DD1v0ou0sE8KKB?utm_source=rss&utm_medium=article
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
本文梳理了相关技术/事件的核心脉络。如有错误欢迎在评论区指正。
📂 分类:AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同
© 本文由彩虹洋葱 AI 自动聚合,转载请注明出处。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
以上为当前进展的梳理。欢迎在评论区交流技术细节和不同观点。
🏷️ 标签:AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同
👍 如果对你有帮助,请点赞收藏支持
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技……
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
📌 来源:InfoQ | 标签:AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同
本文由彩虹洋葱 AI 自动聚合生成,仅供参考,不构成任何投资或决策建议。当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
📎 参考来源:InfoQ - 别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难
🔗 原文链接:https://www.infoq.cn/article/hLA2I6DD1v0ou0sE8KKB?utm_source=rss&utm_medium=article
📺 B站视频脚本 | 时长:3-5分钟
【片头 0:00-0:15】BGM起 → 标题字幕弹出
别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难
【引子 0:15-0:45】制造悬念
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
【时间轴分镜】
├ [00:02] > 当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim……
├ [02:04] “你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动……
├ [04:06] Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:**在 Agent……
├ [06:08] 要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执……
├ [08:10] 这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自……
├ [结尾] 总结 + 求三连关注
【弹幕互动引导】
🏷️ 标签:AI, Agent, 组织变革, DevOps, 平台工程, 人机协同
🎬 抖音口播脚本 | 时长:45-60秒
【0-5秒 黄金Hook】
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
【5-35秒 核心信息(口语化表达,每句一行)】
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。 “你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技
【35-50秒 深度扩展】
别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难
【50-60秒 强CTO结尾】
觉得有用的话,双击点赞 + 关注,下期继续带你读懂 AI!🔥
📐 拍摄建议:竖屏 9:16 · 科技感电子背景乐 · 关键数据配文字弹幕 · 表情自然语速适中
1. Agent 不是工具,是“新物种”同事
2. “修系统”意味着什么?——从“功能团队”到“流式团队”
3. 代码示例:Agent 时代的“平台工程”思维
4. 更难的是什么?—— 信任与控制的重构
5. 结语:从“工具理性”到“系统理性”
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。
这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。
我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
if alert.type == "CPU_HIGH":
runbook = find_runbook("cpu_high")
execute_ssh(alert.host, runbook.scale_up_command)
else:
print("需要人工介入!")
# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool
def ai_handle_alert(alert):
# Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
tools = [
Tool(name="SSH", func=execute_ssh),
Tool(name="K8s API", func=scale_deployment),
Tool(name="Log Analysis", func=query_logs)
]
agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
return agent.run(f"处理告警: {alert},请分析根因并执行修复")
代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。
Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。
在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。
Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。
这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:
Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。
这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。
那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。
这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:
# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
name: payment-service
spec:
# 定义人类角色
human_roles:
- name: senior-engineer
permissions: [code-review, architecture-decision]
- name: sre
permissions: [production-access, incident-command]
# 定义 AI Agent 角色
agent_roles:
- name: code-agent
model: gpt-4o
permissions: [write-code, run-tests, create-pr]
auto_approve: false # 需要人类审批
- name: ops-agent
model: claude-3-opus
permissions: [scale-resources, restart-pods, analyze-logs]
auto_approve: true # 低风险操作自动执行
# 定义工作流交接点
handoffs:
- from: code-agent
to: senior-engineer
trigger: "PR created"
mode: "async-review" # 异步审批
- from: ops-agent
to: sre
trigger: "incident-severity-high"
mode: "page-on-call" # 紧急呼叫
<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 定义安全边界
guardrails:
- policy: "no-direct-prod-db-write"
applies_to: [code-agent]
- policy: "human-in-the-loop-for-deploy"
applies_to: [ops-agent]
注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。
Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。
当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。
因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:
1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。
2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。
3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。
这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。
我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。
别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。 ”
而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。
别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难 🔥
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。
Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。
📌 来源:InfoQ
#AI #Agent #组织变革 #DevOps #平台工程
#科技资讯 #彩虹洋葱AI
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 简书 | 📋 手动复制 | |
| 快手 | 📋 手动复制 | |
| 微博 | 🔑 待配置密钥 | |
| CSDN | 📋 手动复制 | |
| 掘金 | 📋 手动复制 | |
| 公众号 | 🔑 待配置密钥 | |
| 今日头条 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| B站 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 百家号 | 🔑 待配置密钥 | |
| 小红书 | 📋 手动复制 |