别再修代码了去修系统devops-之父说agent-时代的组织变革比技术更难

2026年08月11日 | 来源:
信息源:

📋 多平台草稿预览 (12平台差异化改编)

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。


当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



写于彩虹洋葱 AI 聚合平台 · 如果你也对科技趋势感兴趣,欢迎交流。

🏷️ AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同

快手短视频脚本 | 时长:30-40秒

【封面字幕】(大号字体,居中)

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

【口播文案】(接地气风格,口语化)

老铁们,今天聊个硬核的——当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

核心就三点:

① (从正文提取第一个关键信息)

② (从正文提取第二个关键信息)

③ (从正文提取第三个关键信息)

懂的点个赞,不懂的评论区问我,下条见!💪


🏷️ 推荐标签:AI, Agent, 组织变革, DevOps, 平台工程, 人机协同

【微博短帖 | 140字以内核心版】

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难:当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

#AI #Agent #组织变革


【微博长帖 | 可配图 9 宫格版】

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

#AI #Agent #组织变革 🔗 https://www.infoq.cn/article/hLA2I6DD1v0ou0sE8KKB?utm_source=rss&utm_medium=article

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

前言

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。


当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



总结

本文梳理了相关技术/事件的核心脉络。如有错误欢迎在评论区指正。


📂 分类:AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同

© 本文由彩虹洋葱 AI 自动聚合,转载请注明出处。

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



总结 & 思考

以上为当前进展的梳理。欢迎在评论区交流技术细节和不同观点。


🏷️ 标签:AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同

👍 如果对你有帮助,请点赞收藏支持

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



信息源:InfoQ - 别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难 标签:AI, Agent, 组织变革, DevOps, 平台工程, 人机协同

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

摘要:> 当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技……


当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



📌 来源:InfoQ | 标签:AI · Agent · 组织变革 · DevOps · 平台工程 · 人机协同

本文由彩虹洋葱 AI 自动聚合生成,仅供参考,不构成任何投资或决策建议。

问题:如何看待「别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难」?

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。


当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



总结: 以上分析基于公开信息整理。核心在于理解这一事件/技术背后的驱动力,而非停留在表面叙事。欢迎在评论区交流你的看法。

📎 参考来源:InfoQ - 别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

🔗 原文链接:https://www.infoq.cn/article/hLA2I6DD1v0ou0sE8KKB?utm_source=rss&utm_medium=article

📺 B站视频脚本 | 时长:3-5分钟

【片头 0:00-0:15】BGM起 → 标题字幕弹出

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

【引子 0:15-0:45】制造悬念

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

【时间轴分镜】

├ [00:02] > 当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim……

├ [02:04] “你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动……

├ [04:06] Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:**在 Agent……

├ [06:08] 要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执……

├ [08:10] 这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自……

├ [结尾] 总结 + 求三连关注

【弹幕互动引导】

  • "觉得有用的扣 1"
  • "不同观点的弹幕见"
  • 结尾设置投票:你看好这个方向吗?A.看好 B.观望 C.不看好

🏷️ 标签:AI, Agent, 组织变革, DevOps, 平台工程, 人机协同

🎬 抖音口播脚本 | 时长:45-60秒

【0-5秒 黄金Hook】

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

【5-35秒 核心信息(口语化表达,每句一行)】

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。 “你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技

【35-50秒 深度扩展】

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

【50-60秒 强CTO结尾】

觉得有用的话,双击点赞 + 关注,下期继续带你读懂 AI!🔥


📐 拍摄建议:竖屏 9:16 · 科技感电子背景乐 · 关键数据配文字弹幕 · 表情自然语速适中

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难

【导语】 当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。
本文目录:

1. Agent 不是工具,是“新物种”同事

2. “修系统”意味着什么?——从“功能团队”到“流式团队”

3. 代码示例:Agent 时代的“平台工程”思维

4. 更难的是什么?—— 信任与控制的重构

5. 结语:从“工具理性”到“系统理性”


当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。

Agent 不是工具,是“新物种”同事

要理解 Gene Kim 的焦虑,我们得先看清一个事实:AI Agent 与以往任何技术工具都有本质区别。传统的 IDE、编译器、自动化脚本,本质上是“被动的执行器”,完全遵循人类的指令。但基于大语言模型的 Agent,具备感知、规划、调用工具和自主决策的能力。

这意味着什么?意味着你的代码仓库里,将不再只有人类提交的 commit。AI Agent 会自己“阅读”Issue,自己“编写”Pull Request,甚至自己“修复”CI 流水线的报错。

我们来看一个简单的示例。假设一个运维团队使用 Claude 或 GPT-4 来自动处理告警:

# 传统方式:人类手动处理告警
def handle_alert(alert):
    if alert.type == "CPU_HIGH":
        runbook = find_runbook("cpu_high")
        execute_ssh(alert.host, runbook.scale_up_command)
    else:
        print("需要人工介入!")

# Agent 方式:AI 自主决策并执行
from langchain.agents import AgentExecutor, Tool

def ai_handle_alert(alert):
    # Agent 会先分析告警上下文,然后决定是扩容、重启还是回滚
    tools = [
        Tool(name="SSH", func=execute_ssh),
        Tool(name="K8s API", func=scale_deployment),
        Tool(name="Log Analysis", func=query_logs)
    ]
    agent = AgentExecutor(agent="zero-shot-react", tools=tools, llm=llm)
    return agent.run(f"处理告警: {alert},请分析根因并执行修复")

代码本身并不复杂,但背后的逻辑已经变了。在 Agent 模式下,决策权正在从人向机器转移。过去,我们要求工程师 24 小时待命,响应告警;现在,我们要求 AI 在 5 秒内完成根因分析,并执行修复。人类工程师的角色,从“操作员”变成了“监督者”和“架构师”。

Gene Kim 指出,这种转变带来的冲击,远超技术本身。因为我们的组织架构、绩效评估、责任划分,全都是基于“人类执行”设计的。

“修系统”意味着什么?——从“功能团队”到“流式团队”

在传统的 DevOps 模型中,我们强调“打破孤岛”,让开发(Dev)和运维(Ops)协作。但在 Agent 时代,这种协作的粒度需要进一步细化到“人机协同”。

Gene Kim 提出了一个核心概念:我们需要重新设计“工作流”的交接点。 过去,工作流在“开发”和“运维”之间传递;未来,工作流将在“人类”和“Agent”之间传递。

这里有一个关键的组织结构图,描绘了传统模式与 Agent 模式的差异:

传统模式:功能孤岛 开发团队 (Dev) 运维团队 (Ops) 安全团队 (Sec) 大量交接/等待 大量交接/等待 Agent 模式:流式协同 AI Agent 集群 (编码/运维/安全) 人类工程师 (策略/审批/架构) 业务目标 (价值流驱动) 动态编排 价值反馈

Gene Kim 强调,在 Agent 时代,组织必须从“职能导向”转向“价值流导向”。 也就是说,不再有“开发部”和“运维部”,而是围绕一个业务目标,组建包含人类专家和多个 AI Agent 的“动态单元”。

这种“修系统”的变革,比任何技术升级都痛苦。因为它动摇了中层管理者的权力根基——当 AI 能自动完成 80% 的常规协调工作时,那些原本负责“上传下达”的经理们,就必须要么深入一线做架构决策,要么被组织淘汰。

代码示例:Agent 时代的“平台工程”思维

那么,这种“修系统”在实际落地中长什么样?Gene Kim 提到了“平台工程”的重要性。我们需要构建一个内部开发者平台(IDP),让 Agent 和人类都能在该平台上无缝协作。

这里有一个简化版的“平台即代码”概念,展示如何定义组织工作流:

# platform.yaml - 定义组织的“社会技术系统”
apiVersion: platform.org/v1
kind: ValueStream
metadata:
  name: payment-service
spec:
  # 定义人类角色
  human_roles:
    - name: senior-engineer
      permissions: [code-review, architecture-decision]
    - name: sre
      permissions: [production-access, incident-command]
  
  # 定义 AI Agent 角色
  agent_roles:
    - name: code-agent
      model: gpt-4o
      permissions: [write-code, run-tests, create-pr]
      auto_approve: false  # 需要人类审批
    - name: ops-agent
      model: claude-3-opus
      permissions: [scale-resources, restart-pods, analyze-logs]
      auto_approve: true   # 低风险操作自动执行
  
  # 定义工作流交接点
  handoffs:
    - from: code-agent
      to: senior-engineer
      trigger: "PR created"
      mode: "async-review"  # 异步审批
    
    - from: ops-agent
      to: sre
      trigger: "incident-severity-high"
      mode: "page-on-call"  # 紧急呼叫


<p align="center"><img src="https://static001.geekbang.org/infoq/bd/bd9d318ac01775dcd17a391382311d41.png" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
  # 定义安全边界
  guardrails:
    - policy: "no-direct-prod-db-write"
      applies_to: [code-agent]
    - policy: "human-in-the-loop-for-deploy"
      applies_to: [ops-agent]

注意,这里的核心不是 YAML 语法,而是组织规则的显式化。过去,这些规则存在于人类的默契和会议纪要中;现在,它们必须被编码,被 Agent 理解,被系统强制执行。

更难的是什么?—— 信任与控制的重构

Gene Kim 在访谈中直言不讳:技术上的多 Agent 协作框架,LangChain、AutoGen 已经够用了,真正的瓶颈在于“信任”。

当你的 AI Agent 自动执行了一次数据库删表操作(即使是误判),谁来负责?是写提示词的工程师,是部署 Agent 的运维,还是 Agent 本身?现有的审计合规框架完全无法回答这个问题。

因此,“修系统”的另一个维度,是建立面向 AI 的治理体系。这意味着:

1. 全链路可观测性:不仅监控代码,还要监控 Agent 的“决策链”。

2. 不可变审计日志:记录每一个 AI 动作的触发条件和上下文。

3. 动态权限收缩:当 AI 行为偏离预期时,系统应自动收回权限。

这不再是纯技术问题,而是法律、伦理和管理学的交叉地带。Gene Kim 认为,那些能率先解决“AI 责任归属”问题的组织,将在下一个十年获得巨大的竞争优势。

结语:从“工具理性”到“系统理性”

我们正站在一个分水岭上。过去二十年,DevOps 运动教会了我们“自动化一切”;未来十年,Agent 时代将强迫我们思考“自治化之后是什么”。

别再盯着那些可以自动修复的 Bug 了。真正值得你花时间去“修”的,是那个把人、流程、技术和 AI 揉合在一起的组织系统。正如 Gene Kim 所说:“最复杂的代码,不是写在仓库里的,而是写在组织架构图上的。

而这份“代码”,没有现成的 IDE 可以调试,只能靠每一位技术领导者的认知升级去重写。



关键词:AI, Agent, 组织变革, DevOps, 平台工程, 人机协同 声明:本文由彩虹洋葱 AI 智能聚合生成,仅供信息参考。

别再修代码了,去修系统:DevOps 之父说,Agent 时代的组织变革比技术更难 🔥

当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。


当每个工程师口袋里都揣着一个能写代码的 AI Agent,真正的瓶颈不再是算法或算力,而是我们僵化的组织架构和协作方式。DevOps 之父 Gene Kim 的最新论断,正在撕开 AI 时代最容易被忽视的伤口。

“你的公司不是在开发软件,而是在开发一套‘社会技术系统’。”这句话放在十年前,可能被视为管理学鸡汤;但在今天,当 AI Agent 开始批量取代“写代码”这个动作时,它成了悬在每个技术领导者头顶的达摩克利斯之剑。

Gene Kim,这位因《凤凰项目》和《DevOps 手册》而闻名于世的行业泰斗,最近在 InfoQ 的深度访谈中抛出了一个极具冲击力的观点:在 Agent 时代,我们最大的敌人不是技术债,而是组织债。 与其费尽心思地“修代码”,不如彻底地“修系统”——而这里的系统,指的是人与机器协同工作的整个社会技术架构。


📌 来源:InfoQ

#AI #Agent #组织变革 #DevOps #平台工程

#科技资讯 #彩虹洋葱AI

🚀 多平台发布

点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。

平台状态操作
✍️ 简书📋 手动复制
快手📋 手动复制
🐦 微博🔑 待配置密钥
💻 CSDN📋 手动复制
⛏️ 掘金📋 手动复制
💬 公众号🔑 待配置密钥
📰 今日头条🔑 待配置密钥
🤔 知乎📋 手动复制
📺 B站📋 手动复制
🎵 抖音📋 手动复制
📝 百家号🔑 待配置密钥
📕 小红书📋 手动复制