python\nimport torch\nimport torch.nn as nn\n\nclass LinearAttention(nn.Module):\n \"\"\"一个简化的线性注意力模块,模拟KDA的核心理念\"\"\"\n def __init__(self, dim, num_heads):\n super().__init__()\n self.dim = dim\n self.num_heads = num_heads\n self.head_dim = dim // num_heads\n self.scale = self.head_dim -0.5\n \n self.to_qkv = nn.Linear(dim, 3 dim)\n self.proj = nn.Linear(dim, dim)\n\n def forward(self, x):\n B, N, C = x.shape\n qkv = self.to_qkv(x).reshape(B, N, 3, self.num_heads, self.head_dim).permute(2, 0, 3, 1, 4)\n q, k, v = qkv[0], qkv[1], qkv[2]\n\n # 核心:用特征映射代替softmax,将复杂度从O(N^2)降为O(N)\n q = torch.nn.functional.relu(q)\n k = torch.nn.functional.relu(k)\n \n kv = torch.einsum(\"bhnd,bhnm->bhdm\", k, v) # 先计算KV\n z = 1 / (torch.einsum(\"bhnd,bhd->bhn\", q, k.sum(dim=-2)) + 1e-6)\n out = torch.einsum(\"bhnd,bhdm->bhnm\", q, kv) z.unsqueeze(-1)\n \n out = out.reshape(B, N, C)\n return self.proj(out)\n`\n\n这段代码虽然简化,但体现了线性注意力的核心思想:通过巧妙的数学变换,将注意力计算的复杂度从序列长度的平方降低到线性,这正是Kimi K3能够处理超长上下文的底气所在。\n\n## 行业震动:格局将如何演变?\n\nKimi K3的开源,其影响是多维度的。\n\n对于开发者而言,这是一个难得的“炼丹”机会。以往需要耗费巨资才能触达的万亿参数模型,现在可以自由下载、微调、部署,这极大地降低了AI应用创新的门槛。\n\n对于竞争对手而言,压力是显而易见的。当技术路线被公开验证,追赶者要么选择跟随,要么需要拿出更具颠覆性的创新。这无疑会加速整个行业的迭代速度。\n\n对于整个AI生态而言,这是一个积极的信号。它表明,大模型的竞争正在从“炫技”走向“实干”,从“封闭垄断”走向“开放共赢”。正如月之暗面在开源公告中所言,他们希望“促进AI技术的民主化”。\n\n## 未来已来,但路还很长\n\n当然,我们也要清醒地看到,2.8万亿参数模型的训练和推理,依然需要强大的算力支撑。即便开源,普通开发者想要完整体验其能力,依然面临不小的资源门槛。此外,模型的幻觉问题、价值观对齐等挑战,并不会因为参数规模的扩大而自动消失。\n\n但无论如何,Kimi K3的开源,是国产大模型发展史上的一个重要里程碑。它向世界展示了中国AI团队在基础理论创新上的勇气和实力。正如我们所见,真正的技术革命,往往始于一次勇敢的开源。\n\n
\n\n
\n\nKimi K3的发布,只是这场长跑中的一个节点。我们期待看到,在开放与创新的驱动下,大模型技术能真正落地,为千行百业带来深刻的变革。\n\n---\n\n信息源:** 极客公园《月之暗面开源 Kimi K3 模型,2.8 万亿参数;英伟达牵头成立开放安全 AI 联盟;QQ 宠物宣布回归,接入混元大模型|极客早知道》", "source_note": "信息源:极客公园 http://www.geekpark.net/news/368055", "tags": ["Kimi K3", "月之暗面", "大模型", "开源", "混合注意力", "AI"]}月之暗面正式开源 Kimi K3 模型,2.8 万亿参数
7 月 27 日,月之暗面官方正式开源 Kimi K3 模型。官方发布了 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
官方表示,Kimi K3 是首个达到 2....
{"headline": "2.8万亿参数开源,Kimi K3凭什么让国产大模型再掀波澜?", "lead": "当行业还在为千亿参数模型争得不可开交时,月之暗面直接甩出一张2.8万亿参数的底牌,并大方开源。这不仅是参数的跃升,更是一次技术路线的宣言:混合线性注意力,能否成为下一代大模型的终局答案?", "body": "## 一场关于“规模”的军备竞赛,悄然升级\n\n大模型领域的竞争,从未像今天这样激烈。当人们还在讨论“百模大战”的洗牌何时到来,头部玩家已经将战场拉到了“万亿参数”的维度。7月27日,月之暗面(Moonshot AI)的一则开源公告,像一枚深水炸弹,瞬间引爆了技术圈——Kimi K3,一个拥有2.8万亿参数的新一代模型,正式开放权重与技术报告。\n\n这不仅仅是一次简单的版本更新。在AI发展史上,参数规模的每一次跃升,都伴随着能力边界的拓展。从GPT-3的1750亿,到GPT-4传闻中的万亿级,再到如今Kimi K3的2.8万亿,数字背后是算力、数据、算法的极致堆叠。但月之暗面显然不想只做一个“堆料”的玩家,他们更想证明:在通往AGI的路上,我们找到了一条更高效、更本质的路径。\n\n## Kimi K3:不止于大,更在于“巧”\n\n如果仅仅因为参数多就称之为“怪兽”,那显然低估了Kimi K3的技术含量。官方技术报告显示,Kimi K3的核心创新在于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术。\n\n这意味着什么?简单来说,传统Transformer模型的注意力机制,其计算复杂度随序列长度呈平方级增长,这是制约长文本处理能力的瓶颈。而Kimi K3采用的混合线性注意力,试图在保持全局感知能力的同时,将计算复杂度降至线性。这直接带来了两个直观优势:一是原生支持100万token的上下文窗口,处理海量文档、长视频理解将成为可能;二是推理效率的显著提升,让大规模模型的实际部署不再是“奢侈品”。\n\n更值得注意的是,Kimi K3原生支持视觉理解。这意味着它并非简单的“文本+图片”拼接,而是从架构层面实现了多模态的深度融合。在AI竞争的下半场,多模态能力被认为是通往通用人工智能的关键钥匙,Kimi K3的这一步,显然是在为未来的应用场景铺路。\n\n## 开源的力量:不仅仅是“秀肌肉”\n\n在闭源与开源之争日益白热化的今天,月之暗面选择将模型权重、技术报告乃至关键的Infra技术(MoonEP、FlashKDA和AgentEnv)全部公开,其意义远超“免费使用”。\n\n这更像是一场对技术领导权的争夺。通过开源,月之暗面希望吸引全球最顶尖的开发者、研究机构在其生态上进行二次开发,构建围绕Kimi K3的技术壁垒。正如PyTorch之于深度学习,Linux之于操作系统,一个成功的开源项目,最终会成为整个行业的地基。\n\n此外,这种开放姿态也回应了业界对AI“黑箱化”的担忧。通过公开技术细节,尤其是训练框架中的关键技术,月之暗面在展示其技术自信的同时,也在为AI的可解释性、安全性贡献一份力量。在“开放安全AI联盟”成立的当下,这无疑是一个加分项。\n\n## 一个“开箱即用”的技术栈示例\n\n为了让你更直观地理解Kimi K3的潜力,我们不妨用一个简单的代码示例来模拟其核心的混合注意力机制思路(非官方实现,仅供理解):\n\n`python\nimport torch\nimport torch.nn as nn\n\nclass LinearAttention(nn.Module):\n \"\"\"一个简化的线性注意力模块,模拟KDA的核心理念\"\"\"\n def __init__(self, dim, num_heads):\n super().__init__()\n self.dim = dim\n self.num_heads = num_heads\n self.head_dim = dim // num_heads\n self.scale = self.head_dim -0.5\n \n self.to_qkv = nn.Linear(dim, 3 dim)\n self.proj = nn.Linear(dim, dim)\n\n def forward(self, x):\n B, N, C = x.shape\n qkv = self.to_qkv(x).reshape(B, N, 3, self.num_heads, self.head_dim).permute(2, 0, 3, 1, 4)\n q, k, v = qkv[0], qkv[1], qkv[2]\n\n # 核心:用特征映射代替softmax,将复杂度从O(N^2)降为O(N)\n q = torch.nn.functional.relu(q)\n k = torch.nn.functional.relu(k)\n \n kv = torch.einsum(\"bhnd,bhnm->bhdm\", k, v) # 先计算KV\n z = 1 / (torch.einsum(\"bhnd,bhd->bhn\", q, k.sum(dim=-2)) + 1e-6)\n out = torch.einsum(\"bhnd,bhdm->bhnm\", q, kv) z.unsqueeze(-1)\n \n out = out.reshape(B, N, C)\n return self.proj(out)\n``\n\n这段代码虽然简化,但体现了线性注意力的核心思想:通过巧妙的数学变换,将注意力计算的复杂度从序列长度的平方降低到线性,这正是Kimi K3能够处理超长上下文的底气所在。\n\n## 行业震动:格局将如何演变?\n\nKimi K3的开源,其影响是多维度的。\n\n对于开发者而言,这是一个难得的“炼丹”机会。以往需要耗费巨资才能触达的万亿参数模型,现在可以自由下载、微调、部署,这极大地降低了AI应用创新的门槛。\n\n对于竞争对手而言,压力是显而易见的。当技术路线被公开验证,追赶者要么选择跟随,要么需要拿出更具颠覆性的创新。这无疑会加速整个行业的迭代速度。\n\n对于整个AI生态而言,这是一个积极的信号。它表明,大模型的竞争正在从“炫技”走向“实干”,从“封闭垄断”走向“开放共赢”。正如月之暗面在开源公告中所言,他们希望“促进AI技术的民主化”。\n\n## 未来已来,但路还很长\n\n当然,我们也要清醒地看到,2.8万亿参数模型的训练和推理,依然需要强大的算力支撑。即便开源,普通开发者想要完整体验其能力,依然面临不小的资源门槛。此外,模型的幻觉问题、价值观对齐等挑战,并不会因为参数规模的扩大而自动消失。\n\n但无论如何,Kimi K3的开源,是国产大模型发展史上的一个重要里程碑。它向世界展示了中国AI团队在基础理论创新上的勇气和实力。正如我们所见,真正的技术革命,往往始于一次勇敢的开源。\n\n
\n\n
\n\nKimi K3的发布,只是这场长跑中的一个节点。我们期待看到,在开放与创新的驱动下,大模型技术能真正落地,为千行百业带来深刻的变革。\n\n---\n\n信息源:** 极客公园《月之暗面开源 Kimi K3 模型,2.8 万亿参数;英伟达牵头成立开放安全 AI 联盟;QQ 宠物宣布回归,接入混元大模型|极客早知道》", "source_note": "信息源:极客公园 http://www.geekpark.net/news/368055", "tags": ["Kimi K3", "月之暗面", "大模型", "开源", "混合注意力", "AI"]}
来源:极客公园
标签:tech_newspython\nimport torch\nimport torch.nn as nn\n\nclass LinearAttention(nn.Module):\n \"\"\"一个简化的线性注意力模块,模拟KDA的核心理念\"\"\"\n def __init__(self, dim, num_heads):\n super().__init__()\n self.dim = dim\n self.num_heads = num_heads\n self.head_dim = dim // num_heads\n self.scale = self.head_dim -0.5\n \n self.to_qkv = nn.Linear(dim, 3 dim)\n self.proj = nn.Linear(dim, dim)\n\n def forward(self, x):\n B, N, C = x.shape\n qkv = self.to_qkv(x).reshape(B, N, 3, self.num_heads, self.head_dim).permute(2, 0, 3, 1, 4)\n q, k, v = qkv[0], qkv[1], qkv[2]\n\n # 核心:用特征映射代替softmax,将复杂度从O(N^2)降为O(N)\n q = torch.nn.functional.relu(q)\n k = torch.nn.functional.relu(k)\n \n kv = torch.einsum(\"bhnd,bhnm->bhdm\", k, v) # 先计算KV\n z = 1 / (torch.einsum(\"bhnd,bhd->bhn\", q, k.sum(dim=-2)) + 1e-6)\n out = torch.einsum(\"bhnd,bhdm->bhnm\", q, kv) z.unsqueeze(-1)\n \n out = out.reshape(B, N, C)\n return self.proj(out)\n`\n\n这段代码虽然简化,但体现了线性注意力的核心思想:通过巧妙的数学变换,将注意力计算的复杂度从序列长度的平方降低到线性,这正是Kimi K3能够处理超长上下文的底气所在。\n\n## 行业震动:格局将如何演变?\n\nKimi K3的开源,其影响是多维度的。\n\n对于开发者而言,这是一个难得的“炼丹”机会。以往需要耗费巨资才能触达的万亿参数模型,现在可以自由下载、微调、部署,这极大地降低了AI应用创新的门槛。\n\n对于竞争对手而言,压力是显而易见的。当技术路线被公开验证,追赶者要么选择跟随,要么需要拿出更具颠覆性的创新。这无疑会加速整个行业的迭代速度。\n\n对于整个AI生态而言,这是一个积极的信号。它表明,大模型的竞争正在从“炫技”走向“实干”,从“封闭垄断”走向“开放共赢”。正如月之暗面在开源公告中所言,他们希望“促进AI技术的民主化”。\n\n## 未来已来,但路还很长\n\n当然,我们也要清醒地看到,2.8万亿参数模型的训练和推理,依然需要强大的算力支撑。即便开源,普通开发者想要完整体验其能力,依然面临不小的资源门槛。此外,模型的幻觉问题、价值观对齐等挑战,并不会因为参数规模的扩大而自动消失。\n\n但无论如何,Kimi K3的开源,是国产大模型发展史上的一个重要里程碑。它向世界展示了中国AI团队在基础理论创新上的勇气和实力。正如我们所见,真正的技术革命,往往始于一次勇敢的开源。\n\n
\n\n
\n\nKimi K3的发布,只是这场长跑中的一个节点。我们期待看到,在开放与创新的驱动下,大模型技术能真正落地,为千行百业带来深刻的变革。\n\n---\n\n信息源:** 极客公园《月之暗面开源 Kimi K3 模型,2.8 万亿参数;英伟达牵头成立开放安全 AI 联盟;QQ 宠物宣布回归,接入混元大模型|极客早知道》", "source_note": "信息源:极客公园 http://www.geekpark.net/news/368055", "tags": ["Kimi K3", "月之暗面", "大模型", "开源", "混合注意力", "AI"]}?月之暗面正式开源 Kimi K3 模型,2.8 万亿参数
7 月 27 日,月之暗面官方正式开源 Kimi K3 模型。官方发布了 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
官方表示,Kimi K3 是首个达到 2....
{"headline": "2.8万亿参数开源,Kimi K3凭什么让国产大模型再掀波澜?", "lead": "当行业还在为千亿参数模型争得不可开交时,月之暗面直接甩出一张2.8万亿参数的底牌,并大方开源。这不仅是参数的跃升,更是一次技术路线的宣言:混合线性注意力,能否成为下一代大模型的终局答案?", "body": "## 一场关于“规模”的军备竞赛,悄然升级\n\n大模型领域的竞争,从未像今天这样激烈。当人们还在讨论“百模大战”的洗牌何时到来,头部玩家已经将战场拉到了“万亿参数”的维度。7月27日,月之暗面(Moonshot AI)的一则开源公告,像一枚深水炸弹,瞬间引爆了技术圈——Kimi K3,一个拥有2.8万亿参数的新一代模型,正式开放权重与技术报告。\n\n这不仅仅是一次简单的版本更新。在AI发展史上,参数规模的每一次跃升,都伴随着能力边界的拓展。从GPT-3的1750亿,到GPT-4传闻中的万亿级,再到如今Kimi K3的2.8万亿,数字背后是算力、数据、算法的极致堆叠。但月之暗面显然不想只做一个“堆料”的玩家,他们更想证明:在通往AGI的路上,我们找到了一条更高效、更本质的路径。\n\n## Kimi K3:不止于大,更在于“巧”\n\n如果仅仅因为参数多就称之为“怪兽”,那显然低估了Kimi K3的技术含量。官方技术报告显示,Kimi K3的核心创新在于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术。\n\n这意味着什么?简单来说,传统Transformer模型的注意力机制,其计算复杂度随序列长度呈平方级增长,这是制约长文本处理能力的瓶颈。而Kimi K3采用的混合线性注意力,试图在保持全局感知能力的同时,将计算复杂度降至线性。这直接带来了两个直观优势:一是原生支持100万token的上下文窗口,处理海量文档、长视频理解将成为可能;二是推理效率的显著提升,让大规模模型的实际部署不再是“奢侈品”。\n\n更值得注意的是,Kimi K3原生支持视觉理解。这意味着它并非简单的“文本+图片”拼接,而是从架构层面实现了多模态的深度融合。在AI竞争的下半场,多模态能力被认为是通往通用人工智能的关键钥匙,Kimi K3的这一步,显然是在为未来的应用场景铺路。\n\n## 开源的力量:不仅仅是“秀肌肉”\n\n在闭源与开源之争日益白热化的今天,月之暗面选择将模型权重、技术报告乃至关键的Infra技术(MoonEP、FlashKDA和AgentEnv)全部公开,其意义远超“免费使用”。\n\n这更像是一场对技术领导权的争夺。通过开源,月之暗面希望吸引全球最顶尖的开发者、研究机构在其生态上进行二次开发,构建围绕Kimi K3的技术壁垒。正如PyTorch之于深度学习,Linux之于操作系统,一个成功的开源项目,最终会成为整个行业的地基。\n\n此外,这种开放姿态也回应了业界对AI“黑箱化”的担忧。通过公开技术细节,尤其是训练框架中的关键技术,月之暗面在展示其技术自信的同时,也在为AI的可解释性、安全性贡献一份力量。在“开放安全AI联盟”成立的当下,这无疑是一个加分项。\n\n## 一个“开箱即用”的技术栈示例\n\n为了让你更直观地理解Kimi K3的潜力,我们不妨用一个简单的代码示例来模拟其核心的混合注意力机制思路(非官方实现,仅供理解):\n\n`python\nimport torch\nimport torch.nn as nn\n\nclass LinearAttention(nn.Module):\n \"\"\"一个简化的线性注意力模块,模拟KDA的核心理念\"\"\"\n def __init__(self, dim, num_heads):\n super().__init__()\n self.dim = dim\n self.num_heads = num_heads\n self.head_dim = dim // num_heads\n self.scale = self.head_dim -0.5\n \n self.to_qkv = nn.Linear(dim, 3 dim)\n self.proj = nn.Linear(dim, dim)\n\n def forward(self, x):\n B, N, C = x.shape\n qkv = self.to_qkv(x).reshape(B, N, 3, self.num_heads, self.head_dim).permute(2, 0, 3, 1, 4)\n q, k, v = qkv[0], qkv[1], qkv[2]\n\n # 核心:用特征映射代替softmax,将复杂度从O(N^2)降为O(N)\n q = torch.nn.functional.relu(q)\n k = torch.nn.functional.relu(k)\n \n kv = torch.einsum(\"bhnd,bhnm->bhdm\", k, v) # 先计算KV\n z = 1 / (torch.einsum(\"bhnd,bhd->bhn\", q, k.sum(dim=-2)) + 1e-6)\n out = torch.einsum(\"bhnd,bhdm->bhnm\", q, kv) z.unsqueeze(-1)\n \n out = out.reshape(B, N, C)\n return self.proj(out)\n``\n\n这段代码虽然简化,但体现了线性注意力的核心思想:通过巧妙的数学变换,将注意力计算的复杂度从序列长度的平方降低到线性,这正是Kimi K3能够处理超长上下文的底气所在。\n\n## 行业震动:格局将如何演变?\n\nKimi K3的开源,其影响是多维度的。\n\n对于开发者而言,这是一个难得的“炼丹”机会。以往需要耗费巨资才能触达的万亿参数模型,现在可以自由下载、微调、部署,这极大地降低了AI应用创新的门槛。\n\n对于竞争对手而言,压力是显而易见的。当技术路线被公开验证,追赶者要么选择跟随,要么需要拿出更具颠覆性的创新。这无疑会加速整个行业的迭代速度。\n\n对于整个AI生态而言,这是一个积极的信号。它表明,大模型的竞争正在从“炫技”走向“实干”,从“封闭垄断”走向“开放共赢”。正如月之暗面在开源公告中所言,他们希望“促进AI技术的民主化”。\n\n## 未来已来,但路还很长\n\n当然,我们也要清醒地看到,2.8万亿参数模型的训练和推理,依然需要强大的算力支撑。即便开源,普通开发者想要完整体验其能力,依然面临不小的资源门槛。此外,模型的幻觉问题、价值观对齐等挑战,并不会因为参数规模的扩大而自动消失。\n\n但无论如何,Kimi K3的开源,是国产大模型发展史上的一个重要里程碑。它向世界展示了中国AI团队在基础理论创新上的勇气和实力。正如我们所见,真正的技术革命,往往始于一次勇敢的开源。\n\n
\n\n
\n\nKimi K3的发布,只是这场长跑中的一个节点。我们期待看到,在开放与创新的驱动下,大模型技术能真正落地,为千行百业带来深刻的变革。\n\n---\n\n信息源:** 极客公园《月之暗面开源 Kimi K3 模型,2.8 万亿参数;英伟达牵头成立开放安全 AI 联盟;QQ 宠物宣布回归,接入混元大模型|极客早知道》", "source_note": "信息源:极客公园 http://www.geekpark.net/news/368055", "tags": ["Kimi K3", "月之暗面", "大模型", "开源", "混合注意力", "AI"]}
这个事件/技术的核心价值在于它推动了一个重要方向的发展。作为从业者/关注者,我们既要看到短期的影响,也要理解其长期意义。
来源:极客公园
原文链接:http://www.geekpark.net/news/368055【开场 Hook(0-5秒)】
月之暗面正式开源 Kimi K3 模型,2.8 万亿参数
7 月 27 日,月之暗面官方正式开源 Kimi K3 模型。官方发布了 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
官方表示,Kimi K3 是首个达到 2....
【核心内容(5-45秒)】
{"headline": "2.8万亿参数开源,Kimi K3凭什么让国产大模型再掀波澜?", "lead": "当行业还在为千亿参数模型争得不可开交时,月之暗面直接甩出一张2.8万亿参数的底牌,并大方开源。这不仅是参数的跃升,更是一次技术路线的宣言:混合线性注意力,能否成为下一代大模型的终局答案?", "body": "## 一场关于“规模”的军备竞赛,悄然升级\n\n大模型领域的竞争,从未像今天这样激烈。当人们还在讨论“百模大战”的洗牌何时到来,头部玩家已经将战场拉到了“万亿参数”的维度。7月27日,月之暗面(Moonshot AI)的一则开源公告,像一枚深水炸弹,瞬间引爆了技术圈——Kimi K3,一个拥有2.8万亿参数的新一代模型,正式开放权重与技术报告。\n\n这不仅仅是一次简单的版本更新。在AI发展史上,参数规模的每一次跃升,都伴随着能力边界的拓展。从GPT-3的1750亿,到GPT-4传闻中的万亿级,再到如今Kimi K3的2.8万亿,数字背后是算力、数据、算法的极致堆叠。但月之暗面显然不想只做一个“堆料”的玩家,他们更想证明:在通往AGI的路上,我们找到了一条更高效、更本质的路径。\n\n## Kimi K3:不止于大,更在于“巧”\n\n如果仅仅因为参数多就称之为“怪兽”,那显然低估了Kimi K3的技术含量。官方技术报告显示,Kimi K3的核心创新在于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术。\n\n这意味着什么?简单来说,传统Transformer模型的注意力机制,其计算复杂度随序列长度呈平方级增长,这是制约长文本处理能力的瓶颈。而Kimi K3采用的混合线性注意力,试图在保持全局感知能力的同时,将计算复杂度降至线性。这直接带来了两个直观优势:一是原生支持100万token的上下文窗口,处理海量文档、长视频理解将成为可能;二是推理效率的显著提升,让大规模模型的实际部署不再是“奢侈品”。\n\n更值得注意的是,Kimi K3原生支持视觉理解。这意味着它并非简单的“文本+图片”拼接,而是从架构层面实现了多模态的深度融合。在AI竞争的下半场,多模态能力被认为是通往通用人工智能的关键钥匙,Kimi K3的这一步,显然是在为未来的应用场景铺路。\n\n## 开源的力量:不仅仅是“秀肌肉”\n\n在闭源与开源之争日益白热化的今天,月之暗面选择将模型权重、技术报告乃至关键的Infra技术(MoonEP、FlashKDA和AgentEnv)全部公开,其意义远超“免费使用”。\n\n这更像是一场对技术领导权的争夺。通过开源,月之暗面希望吸引全球最顶尖的开发者、研究机构在其生态上进行二次开发,构建围绕Kimi K3的技术壁垒。正如PyTorch之于深度学习,Linux之于操作系统,一个成功的开源项目,最终会成为整个行业的地基。\n\n此外,这种开放姿态也回应了业界对AI“黑箱化”的担忧。通过公开技术细节,尤其是训练框架中的关键技术,月之暗面在展示其技术自信的同时,也在为AI的可解释性、安全性贡献一份力量。在“开放安全AI联盟”成立的当下,这无疑是一个加分项。\n\n## 一个“开箱即用”的技术栈示例\n\n为了让你更直观地理解Kimi K3的潜力,我们不妨用一个简单的代码示例来模拟其核心的混合注意力机制思路(非官方实现,仅供理解):\n\n``python\nimport torch\nimport torch.nn as nn\n\nclass LinearAttention(nn.Module):\n \"\"\"一个简化的线性注意力模块,模拟KDA的核心理念\"\"\"\n def __init__(self, dim, num_heads):\n super().__init__()\n self.dim = dim\n self.num_heads = num_heads\n self.head_dim = dim // num_heads\n self.scale = self.head_dim -0.5\n \n self.to_qkv = nn.Linear(dim, 3 dim)\n self.proj = nn.Linear(dim, dim)\n\n def forward(self, x):\n B, N, C = x.shape\n qkv = self.to_qkv(x).reshape(B, N, 3, self.num_heads, self.head_dim).permute(2, 0, 3, 1, 4)\n q, k, v = qkv[0], qkv[1], qkv[2]\n\n # 核心:用特征映射代替softmax,将复杂度从O(N^2)降为O(N)\n q = torch.nn.functional.relu(q)\n k = torch.nn.functional.relu(k)\n \n kv = torch.einsum(\"bhnd,bhnm->bhdm\", k, v) # 先计算KV\n z = 1 / (torch.einsum(\"bhnd,bhd->bhn\", q, k.sum(dim=-2)) + 1e-6)\n out = torch.einsum(\"bhnd,bhdm->bhnm\", q, kv) z.unsqueeze(-1)\n \n out = out.reshape(B, N, C)\n return self.proj(out)\n``\n\n这段代码虽然简化,但体现了线性注意力的核心思想:通过巧妙的数学变换,将注意力计算的复杂度从序列长度的平方降低到线性,这正是Kimi K3能够处理超长上下文的底气所在。\n\n## 行业震动:格局将如何演变?\n\nKimi K3的开源,其影响是多维度的。\n\n对于开发者而言,这是一个难得的“炼丹”机会。以往需要耗费巨资才能触达的万亿参数模型,现在可以自由下载、微调、部署,这极大地降低了AI应用创新的门槛。\n\n对于竞争对手而言,压力是显而易见的。当技术路线被公开验证,追赶者要么选择跟随,要么需要拿出更具颠覆性的创新。这无疑会加速整个行业的迭代速度。\n\n对于整个AI生态而言,这是一个积极的信号。它表明,大模型的竞争正在从“炫技”走向“实干”,从“封闭垄断”走向“开放共赢”。正如月之暗面在开源公告中所言,他们希望“促进AI技术的民主化”。\n\n## 未来已来,但路还很长\n\n当然,我们也要清醒地看到,2.8万亿参数模型的训练和推理,依然需要强大的算力支撑。即便开源,普通开发者想要完整体验其能力,依然面临不小的资源门槛。此外,模型的幻觉问题、价值观对齐等挑战,并不会因为参数规模的扩大而自动消失。\n\n但无论如何,Kimi K3的开源,是国产大模型发展史上的一个重要里程碑。它向世界展示了中国AI团队在基础理论创新上的勇气和实力。正如我们所见,真正的技术革命,往往始于一次勇敢的开源。\n\n
\n\n
\n\nKimi K3的发布,只是这场长跑中的一个节点。我们期待看到,在开放与创新的驱动下,大模型技术能真正落地,为千行百业带来深刻的变革。\n\n---\n\n信息源:** 极客公园《月之暗面开源 Kimi K3 模型,2.8 万亿参数;英伟达牵头成立开放安全 AI 联盟;QQ 宠物宣布回归,接入混元大模型|极客早知道》", "source_note": "信息源:极客公园 http://www.geekpark.net/news/368055", "tags": ["Kimi K3", "月之暗面", "大模型", "开源", "混合注意力", "AI"]}
【结尾引导(45-60秒)】
如果你觉得有用,点赞收藏,评论区告诉我你的看法!
{"headline": "2.8万亿参数开源,Kimi K3凭什么让国产大模型再掀波澜?", "lead": "当行业还在为千亿参数模型争得不可开交时,月之暗面直接甩出一张2.8万亿参数的底牌,并大方开源。这不仅是参数的跃升,更是一次技术路线的宣言:混合线性注意力,能否成为下一代大模型的终局答案?", "body": "## 一场关于“规模”的军备竞赛,悄然升级\n\n大模型领域的竞争,从未像今天这样激烈。当人们还在讨论“百模大战”的洗牌何时到来,头部玩家已经将战场拉到了“万亿参数”的维度。7月27日,月之暗面(Moonshot AI)的一则开源公告,像一枚深水炸弹,瞬间引爆了技术圈——Kimi K3,一个拥有2.8万亿参数的新一代模型,正式开放权重与技术报告。\n\n这不仅仅是一次简单的版本更新。在AI发展史上,参数规模的每一次跃升,都伴随着能力边界的拓展。从GPT-3的1750亿,到GPT-4传闻中的万亿级,再到如今Kimi K3的2.8万亿,数字背后是算力、数据、算法的极致堆叠。但月之暗面显然不想只做一个“堆料”的玩家,他们更想证明:在通往AGI的路上,我们找到了一条更高效、更本质的路径。\n\n## Kimi K3:不止于大,更在于“巧”\n\n如果仅仅因为参数多就称之为“怪兽”,那显然低估了Kimi K3的技术含量。官方技术报告显示,Kimi K3的核心创新在于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术。\n\n这意味着什么?简单来说,传统Transformer模型的注意力机制,其计算复杂度随序列长度呈平方级增长,这是制约长文本处理能力的瓶颈。而Kimi K3采用的混合线性注意力,试图在保持全局感知能力的同时,将计算复杂度降至线性。这直接带来了两个直观优势:一是原生支持100万token的上下文窗口,处理海量文档、长视频理解将成为可能;二是推理效率的显著提升,让大规模模型的实际部署不再是“奢侈品”。\n\n更值得注意的是,Kimi K3原生支持视觉理解。这意味着它并非简单的“文本+图片”拼接,而是从架构层面实现了多模态的深度融合。在AI竞争的下半场,多模态能力被认为是通往通用人工智能的关键钥匙,Kimi K3的这一步,显然是在为未来的应用场景铺路。\n\n## 开源的力量:不仅仅是“秀肌肉”\n\n在闭源与开源之争日益白热化的今天,月之暗面选择将模型权重、技术报告乃至关键的Infra技术(MoonEP、FlashKDA和AgentEnv)全部公开,其意义远超“免费使用”。\n\n这更像是一场对技术领导权的争夺。通过开源,月之暗面希望吸引全球最顶尖的开发者、研究机构在其生态上进行二次开发,构建围绕Kimi K3的技术壁垒。正如PyTorch之于深度学习,Linux之于操作系统,一个成功的开源项目,最终会成为整个行业的地基。\n\n此外,这种开放姿态也回应了业界对AI“黑箱化”的担忧。通过公开技术细节,尤其是训练框架中的关键技术,月之暗面在展示其技术自信的同时,也在为AI的可解释性、安全性贡献一份力量。在“开放安全AI联盟”成立的当下,这无疑是一个加分项。\n\n## 一个“开箱即用”的技术栈示例\n\n为了让你更直观地理解Kimi K3的潜力,我们不妨用一个简单的代码示例来模拟其核心的混合注意力机制思路(非官方实现,仅供理解):\n\n``python\nimport torch\nimport torch.nn as nn\n\nclass LinearAttention(nn.Module):\n \"\"\"一个简化的线性注意力模块,模拟KDA的核心理念\"\"\"\n def __init__(self, dim, num_heads):\n super().__init__()\n self.dim = dim\n self.num_heads = num_heads\n self.head_dim = dim // num_heads\n self.scale = self.head_dim -0.5\n \n self.to_qkv = nn.Linear(dim, 3 dim)\n self.proj = nn.Linear(dim, dim)\n\n def forward(self, x):\n B, N, C = x.shape\n qkv = self.to_qkv(x).reshape(B, N, 3, self.num_heads, self.head_dim).permute(2, 0, 3, 1, 4)\n q, k, v = qkv[0], qkv[1], qkv[2]\n\n # 核心:用特征映射代替softmax,将复杂度从O(N^2)降为O(N)\n q = torch.nn.functional.relu(q)\n k = torch.nn.functional.relu(k)\n \n kv = torch.einsum(\"bhnd,bhnm->bhdm\", k, v) # 先计算KV\n z = 1 / (torch.einsum(\"bhnd,bhd->bhn\", q, k.sum(dim=-2)) + 1e-6)\n out = torch.einsum(\"bhnd,bhdm->bhnm\", q, kv) z.unsqueeze(-1)\n \n out = out.reshape(B, N, C)\n return self.proj(out)\n``\n\n这段代码虽然简化,但体现了线性注意力的核心思想:通过巧妙的数学变换,将注意力计算的复杂度从序列长度的平方降低到线性,这正是Kimi K3能够处理超长上下文的底气所在。\n\n## 行业震动:格局将如何演变?\n\nKimi K3的开源,其影响是多维度的。\n\n对于开发者而言,这是一个难得的“炼丹”机会。以往需要耗费巨资才能触达的万亿参数模型,现在可以自由下载、微调、部署,这极大地降低了AI应用创新的门槛。\n\n对于竞争对手而言,压力是显而易见的。当技术路线被公开验证,追赶者要么选择跟随,要么需要拿出更具颠覆性的创新。这无疑会加速整个行业的迭代速度。\n\n对于整个AI生态而言,这是一个积极的信号。它表明,大模型的竞争正在从“炫技”走向“实干”,从“封闭垄断”走向“开放共赢”。正如月之暗面在开源公告中所言,他们希望“促进AI技术的民主化”。\n\n## 未来已来,但路还很长\n\n当然,我们也要清醒地看到,2.8万亿参数模型的训练和推理,依然需要强大的算力支撑。即便开源,普通开发者想要完整体验其能力,依然面临不小的资源门槛。此外,模型的幻觉问题、价值观对齐等挑战,并不会因为参数规模的扩大而自动消失。\n\n但无论如何,Kimi K3的开源,是国产大模型发展史上的一个重要里程碑。它向世界展示了中国AI团队在基础理论创新上的勇气和实力。正如我们所见,真正的技术革命,往往始于一次勇敢的开源。\n\n
\n\n
\n\nKimi K3的发布,只是这场长跑中的一个节点。我们期待看到,在开放与创新的驱动下,大模型技术能真正落地,为千行百业带来深刻的变革。\n\n---\n\n信息源:** 极客公园《月之暗面开源 Kimi K3 模型,2.8 万亿参数;英伟达牵头成立开放安全 AI 联盟;QQ 宠物宣布回归,接入混元大模型|极客早知道》", "source_note": "信息源:极客公园 http://www.geekpark.net/news/368055", "tags": ["Kimi K3", "月之暗面", "大模型", "开源", "混合注意力", "AI"]} 🔥
月之暗面正式开源 Kimi K3 模型,2.8 万亿参数
7 月 27 日,月之暗面官方正式开源 Kimi K3 模型。官方发布了 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Atten...
💡 关键信息:
#tech_news
#科技资讯 #前沿技术
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 公众号 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 小红书 | 📋 手动复制 |