<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Huawei on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/huawei/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Thu, 01 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/huawei/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>DeepSeek 开源华为 Ascend 编程工具链！TileLang 剑指 CUDA，中国 AI 芯片生态加速独立！</title>
        <link>https://www.yesmiracle.net/post/20261001-deepseek-huawei-ascend-tilelang/</link>
        <pubDate>Thu, 01 Oct 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20261001-deepseek-huawei-ascend-tilelang/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20261001-deepseek-huawei-ascend-tilelang/cover.svg" alt="Featured image of post DeepSeek 开源华为 Ascend 编程工具链！TileLang 剑指 CUDA，中国 AI 芯片生态加速独立！" /&gt;&lt;p&gt;如果你关注中国 AI 芯片赛道，昨天是标志性的一天。&lt;/p&gt;
&lt;p&gt;2026 年 9 月 30 日，DeepSeek 联合华为宣布开源一套完整的 Ascend 加速器编程工具链。这不是又一个「基于 CUDA 的适配层」——这是一套从语言到运行时全部&lt;strong&gt;从头为华为昇腾芯片编写&lt;/strong&gt;的软件栈，直接对标 NVIDIA 统治了 AI 行业近二十年的 CUDA 生态。&lt;/p&gt;
&lt;p&gt;消息由 Bloomberg 率先报道，随后多家媒体确认。核心产品是 TileLang——DeepSeek 自称的「更高级编程语言」，被定位为 CUDA 的直接替代品。但 TileLang 只是拼图的一块，整个 release 包含了六个模块：DeepGEMM（矩阵运算）、DeepEP（芯片间通信）、TileKernels（标准向量计算）、FlashMLA（长上下文注意力优化）、以及 DeepSelect（数据过滤）。它们完整镜像了 DeepSeek 已经在 NVIDIA GPU 上跑通的全套工具链，只是这次——全部为华为硅片重写。&lt;/p&gt;
&lt;p&gt;换句话说，DeepSeek 把自己训练旗舰模型的全部软件能力，移植到了中国能自主生产的芯片上，然后直接开源了。&lt;/p&gt;
&lt;h2 id=&#34;为什么不是又一套适配层&#34;&gt;为什么不是「又一套适配层」&lt;/h2&gt;
&lt;p&gt;CUDA 真正的护城河不是技术复杂度，而是&lt;strong&gt;迁移成本&lt;/strong&gt;。切换到非 NVIDIA 芯片意味着数月重写代码、重新调试性能、重新验证精度——这不是一个小团队能承担的风险。过去几年里，「兼容 CUDA」的尝试（AMD ROCm、Intel oneAPI）都因为「兼容」而非「原生」的设计哲学，在性能和开发体验上始终差一步。&lt;/p&gt;
&lt;p&gt;DeepSeek 的做法完全不同：&lt;strong&gt;不为兼容而适配，为新一代芯片原生编写。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;TileLang 的定位是「高级语言」，意思是开发者用比 CUDA 更简洁的语法写 kernel，编译器负责优化到 Ascend 硬件上。DeepSeek 声称 TileLang 已经在 V4 系列模型的训练中验证了几乎所有算子——这意味着一家顶级 AI 实验室用自己的旗舰模型证明了这套工具的可行性。&lt;/p&gt;
&lt;p&gt;同时，DeepSeek 的 PyTorch 库增加了从 CUDA 代码到 CUNN（华为的底层接口）的自动转换能力。这虽然不一定能达到原生性能，但它把「迁移」从半年的工程任务变成了「先跑起来再优化」的渐进过程。&lt;/p&gt;
&lt;h2 id=&#34;性能到底差多少&#34;&gt;性能到底差多少&lt;/h2&gt;
&lt;p&gt;根据 DeepSeek 在 Tom&amp;rsquo;s Hardware 上披露的数据，华为 Ascend 910C 目前的推理性能约为 NVIDIA H100 的 &lt;strong&gt;60%&lt;/strong&gt;。这个数字经过手动优化的 CUNN kernel 后还可以提升。&lt;/p&gt;
&lt;p&gt;但别忘了关键背景：H100 已经是两年前的架构了。NVIDIA 当前主力是 Blackwell 和 Vera Rubin，而华为 Ascend 910C 在完全没有 NVIDIA 等效软件生态支持的情况下，逼近了 H100——这条曲线的斜率本身就在说明问题。&lt;/p&gt;
&lt;p&gt;更重要的是，DeepSeek 和华为正在联合开发一个 &lt;strong&gt;128 颗 Ascend 950 互联的 Supernode&lt;/strong&gt; 架构。当 128 颗芯片组成一个计算单元时，芯片间通信效率往往比单芯片性能更关键——这正是 DeepEP 模块解决的核心问题。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;NVIDIA H100&lt;/th&gt;
          &lt;th&gt;Huawei Ascend 910C&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;推理性能（相对值）&lt;/td&gt;
          &lt;td&gt;100%&lt;/td&gt;
          &lt;td&gt;~60%&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;软件生态&lt;/td&gt;
          &lt;td&gt;CUDA（20年积累）&lt;/td&gt;
          &lt;td&gt;TileLang + CUNN（开源刚起步）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;出口管制风险&lt;/td&gt;
          &lt;td&gt;H20 受限，H100 不可对中国销售&lt;/td&gt;
          &lt;td&gt;国产可控&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;互联方案&lt;/td&gt;
          &lt;td&gt;NVLink（成熟）&lt;/td&gt;
          &lt;td&gt;DeepEP + 128-chip Supernode（开发中）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;可用性&lt;/td&gt;
          &lt;td&gt;需美国政府批准&lt;/td&gt;
          &lt;td&gt;国内直接采购&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;商业信号三巨头集体下单&#34;&gt;商业信号：三巨头集体下单&lt;/h2&gt;
&lt;p&gt;DeepSeek V4（1.6 万亿参数）在 2026 年 4 月发布时做了一件微妙的事：它把&lt;strong&gt;早期访问权优先给了中国芯片厂商&lt;/strong&gt;，而非 NVIDIA 或 AMD。据 DeepLearning.AI 和 Capacity 的报道，ByteDance、腾讯、阿里巴巴在确认 DeepSeek 旗舰模型能在国产芯片上跑通后，迅速向华为锁定了 Ascend 950 的大规模订单。&lt;/p&gt;
&lt;p&gt;这组信号的意义在于：&lt;strong&gt;芯片采购不再是「信仰判断」，而是「验证后的事实」。&lt;/strong&gt; 一个能做 1.6T 参数模型训练推理的软件栈，改变了中国 AI 公司从「想不想买国产芯片」到「能不能不买」的决策逻辑。&lt;/p&gt;
&lt;p&gt;Bloomberg Intelligence 的数据印证了趋势：NVIDIA 在中国市场的份额已被华为 Ascend 挤压到个位数区间。H20 芯片（专为符合美国出口规则而阉割的版本）又遭遇了额外的许可问题——每进一步收紧，就给中国 AI 生态多一个理由构建不依赖美国许可的完整堆栈。&lt;/p&gt;
&lt;h2 id=&#34;更大的棋出口管制加速独立&#34;&gt;更大的棋：出口管制加速独立&lt;/h2&gt;
&lt;p&gt;这是整件事最讽刺也最值得关注的地方。&lt;/p&gt;
&lt;p&gt;美国出口管制的初衷很清楚：限制中国获取先进芯片，遏制其 AI 发展。2022 年的 A100 禁令、2023 年的 H100 禁令、2024 年的 H20 许可限制——层层加码。但 DeepSeek 的开源行动给出了一个清晰的反问：&lt;strong&gt;如果制裁只是加速了中国自建替代方案的速度，代价是什么？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;NVIDIA 中国业务本就因 H20 限制变得微薄。但芯片出口禁令针对的是硬件——你可以限制一颗芯片进入哪个市场。而开源代码一旦被释放，你无法把它收回。DeepSeek 在 9 月 30 日把整套工具链放到了 GitHub 上，任何人、任何公司、任何国家都可以免费下载、修改、优化。&lt;/p&gt;
&lt;p&gt;制裁可以限制芯片，但限制不了开源代码。&lt;/p&gt;
&lt;p&gt;DeepSeek 的 CTO 梁文锋在内部曾说过一段话（经 DeepLearning.AI 引用）：「我们不是在做中国版的 CUDA。CUDA 的问题在于它让你只能在 NVIDIA 上跑。我们想解决的问题是：你的模型应该能在任何硬件上跑——这不是一个商业问题，这是一个技术信仰问题。」&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;DeepSeek + Huawei 的开源工具链不是第一个、也不会是最后一个挑战 CUDA 垄断的尝试。但它的独特之处在于：它不是从外部攻进来的，而是从内部长出来的——它已经被世界顶级模型 V4 验证过，它的创造者有足够的工程底气说「我们不需要兼容」。&lt;/p&gt;
&lt;p&gt;接下来真正值得关注的是：&lt;strong&gt;TileLang 能在多大程度上被中国 AI 生态以外的开发者采用。&lt;/strong&gt; ByteDance、阿里、腾讯的订单是一个信号，但中小型 AI 实验室、以及非中国的开发团队，才是决定「反 CUDA」运动能否全球蔓延的关键指标。&lt;/p&gt;
&lt;p&gt;你可以限制一颗芯片的出口。但你限制不了一行能被任何人下载的代码。&lt;/p&gt;
&lt;p&gt;在 AI 基础设施的博弈里，开源是最不讲政治的——也是最不讲情面的。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;延伸阅读：&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260925-alibaba-zhenwu-v900-ai-chip/&#34; &gt;《豪掷 $530 亿！阿里发布最强 AI 芯片 Zhenwu V900》&lt;/a&gt; — 国产 AI 芯片的另一条战线&lt;/p&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
