DeepSeek verschenkt die Softwareschicht, auf der Nvidias China-Burggraben ruht
Sechs Open-Source-Module für Huaweis Ascend-Chips, darunter ein CUDA-Konkurrent namens TileLang, verlagern Chinas Vorstoß bei der Chip-Software von der Roadmap ins Repository. Für Nvidia ruht das Bullenszenario eines wiedergeöffneten Chinamarkts nun allein auf Pekings Erlaubnis.
Richard Tang · 3 min read
DeepSeek hat am Mittwoch sechs Software-Module für Huaweis Ascend-KI-Chips als Open Source freigegeben 1. Das Paket zielt auf die eine Schicht, die Pekings Chip-Offensive nicht einfach kaufen konnte: die Software, die einen Chip programmierbar macht. Die hier bereits berichtete Wette auf Huaweis Produktionslinien hat nun auslieferungsfähigen Code hervorgebracht.
Bloomberg nennt die TileLang-Veröffentlichung Chinas Antwort auf CUDA – kostenlos herunterladbar wie alles andere darin 2. Seit Mittwoch listet das TileLang-Repository Huaweis Ascend 950 offiziell als unterstütztes Backend, mit nativer Codegenerierung und automatischem Scheduling 3.
Der Engpass waren die Kernel, nicht die Transistoren
KI-Chips sind nur so gut wie ihre Kernel – der handoptimierte Code für Matrixmultiplikation und Attention, in dem Performance gewonnen oder verloren wird. Ein Jahrzehnt lang war dieses Handwerk in CUDA beheimatet. TileLang bündelt die Arbeit: Wer einen Kernel einmal in Python-ähnlicher Syntax schreibt, bekommt vom Compiler optimierten Code für Nvidia-, AMD- und Apple-Chips – und nun auch für Ascend 3.
DeepSeek kombinierte TileLang mit DeepGEMM für die Matrixmultiplikation und mit DeepEP, das Daten zwischen den 128 Ascend-950-Prozessoren des Huawei-Supernodes verschiebt, auf dem das Labor den Stack optimierte. Nach eigenen Angaben habe sich die Performance dabei den Grenzen der Hardware angenähert 14.
DeepSeeks eigene Workloads laufen bereits darauf
Das ist kein Demo-Stack. TileLang-Beispiele für DeepSeeks V4-Workloads liegen seit Mai im Repository 3, das Labor betreibt seit April mit Huaweis voller Unterstützung V4-Inferenz auf Ascend 1, und Huawei hat bei der Software umfassende technische Hilfe geleistet 4.
Huawei erklärt, Supernodes mit Ascend 950 seien bereits kommerziell im Einsatz, und mehr als 1.000 ältere 910C-Supernodes seien installiert 5. Der Trainingschip 960DT wurde auf das erste Quartal 2027 vorgezogen, drei Quartale früher als geplant 1. Inferenz heute, Training ab nächstem Jahr: Der Stack deckt damit inzwischen beide Hälften der Rechenkosten eines chinesischen Labors ab.
Heimische Chips verkauften sich, bevor es die Software gab
Die Nachfrage war nie der Engpass. Bei Cambricon stieg der Umsatz im ersten Halbjahr um 108 Prozent auf 6 Milliarden Yuan, Hygon sagte für dieselben sechs Monate bis zu 9,3 Milliarden Yuan voraus, Moore Threads bis zu 1,75 Milliarden – getragen von Pekings Streben nach Selbstversorgung und von den US-Exportkontrollen 6. Cambricon, Moore Threads und die Halbleitersparte T-Head von Alibaba hatten bereits bestätigt, dass ihre Chips DeepSeeks Modelle ausführen 1.
Das Bezeichnende: Die Umsätze entstanden, bevor es die Werkzeuge gab. Die Käufer warteten mit ihren Bestellungen nicht auf Software. Das TileLang-Repository enthält bereits Backends für Hardware von Moore Threads und Hygon 3, die Freigabe vom Mittwoch liefert nun die Kernel, den Compiler und die Kommunikationsbibliotheken für Ascend 1. Für einen chinesischen Käufer, der zwischen gedrosselter Nvidia-Hardware und heimischen Chips wählt, entfällt damit der letzte Grund, noch zu warten.
Heimische Chiphersteller wuchsen, bevor DeepSeeks Software kam
- Umsatz im 1. Halbjahr 2026
- Estimate
Data
| Umsatz im 1. Halbjahr 2026 | |
|---|---|
| Hygon (estimate) | ¥9.3B |
| Cambricon | ¥6B |
| Moore Threads (estimate) | ¥1.75B |
Nvidias China-Kalkül ruht jetzt allein auf Pekings Erlaubnis
Nvidia hat für das laufende Quartal 108 Milliarden Dollar prognostiziert und dabei keine Umsätze mit Datacenter-Rechenleistung aus China eingerechnet 7. Jensen Huang hat erklärt, Nvidias Anteil am chinesischen Markt für KI-Chips sei von rund 95 Prozent auf null gefallen 7. Im vergangenen Quartal setzte der Konzern dennoch 7,9 Milliarden Dollar mit Kunden mit Sitz in China um – fast nichts davon KI-Rechenleistung 7.
Das Bullenszenario eines wiedergeöffneten Chinamarkts ruht auf zwei Säulen: zum einen auf Pekings Zähler, der Berichten zufolge derzeit mit möglichen RTX-Pro-5500-Freigaben für ByteDance und Alibaba getestet wird 8, zum anderen auf der vermeintlichen Unüberwindbarkeit von CUDA. Die eine Säule ist Politik. Für die andere gibt es inzwischen ein Gegenbeispiel gleich mehrerer Chiphersteller in einem Repository. Außerhalb Chinas sind die CUDA-Werkzeuge nach wie vor überlegen. Doch der Software-Rückstand war das eine Bärenargument, das die Exportkontrollen nicht schließen konnten – und diese Woche hat ihn Code geschlossen.
Zu beobachten sind zwei Bestätigungen: ob ein chinesisches Labor den Trainingslauf eines Frontier-Modells auf Ascend verlagert, und ob der 960DT wie versprochen im ersten Quartal eintrifft 1. Das eine ist die Entscheidung eines Labors, das andere ein Termin.
Der Lohn gehört dem, der die Hardware programmierbar gemacht hat
DeepSeek und Huawei haben die Arbeit in der Mitte des Stacks selbst erledigt, für alle sichtbar – und sie sind es, denen der Wert zufallen sollte: nicht dem, der den Transistoren am nächsten sitzt, sondern dem, der die Hardware programmierbar gemacht hat. Der Burggraben war schon immer die Software. Chinas Antwort ist jetzt öffentlich – und kostenlos.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



