Clicked Gallery

Was ist ein Compute-Cluster?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

Nvidia's Jensen Huang called xAI's assembly of Colossus, a compute cluster of 100,000 chips, a “superhuman” effort, saying a machine of that size would normally take three years to plan and another year to get working.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „compute cluster“ in einfacher Sprache:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Die Clicked-Methode

●○○

Overview

Ein Compute-Cluster ist eine große Gruppe eigenständiger Computer, durch schnelle Verbindungen verbunden, damit ein einziger Auftrag auf allen zugleich läuft. Jeder Computer ist eine vollständige Maschine mit eigenen Rechenchips und eigenem Speicher. Weil dieser Speicher ihr allein gehört, muss alles, was eine Maschine ausrechnet, erst über die Verbindungen geschickt werden, bevor die übrigen es nutzen können. Ein Auftrag, der über tausend Maschinen verteilt ist, hält deshalb nach jedem Schritt an, damit die Maschinen austauschen, was sie herausgefunden haben, und der nächste Schritt wartet auf die langsamste. Die Größe wird in Chips angegeben und nicht in Maschinen, weil jede Maschine meist mehrere trägt: 2026 wurden die größten KI-Trainingscluster mit 100.000 Chips und mehr angekündigt.
●○○

Overview

Ein Compute-Cluster ist das, was entsteht, wenn die Arbeit für einen Computer viel zu groß ist: Du verkabelst Tausende davon und gibst ihnen den Auftrag zum Teilen. Jeder erledigt sein Stück, und der Haken ist, dass keiner weiß, was die anderen herausbekommen haben, bis alle anhalten und es sich erzählen. Die Sache läuft also in Runden: alle arbeiten, alle halten an, alle tauschen Antworten, und erst dann beginnt die nächste Runde. Ein guter Teil des Tages geht fürs Warten auf die letzte Maschine drauf. Eine Schlagzeile über 50.000 Chips sagt dir also, wie viel gleichzeitig passieren könnte, und kein Wort darüber, wie viele Stunden diese Chips aufeinander warten. 😎

Die Kurzfassung — oft reicht sie schon.

●●○

Detail

Ein Compute-Cluster baut man, wenn ein Auftrag jede einzelne Maschine übersteigt: Hunderte oder Tausende Computer, miteinander verkabelt, um an einem Problem zu arbeiten. Einen Auftrag auf Maschinen aufzuteilen sollte die Zeit im gleichen Verhältnis teilen, zehn Maschinen also in einem Zehntel fertig sein. So kommt es nicht. Ein Teil jedes Auftrags lässt sich gar nicht aufteilen: die Vorbereitung, die jede Maschine braucht, bevor überhaupt eine anfangen kann, und dieser feste Teil bleibt gleich groß, wie viele Maschinen auch dazukommen. Angenommen, ein Auftrag dauert allein 100 Tage, davon 5 Tage feste Vorbereitung und 95 Tage teilbare Arbeit. Zehn Maschinen drücken die 95 Tage auf 9,5, der Auftrag ist also nach 14,5 Tagen fertig und nicht nach 10. Hundert Maschinen drücken dieselben 95 Tage auf unter einen, und der Auftrag dauert trotzdem noch etwa 6, weil die 5 festen Tage sich nicht bewegen. Diese 5 Tage sind ein Boden, unter den keine Zahl von Maschinen kommt, und die Regel dahinter hat einen Namen: das Amdahlsche Gesetz. Die Vorbereitung ist allerdings nur ein einmaliger Aufwand. Läuft der Auftrag erst, müssen die Maschinen vergleichen, was sie herausgefunden haben, üblicherweise am Ende jedes Schritts, und der nächste Schritt beginnt erst, wenn die langsamste sich gemeldet hat. Jeder dieser Austausche geht über die Verkabelung, und deshalb werden die Verbindungen zwischen den Maschinen ebenso sorgfältig entworfen und bezahlt wie die Maschinen selbst. Nicht jeder Cluster zahlt diesen Preis: tausend voneinander unabhängige Aufträge, die nebeneinander laufen und nichts zu vergleichen haben, kommen mit gewöhnlichen Netzen aus. Maschinen gehen außerdem kaputt, und jede hält ein Stück des Auftrags, ein Ausfall stoppt den Lauf also, statt ihn zu verlangsamen. Über ein paar tausend Maschinen und einen Monat hinweg ist das Alltag, lange Aufträge sichern ihren Fortschritt daher in Abständen und setzen beim letzten Stand wieder an, statt von vorn zu beginnen.
●●○

Detail

Ein Compute-Cluster sind ein paar tausend Computer, die sich einen Auftrag teilen, und das Teure daran ist, sie dazu zu bringen, wie einer zu handeln. Der Auftrag läuft in Runden. In jeder Runde macht jeder Computer sein Stück, dann halten alle an, damit jeder sieht, was die übrigen herausbekommen haben, und keiner geht weiter, bevor der letzte sich meldet. Die Leerzeit ist echt: Ist ein Computer eine Minute im Rückstand, sitzen alle anderen diese Minute untätig da, und das wiederholt sich Runde um Runde, den ganzen Tag. Dann kommt das zweite Problem: Computer gehen kaputt. Nimm an, einer hält ungefähr ein Jahr durch, bevor etwas in ihm aufgibt. Ein Jahr sind 8.760 Stunden, bei 1.000 laufenden Geräten fällt also ungefähr alle 9 Stunden eines aus. Ein Trainingslauf, der drei Wochen braucht, bekommt keine drei sauberen Wochen, und wenn ein Computer aufgibt, geht sein Stück Arbeit mit, der Lauf stoppt also, statt mit einem Loch weiterzumachen. Deshalb schreibt der Auftrag alle paar Minuten mit, wo er steht, und spult nach jedem Ausfall dorthin zurück, was bedeutet, dass ein gutes Stück dieser drei Wochen dafür draufgeht, schon Erledigtes noch einmal zu erledigen. Mehr Computer lösen davon nichts: jeder weitere ist ein Ding mehr, das aufgeben kann, und eine Antwort mehr, auf die gewartet wird. 😎

Mehr? Ein Klick geht tiefer.

●●●

Analogy

Ein Compute-Cluster ist wie eine große Kolonne, die einen Turm Stockwerk für Stockwerk hochzieht. Die Arbeit ist zu groß für einen Maurer, also verteilen sich vierzig über das Stockwerk, jeder nimmt einen Abschnitt. Niemand kann mit dem Stockwerk darüber anfangen, solange nicht jeder Abschnitt hier unten fertig ist. Die Kolonne bewegt sich also im Tempo dessen, der zuletzt fertig wird, und ein schneller Maurer gewinnt nichts, wenn er früher aufhört. Bevor es nach oben geht, müssen die Abschnitte außerdem gegeneinander geprüft werden, damit die Ebene stimmt, und dieses Prüfen kostet eigene Zeit. Nimm mehr Maurer dazu, und jeder Abschnitt wird kleiner, aber das Prüfen und das Warten wachsen. Ein Cluster arbeitet genauso. Jede Maschine nimmt einen Abschnitt jedes Schritts, keine geht weiter, bevor alle verglichen haben, und je mehr Maschinen es sind, desto mehr von jedem Schritt geht fürs Vergleichen statt fürs Arbeiten drauf.
●●●

Analogy

Ein Compute-Cluster ist wie ein Ruderboot mit acht Leuten darin. Jede und jeder ist für sich stark, aber das Boot läuft nur dann gut, wenn alle acht im selben Moment ziehen, sie rudern also im Gleichtakt, Schlag für Schlag, und einer gibt den Takt an. Fällt eine Person einen halben Schlag zurück, fährt das Boot nicht mit sieben Achteln Tempo, es hakt, weil die anderen sieben nun gegen diese eine ziehen. Härter allein zu rudern hilft auch nichts, denn das Boot fährt in dem Tempo, das die Mannschaft gemeinsam halten kann. Ein Cluster ist dieses Boot mit tausend Ruderern: jede Maschine macht ihren Schlag, alle warten auf die langsamste, und den Takt gibt die Verkabelung zwischen ihnen an. 😎

Neues Konzept? Ein Alltagsbeispiel macht’s greifbar — neue Analogien auf Knopfdruck.

KI-Erklärungen können Fehler enthalten · Keine professionelle Beratung

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Ein Compute-Cluster ist eine Gruppe eigenständiger Computer, Knoten genannt, die über eine dedizierte Hochgeschwindigkeitsverbindung gekoppelt und als ein System verwaltet werden, sodass eine Arbeitslast auf alle verteilt werden kann. Jeder Knoten führt sein eigenes Betriebssystem aus und besitzt eigenen Speicher; die Koordination erfolgt über Nachrichtenaustausch auf der Verbindung und nicht über gemeinsamen Speicher, was einen Cluster von einer einzelnen großen Mehrprozessormaschine unterscheidet. Planungssoftware wie Slurm oder Kubernetes weist den Aufträgen Knoten zu und setzt die Warteschlangenregeln durch. Cluster sind die übliche Form von Hochleistungsrecheninfrastruktur, eingesetzt für wissenschaftliche Simulation, Finanzmodellierung und, im größten Maßstab, das Training von Modellen des maschinellen Lernens, wobei Bandbreite der Verbindung und Fehlertoleranz meist die begrenzenden Entwurfsfaktoren sind.

Soll Clicked Begriffe wie „compute cluster“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig