MEGADEAL Jetzt gut informiert in den Apple-Herbst 2026 starten Deal sichern
Nachgemessen: So Maxi ist der neue Mini

Mac mini mit M6 im Test: Wie gut läuft lokale KI?

Apple bewirbt den neuen Mac mini mit M6 als ideale Maschine für lokale Künstliche Intelligenz. Wird der kleinste aller Macs diesem Anspruch gerecht? Wir messen nach und durchleuchten die Architektur des neuen 2-Nanometer-Chips im Detail.

Von   Uhr
Mac Life bei Google bevorzugen
So verpassen Sie unsere Updates bei Google nicht mehr: Klicken Sie auf den Link, setzen Sie im Google-Menue das Haekchen neben maclife.de und speichern Sie. Google spielt Ihnen unsere neuen Beitraege dann bei Suchanfragen bevorzugt aus.

Lokale Künstliche Intelligenz verändert den Markt für Desktop-Computer derzeit grundlegend. Apple positioniert den neuen Mac mini mit M6-Chip und ab 16 Gigabyte Arbeitsspeicher genau in diesem aufstrebenden Segment. Das Unternehmen bewirbt den kompakten Rechner offensiv als ideale Maschine, um große Sprachmodelle (Englisch „Large Language Models“, LLMs) lokal und ohne Cloud-Anbindung auszuführen. Nebenbei entfallen so die Kosten pro Token. Token sind gewissermaßen die „Währung“, in der KI-Anbieter bezahlt werden wollen.

Sommer-Angebot

(Bild: Stefan Molz)

Wir gehen diesem Anspruch auf den Grund und verzichten dabei bewusst auf synthetische Standardbenchmarks. Werkzeuge wie Geekbench oder Cinebench messen zwar die reine Rechenleistung der CPU- und GPU-Kerne, spiegeln aber die Realität bei der Ausführung moderner Sprachmodelle kaum wider. Für LLMs zählen vor allem zwei Werte: die Größe des Arbeitsspeichers und dessen Bandbreite.

llama.cpp als Testverfahren

Für diesen Test entsteht daher ein eigenständiger Benchmark-Parcours. Er setzt direkt auf einem lokalen Sprachmodell auf, das wir mithilfe der Open-Source-Software llama.cpp auf allen Testgeräten installieren. Als Basis dient das Modell Qwen3-4B-Q4_K_M.gguf. Es verfügt über vier Milliarden Parameter und nutzt eine Quantisierung auf 4 Bit. Die Quantisierung komprimiert die Gewichte des neuronalen Netzes, sodass sie weniger Arbeitsspeicher belegen – das ist besonders wichtig für Macs mit 16 Gigabyte oder weniger.

(Bild: Stefan Molz)

Die Wahl fällt aus einem bestimmten Grund auf genau diese Modellgröße: Alle Generationen sollen unter identischen Bedingungen antreten. Das Modell passt vollständig in den Arbeitsspeicher des ältesten Rechners im Testfeld, des Mac mini mit M1 und lediglich 8 Gigabyte. Neben dem Apple-Silicon-Pionier treten das MacBook Pro mit M1 Max (32 Gigabyte), der Mac mini mit M4 (16 Gigabyte), das MacBook Pro mit M5 Max (48 Gigabyte) und der Mac mini mit M6 an, den Apple uns mit 24 Gigabyte Arbeitsspeicher leihweise zum Test schickt.

llama.cpp: der Motor für lokale Sprachmodelle

Das Programm llama.cpp ist sozusagen der Sportwagen unter den Motoren für lokale Sprachmodelle: ein schlankes Programm, geschrieben in C++ (deswegen „.cpp“), das große Sprachmodelle lokal auf dem Mac zum Laufen bringt – ganz ohne Cloud, Python-Ballast oder teure GPU-Pflicht. Georgi Gerganov bastelte es ursprünglich an einem Wochenende, nur um Llama auf seinem MacBook laufen zu lassen. Heute gilt es als Standard für die lokale Ausführung von LLMs: Es komprimiert Modelle clever (GGUF, Quantisierung) und nutzt auf dem Mac direkt die GPU über Metal. Schneller geht es nicht.

Für unseren Benchmark ist es das Herzstück: llama-bench liefert die Tokens pro Sekunde, llama-perplexity die Qualitätswerte, llama-server macht das Modell für automatisierte Tests erreichbar. Ohne llama.cpp keine vergleichbaren Zahlen – es ist quasi die Stoppuhr, die bei jedem Mac exakt dieselbe Strecke misst. Das Projekt llama.cpp ist Open Source und kostenlos auf Github erhältlich. Am einfachsten gelingt „terminalfesten“ Anwendern die Installation per Homebrew mit dem Befehl

brew install llama.cpp

Der Mandelbrot-Test

Neben der reinen Textgenerierung steht ein zweiter, weitaus komplexerer Praxistest auf dem Programm: Er untersucht, wie gut die Modelle auf den Test-Macs Programmcode schreiben. Dabei agiert das jeweilige LLM im sogenannten „Agentic Mode“ direkt in der Entwicklungsumgebung Visual Studio Code (VS Code). Das Modell erhält den Auftrag, selbstständig eine moderne Webseite zu programmieren, die die Mandelbrot-Menge berechnet, visuell darstellt und Nutzenden einige Einstellmöglichkeiten bietet. Die Mandelbrot-Menge (auch „Apfelmännchen“ genannt), ein berühmtes Konstrukt der fraktalen Geometrie, erfordert präzise mathematische Schleifen und eine korrekte Implementierung der HTML5-Canvas-API zur grafischen Ausgabe.

In diesem Szenario fällt die Beschränkung auf vier Milliarden Parameter. Jeder Test-Mac erhält das jeweils größte Qwen-Modell, das sein Arbeitsspeicher gerade noch fassen kann. Das MacBook Pro mit M5 Max und 48 Gigabyte darf also ein weitaus mächtigeres Modell nutzen als der Mac mini mit M1. Am Ende bewerten wir, wie ansprechend die generierte Webseite aussieht, ob der Code fehlerfrei läuft und wie eigenständig die Künstliche Intelligenz Probleme bei der Entwicklung löst.

Beide Tests zusammen, Effizienzmessung und Praxistest, sollen handfeste Aussagen über die Energieeffizienz und den praktischen Nutzen lokaler LLMs liefern und so Apples Werbeversprechen überprüfen. Wer Sprachmodelle lokal ausführt, spart Zeit, Kosten und Energie für den sonst nötigen Datentransfer in entfernte Rechenzentren und schützt gleichzeitig vertrauliche Code-Fragmente vor fremden Blicken.

(Bild: Stefan Molz)

Der M6-Chip im Detail: Was Apple verbessert hat

Zunächst ein Blick auf genauer gesagt viel mehr in den M6-Chip selbst, der nicht weniger spannend ist: Apple verfeinert die Architektur im Vergleich zum direkten Vorgänger erheblich und erhöht primär die Bandbreite des gemeinsamen Arbeitsspeichers. Das weitet den größten Flaschenhals bei der lokalen Ausführung von Sprachmodellen. Ein Sprachmodell generiert Text bekanntlich Token für Token. Für jedes Token muss der Chip gigantische Matrizen aus dem Arbeitsspeicher laden. Je schneller dieser Datentransfer abläuft, desto mehr Tokens pro Sekunde gibt der Rechner aus.

Zusätzlich überarbeitet Apple die Neural Engine: Der M6 besitzt erstmals zwei Neural Engines mit je 16 Kernen. Dieser dedizierte Koprozessor für Künstliche Intelligenz beschleunigt Matrix-Multiplikationen, die das Fundament neuronaler Netze bilden. Eine stärkere Neural Engine entlastet die CPU-Kerne und senkt den Stromverbrauch bei gleichbleibender Leistung.

FinFET gegen GAAFET – die neue Transistor-Generation

Transistoren bilden die Grundlage jedes Prozessors. Sie fungieren als winzige Schalter, die den Stromfluss kontrollieren. Bis zur 3-Nanometer-Generation setzt TSMC auf die sogenannte FinFET-Architektur („Fin Field-Effect Transistor“). Dabei steht der stromführende Kanal wie eine kleine Haifischflosse auf dem Silizium. Das Gate, das den Strom steuert, umschließt diese Flosse von drei Seiten. Bei extrem kleinen Strukturbreiten stößt diese Bauweise jedoch an physikalische Grenzen: Der Strom lässt sich nicht mehr präzise stoppen, Leckströme entstehen, und der Chip verliert an Effizienz.

Der M6 nutzt stattdessen als erster Mac-Chip die GAAFET-Technik („Gate-All-Around“). Dabei teilt TSMC den stromführenden Kanal in mehrere hauchdünne, horizontale Nanosheets auf und stapelt sie übereinander. Das Gate umschließt diese Nanosheets vollständig von allen vier Seiten. Diese vollständige Umklammerung erlaubt eine deutlich bessere Kontrolle über den Stromfluss. Der Transistor schaltet präziser und schneller und verliert weniger Energie in Form von Abwärme. Diese Architekturänderung trägt maßgeblich zur gestiegenen Energieeffizienz des M6-Chips bei.

In der Pressemitteilung hebt Apple die neue 2-Nanometer-Strukturbreite des M6 hervor, während der Vorgänger M5 noch im 3-Nanometer-Verfahren vom Band läuft. Doch was bedeutet dieser Wert in der Realität? Die Angabe „2 Nanometer“ beschreibt heutzutage nicht mehr die physische Länge des Transistor-Gates. Es handelt sich vielmehr um einen Marketingbegriff der Halbleiterindustrie (speziell von Apples Hoflieferanten TSMC), der die nächste Generationsstufe der Miniaturisierung markiert. Dennoch hat dieser Schritt massive Auswirkungen: TSMC bringt auf der gleichen Siliziumfläche einmal mehr deutlich mehr Transistoren unter. Die Wege zwischen den Schaltelementen schrumpfen, und der Chip verrichtet dieselbe Arbeit mit niedrigerer elektrischer Spannung. Das Geheimnis dahinter erklärt der Kasten „FinFET gegen GAAFET“.

(Bild: Stefan Molz)

Der M6 stiehlt die Show

Unsere Tests zeigen, wie sich die Apple-Silicon-Chips entwickelt haben. Den Anfang macht der Mac mini mit M1 und 8 Gigabyte Arbeitsspeicher. Er generiert beim 4B-Parameter-Modell solide 22,08 Tokens pro Sekunde und zieht dabei lediglich 11,31 Watt aus der Steckdose. Das ergibt eine beachtliche Effizienz von 1,95 Tokens pro Sekunde und Watt (ein höherer Wert ist besser). Für ein Einsteigergerät, das Ende 2020 erschien, ist das ein hervorragender Basiswert. Das System beweist, dass auch ältere Apple-Chips lokale Sprachmodelle ausführen können: Die Lesegeschwindigkeit eines Menschen liegt bei etwa fünf Tokens pro Sekunde.

Das MacBook Pro mit M1 Max (32 Gigabyte) demonstriert die Macht einer höheren Speicherbandbreite. Obwohl es zur gleichen Chip-Generation gehört, schiebt es die Leistung auf beeindruckende 82,33 Tokens pro Sekunde. Der Stromverbrauch steigt dabei auf 38,88 Watt, die Effizienz klettert leicht auf 2,12 Tokens pro Sekunde und Watt. Der breitere Speicherbus des Max-Chips füttert die Rechenwerke schlicht schneller mit den nötigen Modellgewichten.

Der Mac mini mit M4 (16 Gigabyte) zeigt mit dem gleichen Qwen3-4B-Q4-K-M-Modell eine spürbare Leistungssteigerung gegenüber dem M1. Er erreicht 37,87 Tokens pro Sekunde und verbraucht dabei 19,10 Watt. Das führt zu einer ordentlichen Effizienz von 1,98 Tokens pro Sekunde und Watt. Der M4 bewältigt die Aufgabe souverän, ohne thermisch aufzufallen.

Die aktuelle Leistungsspitze bei den Max-Chips markiert das MacBook Pro mit M5 Max und 48 Gigabyte Arbeitsspeicher. Es lässt das restliche Testfeld mit 158,13 Tokens pro Sekunde bei 56,07 Watt weit hinter sich. Die Effizienz von 2,82 Tokens pro Sekunde und Watt zeigt, wie viel Potenzial in den großen Chip-Varianten steckt. Der M5 Max generiert damit salopp gesagt Text 30-mal schneller, als ein Mensch ihn lesen kann.

Der heimliche Star des Tests ist jedoch der neue Mac mini mit M6 (24 Gigabyte). Er zeigt eindrucksvoll Apples Weg, auch wenn er den M5 Max nicht schlagen kann – als Einstiegschip bietet er eine geringere Speicherbandbreite. Mit 54,51 Tokens pro Sekunde übertrifft er den M4 deutlich und benötigt dafür lediglich 17,16 Watt. Das Resultat ist eine herausragende Effizienz von 3,18 Tokens pro Sekunde und Watt – das ist der Spitzenwert im Testfeld, die höhere Bandbreite zahlt sich deutlich aus.

Eine interessante Randnotiz: Während des intensiven LLM-Benchmarks hörten wir den Lüfter des Mac mini mit M6 leise anlaufen. Das Geräusch war keineswegs störend, aber auffällig, da die anderen Mac-mini-Modelle bei diesem Test komplett lautlos blieben. Offenbar regelt Apple den Lüfter beim M6 früher hoch.

Programmieren mit Künstlicher Intelligenz

Beim Erzeugen der Mandelbrot-Webseite in HTML und JavaScript schneiden erwartungsgemäß die Macs am besten ab, die am meisten Arbeitsspeicher mitbringen. Der M5 Max nutzt das Modell mit 30 Milliarden Parametern und liefert prompt eine Seite ab, die nicht nur gut aussieht (siehe Abbildung), sondern auch auf Anhieb einwandfrei funktioniert. Nacharbeit: praktisch keine.

Knapp dahinter landet tatsächlich der vergleichsweise alte M1 Max. Auch er kann das Modell mit 30 Milliarden Parametern nutzen, es passt gerade so in den Arbeitsspeicher. Auch hier ist keine Nacharbeit nötig.

Die Seite, die der M1 ausspuckt, funktioniert leider gar nicht. Sie berechnet die Mandelbrot-Menge nicht korrekt, und die Bedienelemente arbeiten nur teilweise.

Der M6 im Mac mini schlägt sich indes wacker. Dank 24 Gigabyte Arbeitsspeicher kann er das 14 Milliarden Parameter schwere Modell nutzen. Die Seite ist zwar nicht perfekt, funktioniert aber ordentlich, und die wesentlichen Parameter zum Erzeugen der Mandelbrot-Menge lassen sich setzen und variieren.

Einige der Mandelbrot-Testseiten stehen unter https://cmg-software.com/llm/index.html zum Ausprobieren bereit.

(Bild: Stefan Molz)

Belastungsprobe unter Dauerfeuer

Kurze Benchmarks liefern oft trügerische Ergebnisse: Prozessoren erreichen für wenige Sekunden extrem hohe Taktraten, bevor sie aufgrund der Hitzeentwicklung drosseln müssen – ein Vorgang, den Fachleute als „Thermal Throttling“ bezeichnen. Um diesen Effekt offenzulegen, greifen wir auf ein eigens entwickeltes Werkzeug zurück: die App APSI Bench.

Die App testet die CPU-Leistung im Szenario „Long-Term-Load“ über volle 30 Minuten. Sie bringt die Prozessoren ans thermische Limit und protokolliert minutiös, ab welcher Minute das System die Leistung drosselt, um sich vor Überhitzung zu schützen. Gerade der Mac mini ist hier ein spannendes Untersuchungsobjekt, denn sein kompaktes Gehäuse bietet deutlich weniger Raum für Kühllösungen als ein großer Tower-PC. Ob das thermische Design die Abwärme des M6 über eine halbe Stunde abführt, ohne die Leistung zu kappen, entscheidet maßgeblich über die Praxistauglichkeit bei langen Programmiersitzungen.

Warum Apple auf lokale Sprachmodelle setzt

Während andere Technologiekonzerne gigantische Rechenzentren für ihre Dienste mit Künstlicher Intelligenz aus dem Boden stampfen, setzt Apple strategisch stärker auf lokale Berechnungen direkt auf dem Endgerät – auch wenn anspruchsvolle Aufgaben ebenfalls in Apples eigene Rechenzentren wandern. Dieser Ansatz bietet Nutzenden mehrere handfeste Vorteile. Erstens schützt er die Privatsphäre: Wenn sensible Daten das Gerät niemals verlassen, kann sie niemand auf externen Servern abfangen oder mitunter heimlich für das Training fremder Modelle missbrauchen. Zweitens reduziert lokale Künstliche Intelligenz die Latenzzeit drastisch. Der Rechner muss nicht auf die Antwort eines entfernten Servers warten, was besonders bei Echtzeitanwendungen wie der Code-Erstellung extrem wichtig ist. Drittens arbeiten lokale Modelle unabhängig von einer Internetverbindung. Wer im Flugzeug programmiert, hat seinen digitalen Assistenten somit dennoch stets griffbereit. Macht das Apple-Modell Schule, könnten die gigantischen Rechenzentren an Bedeutung verlieren – die Umwelt würde es danken. Außerdem entkoppelt sich Apple so auch ein Stück weit von der von manchen Finanzmarktexperten erwarteten KI-Bubble.

Hier zeigen die Apple-Silicon-Chips ihre wahre Stärke. Auch wenn manchmal der Lüfter anspringt, drosselt kein Mac im Testfeld die CPU bei langer und hoher Last spürbar. Alle liegen nach 30 Minuten noch bei über 90 Prozent, der M6 sogar bei fast 100 Prozent. Ein Top-Ergebnis, das zeigt, wie gut Apple die Kühlung der Geräte mit Lüfter im Griff hat.

Fazit: Ein kompakter KI-Rechner mit Preisaufschlag

Der Mac mini kann natürlich erst einmal alles, was der Vorgänger mit M4-CPU konnte, nur etwas schneller. Neu ist, dass er sich dank des M6-Prozessors auch als kleine leistungsstarke Workstation für Entwickler und KI-Anwender etablieren kann. Wer nicht allzu große Ansprüche hat, kann hier auf den deutlich teureren Mac Studio verzichten.

Generell besetzt der kompakte Rechner eine Nische, die auf dem PC-Markt kaum direkte Konkurrenz findet: kleine Abmessungen gepaart mit hoher Rechenleistung bei gleichzeitig geringem Stromverbrauch, Stichwort Effizienz! Speziell der M6-Chip zeigt dank der 2-Nanometer-Architektur und der GAAFET-Technik auf, wie effizient lokale KI-Berechnungen in der Praxis ablaufen können. Ein Wert von 3,18 Tokens pro Sekunde pro Watt markiert den klaren Spitzenplatz im Testfeld und Computer aus der Windows-Welt dürften hier lange nicht herankommen. Das beweist die Vorzüge des neuen Fertigungsverfahrens.

Apple verlangt für diesen technologischen Sprung jedoch einen deutlichen Aufpreis, der zu einem nicht geringen Teil den Marktumständen geschuldet sein dürfte. Der starke Preisanstieg im Vergleich zu den Vorgänger-Modellen fordert von Interessenten eine genaue Abwägung. Käufer müssen für sich entscheiden, ob die höhere KI-Leistung, die neue Prozessor-Architektur und der gewachsene Arbeitsspeicher die deutlichen Mehrkosten im Alltag rechtfertigen. Wer jedoch primär auf lokale Sprachmodelle setzt und eine energieeffiziente Maschine für den Schreibtisch sucht, findet im Mac mini mit M6 ein maßgeschneidertes Werkzeug.

Mac mini M6 im Test: Messwerte und Benchmarks
Mac-Modell Chip Arbeitsspeicher (Gigabyte) Sprachmodell Ausgabe (Token/s) Leistungsaufnahme (Watt) Effizienz (Token/s pro Watt) APSI-Bench Thermal Throttling (%) Programmieren mit Künstlicher Intelligenz (VS Code)
Mac mini M6 Apple M6 24 Qwen3-4B-Q4_K_M 54,51 17,16 3,18 99,01 Gut
Mac mini M4 Apple M4 16 Qwen3-4B-Q4_K_M 37,87 19,10 1,98 98,10 Befriedigend
Mac mini M1 Apple M1 8 Qwen3-4B-Q4_K_M 22,08 11,31 1,95 96,77 Unbrauchbar
MacBook Pro 2021 Apple M1 Max 32 Qwen3-4B-Q4_K_M 82,33 38,88 2,12 96,67 Gut
MacBook Pro 2026 Apple M5 Max 48 Qwen3-4B-Q4_K_M 158,13 56,07 2,82 97,36 Sehr gut
(Horizontal Scrollen, um die ganze Tabelle zu sehen)
Chris Möller // Autor & Code-Rocker
Chris Möller

Journalist. Entwickler. Schlagzeuger. Beim Chris verschwimmen die Grenzen zwischen Text, Takt und Quellcode. Wer bereits in den 90ern die Tech-Szene journalistisch prägte und später als stellvertretender Chefredakteur der Macwelt den Ton angab, könnte sich eigentlich auf seiner Expertise ausruhen. Chris tut das Gegenteil: Er baut kurzerhand eigene SwiftUI-Benchmarks (APSI-Bench), um Apple Silicon Chips ans Limit zu treiben.

Als ausgewiesener HiFi-Nerd und langjähriger Audio-Redakteur liebt er analoges Vinyl – und entwickelt ironischerweise die passenden Einmess-Tools fürs iPhone selbst. Ob Vibe-Coding in der Nacht, am Mischpult bei Live-Konzerten oder hinter den Drums seiner Rockband: Chris hat ein feines Gespür für das perfekte Timing. Bei der Mac Life sorgt er ab sofort für den richtigen Groove in den Artikeln. Denn er ist ein Redakteur, der die Apple-Welt nicht nur kommentiert, sondern sie sich selbst kompiliert.

Weitere Artikel von Chris Möller
Chris Möller ist Redakteur bei AUDIO+stereoplay

Testergebnis
ProduktnameMac mini M6
HerstellerApple
Preisab 1049 Euro, Testkonfiguration 1.269 Euro
Webseitewww.apple.com
Pro
  • sehr hohe Energieeffizienz bei lokalen KI-Modellen (3,18 tok/s pro Watt), spürbarer Leistungssprung dank 2-nm-GAAFET-Architektur, Basismodell bietet ab sofort ausreichend Arbeitsspeicher für LLMs
Contra
  • signifikanter Preisanstieg gegenüber den Vorgängern, Lüfter schaltet sich bei intensiver LLM-Dauerlast hörbar ein, Arbeitsspeicher systembedingt nicht aufrüstbar
SystemvoraussetzungenmacOS 27 (vorinstalliert)
Bewertung
1,3sehr gut

Mehr zu diesen Themen: