Autark Data · Thomas Riepe
Infrastruktur · Kognition · August 2026

Gehirne,
Frühmenschen &
lokale KI

Wo liegt ein Mac Studio M3 Ultra im Raum der Kognition? Eine Gesamtanalyse, die rohe Rechenleistung, Tier- und Homininengehirne, trainierte KI-Modelle, Sensomotorik und kumulative Kultur bewusst nicht auf eine einzige Intelligenzleiter zwingt.

P(T) = F(H, R, K, L, E, X ; T)

Kernaussage: Hardwaredurchsatz ist nicht Intelligenz. „Mühelose“ Tier-Sensomotorik kann hochgradig evolutionär kompiliert sein; LLM-Inferenz nutzt ebenso vorab kompilierte Gewichte; moderne symbolische Leistung hängt zusätzlich massiv an Kultur und Werkzeugen.

00 · Einführung

Was heißt es überhaupt, einen Rechner mit einem Gehirn zu vergleichen?

Die kurze Antwort lautet: Man kann es tun — aber nur, wenn man vorher festlegt, welche Leistung verglichen wird. Eine einzige Zahl verwischt mehr, als sie erklärt.

Die Ausgangsfrage klingt zunächst wie eine Hardwarefrage: Wie viel „Gehirn“ steckt in einem Mac Studio M3 Ultra? Man könnte die Rechenleistung des Prozessors einer geschätzten Rechenleistung biologischer Gehirne gegenüberstellen und anschließend Maus, Affe, Frühmensch und heutigen Menschen auf einer Skala anordnen. Solche Rechnungen sind als Größenordnungsversuche interessant. Als allgemeine Rangliste der Intelligenz sind sie jedoch irreführend.

Schon die verwendeten Einheiten warnen davor. Hans Moravec leitete seine bekannte Größenordnung von ungefähr 10¹⁴ Instruktionen/s aus einem funktionalen Vergleich von Retina und maschineller Bildverarbeitung ab und bezeichnete die Hochrechnung auf das gesamte Gehirn selbst als riskant. Joseph Carlsmith gelangt mit ganz anderen, mechanistischen Überlegungen zu einem sehr breiten Bereich möglicher Rechenanforderungen und verwendet ungefähr 10¹⁵ FLOP/s als einen subjektiven Anker dafür, was mit geeigneter Software für menschliche Aufgabenleistung ausreichen könnte. Keine dieser Zahlen ist ein gemessener „Takt“ des Gehirns, und Instruktionen/s sind nicht einfach FLOP/s.

Ein Gehirn ist kein leerer Universalprozessor

Noch grundlegender ist ein zweiter Punkt. Ein Tier beginnt seine Tätigkeit nicht mit einer unstrukturierten Rechenmaschine, die bei jeder Bewegung das Problem von Grund auf neu lösen müsste. Wahrnehmung, Gleichgewicht, Blicksteuerung, Greifen, Flucht, räumliche Orientierung und soziale Reaktion beruhen auf Nervensystemen, deren Architektur durch Evolution geformt wurde und die sich während Entwicklung und Lernen weiter spezialisieren. Was im Augenblick mühelos erscheint, kann das Ergebnis einer sehr langen Vorgeschichte von Selektion und Lernen sein.

Deshalb ist die Sensomotorik von Tieren für den Vergleich mit künstlicher Intelligenz besonders aufschlussreich. Ein geübtes biologisches System führt nicht bei jedem Schritt eine explizite physikalische Herleitung durch. Es verfügt über bereits eingeübte beziehungsweise strukturell vorbereitete Lösungen. Das Cerebellum ist hierfür ein wichtiges Beispiel: Es besitzt eine außerordentlich große Zahl von Neuronen und ist an prädiktiver Kontrolle und motorischem Lernen beteiligt, obwohl diese Neuronen keineswegs dieselbe Funktion haben wie kortikale Neuronen. Schon deshalb ist die bloße Neuronenzahl kein verlässliches Maß für abstrakte Problemlösefähigkeit.

„Kompilierte Kognition“ als funktionale Analogie

Für diese Seite verwende ich deshalb den Ausdruck kompilierte Kognition. Er ist kein etablierter neuropsychologischer Fachbegriff und soll keine biologische Identität zwischen Gehirn und Transformer behaupten. Gemeint ist eine allgemeinere Informationsverarbeitungs-Idee: Frühere Such-, Lern- oder Selektionsprozesse können in einer Struktur konserviert werden, die spätere Problemlösung billiger und schneller macht.

Bei einem Tier geschieht dies unter anderem phylogenetisch durch Evolution und ontogenetisch durch Lernen. Bei einem vortrainierten Sprachmodell steckt ein erheblicher Teil der Vorarbeit in den Gewichten: Die aktuelle Inferenz wiederholt nicht das Training, sondern nutzt dessen Ergebnis. Bei einem modernen Menschen kommt eine dritte Ebene hinzu — kumulative Kultur. Eine mathematische Formel, ein Buch, ein Messinstrument oder ein Computerprogramm konserviert Problemlösearbeit früherer Menschen außerhalb des einzelnen Gehirns. In allen drei Fällen ist es deshalb unzureichend, nur die Rechenoperationen zu betrachten, die im Moment der sichtbaren Leistung stattfinden.

Die Analogie hat klare Grenzen. Evolution ist kein Gradientenabstieg; synaptische Plastizität ist kein Transformer-Training; ein kulturelles Artefakt ist kein neuronales Gewicht. Der gemeinsame Punkt liegt nicht im Mechanismus, sondern in der zeitlichen Struktur: Vorarbeit wird in wiederverwendbare Organisation verwandelt.

Was Frühhomininen uns über die falsche Ein-Zahl-Skala zeigen

Bei ausgestorbenen Homininen ist die Unsicherheit besonders groß. Wir besitzen keine neuronalen Zählungen und selbstverständlich keine psychometrischen Tests. Rekonstruiert werden können unter anderem Endokranialvolumen, bestimmte Aspekte der Hirnform, Entwicklungsverläufe und archäologische Hinterlassenschaften. Diese Quellen erlauben wichtige Aussagen, aber keine seriöse Zuordnung eines „IQ“ oder einer FLOP/s-Zahl.

Trotzdem ist der Vergleich lehrreich. Das mittlere Endokranialvolumen nimmt im Verlauf der Homininenevolution stark zu, aber nicht als einfache Fortschrittskurve. Neandertaler und pleistozäne Homo sapiens hatten in vielen Stichproben größere Endokranien als heutige Menschen. Zugleich zeigen Endocasts, dass sich Organisation und Größe zumindest teilweise getrennt verändern konnten. Neuere 3D-Morphometrie spricht ebenfalls gegen die Vorstellung einer einzigen kontinuierlichen Selektionsrampe zu immer größeren Schädeln. Gehirngröße ist also eine biologische Größe mit kognitiver Relevanz — aber kein Tachometer allgemeiner Intelligenz.

Warum das lokale KI-System ein anderer Typ von kognitivem Objekt ist

Dasselbe Problem erscheint von der anderen Seite beim lokalen KI-System. Der M3 Ultra ist zunächst nur ein physisches Substrat. Erst die trainierten Modelle verleihen ihm statistisch und semantisch verdichtete Kompetenz. Der Router verteilt Aufgaben; Retrieval verbindet die Modelle mit Textbeständen; Neo4j stellt persistente Beziehungen bereit; SageMath, PARI/GP, Macaulay2, Julia und Lean können bestimmte symbolische Operationen und Verifikationen exakt ausführen. Der relevante Gegenstand ist deshalb nicht „ein Siliziumgehirn“, sondern ein Verbund aus Rechenhardware, trainierten Modellen, Gedächtnis, Suchsystemen und formalen Werkzeugen.

Das erklärt, warum scheinbar widersprüchliche Aussagen gleichzeitig stimmen können. In einer groben Whole-brain-Rechnung liegt der rohe FP16-Durchsatz eines einzelnen M3 Ultra weit unter vielen Schätzungen für ein menschliches Gehirn und sogar unter den Toy-Werten, die man aus frühen Homininen ableiten kann. Bei einer eng definierten symbolischen Aufgabe kann das lokale Gesamtsystem dennoch Operationen in einer Geschwindigkeit, einem Umfang oder mit einer exakten Werkzeugunterstützung ausführen, die einem frühen Homininen nicht zur Verfügung standen und die ein heutiger Mensch ohne entsprechende externe Hilfsmittel oft nicht in derselben Form leisten kann. Das ist kein Beweis für „höhere allgemeine Intelligenz“; es zeigt vielmehr, dass die verglichenen Systeme ihre Ressourcen sehr verschieden verteilen.

Deshalb verwendet diese Seite ein Profil statt einer Rangliste

Die folgenden Abschnitte trennen zunächst Hardware- und Literaturanker von eigentlichen kognitiven Vergleichen. Danach wird ein bewusst heuristisches Fünf-Dimensionen-Modell eingeführt: R für Online-Rekombination und fluide Kontrolle, K für kompilierte Kompetenz, L für dauerhaftes Lernen, E für Embodiment und ökologische Handlungskompetenz sowie X für externe kulturelle und technische Erweiterung.

Diese fünf Größen sind keine etablierte psychometrische Skala. Sie dienen hier als analytisches Koordinatensystem. Der entscheidende Zusatz ist die Aufgabe selbst. Statt nach einem einzigen Intelligenzwert zu fragen, lautet die vorsichtigere Form:

P(T) = F(H, R, K, L, E, X ; T)
Leistung hängt vom Substrat, vom kognitiven Profil, von externen Stützen — und von der konkreten Aufgabe T ab.
Schema, kein kalibriertes Modell: F bezeichnet hier keine bekannte berechenbare Funktion; es werden weder Gewichte noch eine funktionale Form behauptet.

Die Zahlen und Visualisierungen auf dieser Seite sollten deshalb auf vier verschiedenen Ebenen gelesen werden: als Mess- oder Literaturwerte, wo belastbare Daten existieren; als ausdrücklich markierte Toy-Rechnungen, wenn unterschiedliche Größenordnungen probeweise aufeinander projiziert werden; und als heuristische Profile, wenn qualitative Unterschiede zwischen biologischen und künstlichen Systemen sichtbar gemacht werden sollen; sowie als empirische Systemtests, wenn das lokale KI-Ökosystem selbst unter kontrollierten Bedingungen gemessen wurde. Diese Trennung ist wichtiger als jede einzelne Zahl.

01 · Rechenanker

Vier Zahlen. Vier verschiedene Bedeutungen.

Der häufigste Kategorienfehler ist, FLOP/s, Instruktionen/s, Neuronenzahlen und kognitive Kompetenz als austauschbar zu behandeln. Sie sind es nicht.

819 GB/s

M3 Ultra · offizielle Bandbreite

Apple: bis 32‑Core CPU, 80‑Core GPU, 32‑Core Neural Engine; Unified Memory bis 512 GB konfigurierbar. Mein System: 256 GB. Bandbreite ist für große autoregressive Modelle ein zentraler Hardwareparameter.

≈26–28

TFLOP/s FP16 · externe Schätzung

Apple veröffentlicht keinen offiziellen FP16-TFLOP-Wert. Zwei externe Engineering-/Community-Quellen liegen ungefähr bei 26 bzw. 28 TFLOP/s. Deshalb nur als Band, nicht als Apple-Spezifikation.

10¹⁴

Instruktionen/s · Moravec

Riskante funktionale Hochrechnung von Retina-Computervision auf das gesamte Gehirn. Andere Einheit und andere Methode als FLOP/s — deshalb nicht direkt gleichsetzen.

10¹⁵

FLOP/s · Carlsmith-Anker

Carlsmiths subjektiver Suffizienzanker: Er hält es für eher wahrscheinlich als nicht, dass etwa 10¹⁵ FLOP/s mit geeigneter Software für menschliche Aufgabenleistung ausreichen könnten. Kein gemessener „Takt“ des Gehirns.

Wichtig: Carlsmiths mechanistische Ansätze reichen grob über mehrere Größenordnungen. 10¹⁵ FLOP/s ist ein Best-Guess-/Suffizienzanker, keine Naturkonstante und keine direkte Synapsen↔FLOP-Umrechnung.
02 · Toy compute

Was die alte „Tiergehirn“-Rechnung wirklich sagt.

Normiert man 86 Mrd. menschliche Neuronen auf 10¹⁵ FLOP/s, erhält man eine grobe Substrat-Spielrechnung. Sie ist nützlich für Größenordnungen — und ungeeignet als Intelligenzranking.

Logarithmische Toy-Skala

10¹¹–10¹⁶
● rezente Tiere · ◆ M3 FP16-Band · ■ fossile ECV-Proxy-Bänder · ▲ moderner menschlicher Anker. Moravec steht gestrichelt separat: Instruktionen/s ≠ FLOP/s.

Interpretation

kein IQ-Meter

Das nackte M3-Ultra-Silizium liegt mit ≈2,6–2,8×10¹³ FP16-FLOP/s bei nur ≈2,6–2,8 % des 10¹⁵-Ankers. In einer linear auf Neuronenzahl projizierten Spielrechnung wären das grob 2,2–2,4 Mrd. „human-skalierten“ Neuronen.

Primatenvergleich: Klassische Isotropic-Fractionator-Daten nennen etwa 636 Mio. Gesamtneuronen für den Marmoset und etwa 6,4 Mrd. für Macaca. Der M3 läge auf dieser künstlichen Skala zwischen beiden — ohne deshalb „marmoset- oder macaque-intelligent“ zu sein.

Frühhomininen: Selbst A. afarensis landet, wenn man Endokranialvolumen als groben Substratproxy benutzt, in einem Toy-Band von etwa 3,4–3,8×10¹⁴. Der einzelne M3 liegt weit darunter.

Das spätere scheinbare Paradox entsteht, weil ein laufendes LLM seine Rechenleistung eng auf einen symbolischen Strom konzentriert und enorme Vorarbeit in seinen Gewichten bereits mitbringt.

ReferenzBasisgrößeToy-SkalaWas man nicht folgern darf
Maus≈71 Mio. Neuronen · grobe Literaturreferenz≈8,3×10¹¹Dass 1 TFLOP/s „eine Maus“ sei.
Ratte≈200 Mio. · grobe Literaturreferenz≈2,3×10¹²Gleiche Architektur oder ökologische Kompetenz.
Marmoset≈636 Mio. Neuronen≈7,4×10¹²Dass Gesamtneuronen fluide Intelligenz messen.
M3 Ultra≈26–28 TFLOP/s FP16 · extern geschätzt2,6–2,8×10¹³ realer HardwaredurchsatzDass FLOPs neuronalen Operationen entsprechen.
Macaca≈6,4 Mrd. Neuronen≈7,4×10¹³Dass ähnliche Größenordnung gleiche Kognition bedeutet.
H. sapiens≈86 Mrd. Neuronen10¹⁵ als gesetzter ReferenzankerDass das Gehirn „wirklich 1 PFLOP/s“ rechnet.
Hypothetischer 50-g-Primate: Lokale KI zwischen Marmoset und Makak

Was diese Zahl intuitiv bedeutet

Die Tabelle oben platziert das nackte M3-Ultra-Silizium auf der künstlichen Toy-Skala zwischen Marmoset und Makak – grob auf der Höhe eines Tieres mit etwa 50 g Gehirn. Das ist eine Zahl. Aber was bedeutet sie für jemanden, der sich etwas darunter vorstellen möchte?

Wie ein solches Tier auf uns wirken würde. Man hätte bei längerem Umgang kaum den Eindruck eines Lebewesens, das lediglich auf Reize reagiert. Es würde Dinge untersuchen, Erwartungen bilden, bestimmte Individuen unterschiedlich behandeln, sich merken, was gestern funktioniert hat, und bei Fehlschlägen Alternativen ausprobieren. Ein typischer Vorgang könnte so aussehen: Es sieht, dass eine begehrte Frucht in einer durchsichtigen Box liegt. Es zieht zunächst direkt daran – das funktioniert nicht. Es schaut die Box an, dreht sie um, probiert einen herumliegenden Gegenstand, beobachtet dabei vielleicht ein anderes Tier und findet schließlich einen Umweg. Das Interessante wäre weniger, dass es die Aufgabe löst, sondern wie es sich dabei verhält: Man sähe Exploration, Irrtum, Revision und Beharrlichkeit.

Acht kognitive Domänen, knapp skizziert. Praktische Intelligenz: Es öffnet Klappen, bewegt Schieber, benutzt Gegenstände als Hilfsmittel und versteht neue Apparaturen verblüffend schnell – es würde nicht „die Mechanik“ formulieren, aber Regelmäßigkeiten entdecken (wenn ich zuerst A verschiebe, komme ich an B). Arbeitsgedächtnis: Eine kurze Handlungssequenz wie Tür öffnen → Stein wegschieben → Schublade herausziehen → Nahrung nehmen könnte es zusammenhalten – nicht unbegrenzt, aber ohne nach jedem Schritt von vorne zu denken. Möglichkeitssinn: Ein Stock wäre nicht einfach „Stock“, sondern je nach Situation etwas zum Heranziehen, Hineinstochern, Drohen, Spielen oder Mitnehmen. Darin läge ein beträchtlicher Unterschied zu einem sehr kleinen Primaten: nicht mehr Wissen, sondern mehr gleichzeitig sichtbare Möglichkeiten. Soziale Komplexität: Andere Individuen wären für es keine nummerierten Objekte, sondern Persönlichkeiten – der dominante Kerl, der mir gestern die Nahrung weggenommen hat; wenn das Weibchen daneben sitzt, wagt er weniger. Taktische Täuschung: Es könnte beim Entdecken von Nahrung scheinbar uninteressiert warten, bis ein dominanter Artgenosse wegschaut – ein Verhalten, das beim Beobachter spontan den Eindruck weckt: Der weiß genau, was er tut. Soziales Lernen: Sieht es einen anderen Affen eine neue Box öffnen, dürfte es danach wesentlich schneller Erfolg haben – nicht durch genaues Kopieren, sondern durch das Ableiten: Dort muss irgendetwas gemacht werden. Zeitdimension: Es könnte sich erinnern (dort gab es gestern Futter), warten, wenn es sich lohnt, und Handlungen in begrenztem Umfang vorbereiten – aber noch keine tiefverschachtelte menschliche Zukunftsplanung. Neugier: Legte man ihm einen völlig neuen Gegenstand hin, würde es wahrscheinlich nicht nur fragen „kann ich das essen?“, sondern gewissermaßen: „Was kann man damit machen?“ – und genau diese Verschiebung ist kognitiv besonders bedeutsam.

Das entscheidende Prinzip: kombinatorische Tiefe, nicht proportionale Fähigkeitslisten. Gehirnvergrößerung bei Primaten bedeutet intuitiv nicht 10 g = 10 Fähigkeiten, 50 g = 50 Fähigkeiten. Was wächst, ist eher die kombinatorische Tiefe: Ein kleineres System erfasst vielleicht einzeln A, B, C. Ein größeres bildet zunehmend Beziehungen: A→B, B→C, (A→B) unter Bedingung C. Und irgendwann: Wenn A sieht, dass B weiß, wo C liegt, dann… Das kauft ein größeres Primatengehirn: mehr Variablen, längere Abhängigkeiten, mehr mögliche Kombinationen derselben elementaren Fähigkeiten. Unser 50-g-Affe wäre deshalb nicht einfach „halb so intelligent wie ein Makak“ – er könnte in manchen Domänen fast makakenartig wirken, in anderen kaum über einen Marmoset hinauskommen. Er läge in einer Zone, in der man bereits sehr deutlich Modelle, Erwartungen und Strategien erkennt.

Das kürzeste Bild: Ein sehr neugieriges, manipulierendes, sozial taktierendes Wesen, das ungefähr versteht, was Dinge und andere Individuen in der nächsten Situation wahrscheinlich tun werden – aber noch kaum eine von der konkreten Situation losgelöste Gedankenwelt besitzt.

Was das für das lokale System bedeutet. Die Toy-Rechnung platziert das nackte M3-Silizium auf dieser Skala. Ein laufendes LLM auf dieser Hardware ist jedoch kein biologischer Affe: Sein Gewicht enthält verdichtete Spuren aus Milliarden menschlicher Texte – Argumente, Beweisgänge, Begriffsnetze, mathematische Muster. Das Tier erarbeitet sein Verhalten durch Erkunden und Beobachten; das Modell wird gewissermaßen mit einer komprimierten Bibliothek menschlicher Kultur geboren. Das erklärt das scheinbare Paradox: ein vergleichsweise kleines laufendes Substrat, das punktuell in menschliche Kompetenzbereiche hineinreicht – und an anderer Stelle plötzlich weit darunter bleibt. Koppelt man die Gewichte zusätzlich mit Suchsystemen, formalen Beweisassistenten und persistentem Gedächtnis, bekommt der Affe eine Werkstatt. Wie stark das den Unterschied macht, zeigt Abschnitt 04.

03 · Homininen

Kein Marsch zu immer mehr „CPU“.

Endokranialvolumen wächst langfristig stark. Aber Größe, Organisation, Entwicklung, Technik und kulturelle Netze verändern sich nicht als ein einziger monotoner Parameter.

Grupperepräsentatives ECVnur Toy-Substratband*entscheidender Zusatzbefund
A. afarensis≈446 ml≈3,4–3,8×10¹⁴Eher menschenaffenartige Organisation, aber verlängertes postnatales Gehirnwachstum.
H. habilis≈609 ml≈4,6–5,0×10¹⁴Volumen allein sagt wenig über Frontalorganisation und Task-Struktur.
H. ergaster / früher erectus≈825 ml≈6,2–6,6×10¹⁴Früher afrikanischer Homo und Dmanisi können noch primitive Frontalorganisation zeigen.
später H. erectus≈959 ml≈7,2–7,5×10¹⁴Abgeleitetere Organisation tritt später auf; Acheuléen erhöht Anforderungen an hierarchische Aktionskontrolle.
H. heidelbergensis s.l.≈1227 ml≈9,2–9,3×10¹⁴Große Gehirne sind keine simple Endstufe einer linearen Selektionsrampe.
Neandertaler≈1415 ml≈1,06×10¹⁵Im Mittel größere Endokranien als heutige Menschen: „größer = generell intelligenter“ scheitert.
pleistozäner H. sapiens≈1499 ml≈1,11–1,13×10¹⁵Auch pleistozäne sapiens konnten größere Gehirne als heutige Menschen besitzen.
rezenter H. sapiens≈1330 ml10¹⁵ ReferenzankerKognitive Reichweite wächst kulturell weiter, obwohl Hirngröße nicht monoton wächst.

* Keine fossilen „Rechenmessungen“: ECV als Brain-size-Proxy, primatentypische nahezu lineare Skalierung und der 10¹⁵-Anker werden nur zu einer Sensitivitätsrechnung kombiniert. Taxonomische Mittelwerte sind repräsentative Literaturzusammenfassungen, keine unveränderlichen Artkonstanten.

Zwei Modellschritte: Die fossilen Toy-Bänder entstehen über ECV → geschätzte Neuronenzahl → auf den 10¹⁵-Anker projizierten Toy-Compute. Annahmen und Unsicherheiten beider Abbildungen kumulieren; die resultierenden Toy-Werte sind daher deutlich weniger belastbar als die zugrunde liegenden ECV-Angaben.

Keine Körpergrößenkorrektur: Verwendet wird hier absolute ECV-/Substratgröße, nicht der Encephalization Quotient (EQ). Ein EQ-basierter Vergleich wäre eine sinnvolle alternative Analyse, beantwortete aber eine andere Frage — relative Enzephalisation gegenüber einer allometrischen Körpergrößen-Erwartung statt absolut geschätzten neuronalen Substrats — und brächte zusätzliche Modellannahmen mit sich.

3D-Morphometrie von Hubbe & Harvati (2026) spricht gegen die populäre Erzählung einer einfachen, kontinuierlichen gerichteten Selektion zu immer größerem Neurocranium. „Evolution der Intelligenz“ ist keine Taktratenerhöhung.
04 · 3D-Kognitionsraum

Verschiedene Formen, nicht verschiedene Stufen.

Die Profile sind heuristisch und ordinal. Ziehen zum Rotieren, Mausrad/Pinch zum Zoomen, Punkt antippen. X/Y/Z lassen sich frei aus fünf Dimensionen wählen.

R

Online-Rekombination

Neuartige Probleme, Arbeitsgedächtnis, Planung, Inhibition, fluide Kontrolle.

K

Kompilierte Kompetenz

Evolutionär, erlernt oder durch Training bereits in Struktur/Gewichten sedimentierte Fähigkeit.

L

Dauerhaftes Lernen

Neue Erfahrung in stabile neue Fähigkeiten und Repräsentationen verwandeln.

E

Embodiment

Offene physische Welt: Wahrnehmung, Körper, Navigation, Motorik, Selbstregulation.

X

Externe Kognition

Soziale Kultur, Sprache, Schrift, Bibliothek, Datenbanken, RAG, CAS, Beweisassistenten.

Analytisch, nicht orthogonal: R, K, L, E und X sind konzeptionell unterscheidbare Dimensionen, aber weder als statistisch unabhängig noch als neurobiologisch orthogonal gemeint. In realen Organismen und KI-Systemen sind Korrelationen und Wechselwirkungen zu erwarten — etwa zwischen Embodiment und Lernen oder zwischen interner Kompetenz und externen Werkzeugen.
drag · rotate · wheel/pinch · zoom

5D-Fingerprint

Systeme überlagern

Was die Form sagt

nicht der Flächeninhalt

Frühe Homininen: stark in E und L, weil sie vollständige autonome Organismen waren; X wächst mit Technik, Übertragung und sozialen Netzen.

Lokale KI: beinahe das Negativ davon — sehr hohes K und X, schwaches L und fast kein E.

X ist dabei qualitativ doppeldeutig: Man kann externe Kognition nutzen — Bücher, Datenbanken, arXiv, Mathlib, Suchsysteme, CAS — oder zu ihrer dauerhaften kumulativen Fortschreibung beitragen. Beim heutigen lokalen System ist Xnutzen sehr stark; Xfortschreiben ist dagegen begrenzt, lokal und überwiegend menschlich angeleitet. Rückschreibpfade wie persistentes Memory und Forschungsgraph ändern daran nur graduell etwas. Menschliche Kultur verbindet beides über Generationen.

Darum kreuzen sich Rangfolgen: Ein früher Homo schlägt das lokale System bei autonomer Weltbewältigung und kontinuierlichem Lernen; das lokale System schlägt ihn bei vielen textuellen, mathematischen und kulturgesättigten Aufgaben.

Die Frage „wer ist intelligenter?“ ist ohne Aufgabe T unterbestimmt.

04b · Systemleistung & Zuverlässigkeit

Vom Rechenwert zur tatsächlichen KI-Leistung.

Hardware-Durchsatz allein sagt wenig darüber, welche KI-Abläufe auf diesem Rechner tatsächlich zuverlässig funktionieren. Inzwischen gibt es einen direkteren Maßstab: das lokale Ökosystem wurde über Monate systematisch getestet — und die Ergebnisse sind widersprüchlicher als eine einzige Zahl vermuten ließe.

48

neue Aufgaben im finalen End-to-End-Test

Testmenge, Reihenfolge, Bewertungskontrakt und Antwortschlüssel wurden vor der Ausführung festgeschrieben. Technische und fachliche Ausfälle werden getrennt erfasst.

91,67 %

fachliche Trefferquote im 48-Aufgaben-Test

44 / 48 korrekt, 4 falsch, 0 ungelöst, 0 technisch ausgefallen. Geisteswiss. & Literatur je 12/12; Mathematik & Physik je 10/12.

100 %

technische Zuverlässigkeit in diesem Test

Kein technischer Ausfall bei 48 Aufgaben. Router, Modelle und Sicherheitsschichten liefen durch; jede Aufgabe erzeugte eine auswertbare Antwort.

≈202 GiB

lokales quantisiertes 671B-Modell

Auf dem 256-GB-Mac ausführbar, unter strikter Ressourcenüberwachung. Nicht automatische Standardroute, sondern explizit angeforderter Spezialist. Reale Durchsatzrate in zwei Diagnoseläufen: ≊9–10 tok/s; Laufzeit 34–46 Min. pro Aufgabe (aufgabenspezifisch, kein allgemeiner Throughput-Benchmark).

Einschränkung: 91,67 % ist das Ergebnis eines genau definierten 48-Aufgaben-Tests — kein standardisierter Industriebenchmark und keine Behauptung, das System sei generell zu 91,67 % korrekt. „PhD-Qualifying“ bezeichnet die Einstufung der Aufgaben im Testdesign, nicht eine allgemeine Leistungsgarantie.
Auditnotiz: Einer der vier offiziellen Fehler erwies sich nach Abschluss als konventionssensitiver Antwortschlüssel-Fall (φ³-Theorie in sechs Dimensionen). Der vorab eingefrorene Benchmarkwert bleibt trotzdem unverändert 44/48. Ein Benchmark verliert seinen Wert, wenn man seine Regeln nach Kenntnis des Resultats anpasst.

Nicht ein Modell — ein kleines lokales KI-System

KomponenteTypische Rolle
Qwen3 235B MoEAnspruchsvolle Analyse, Geisteswissenschaften, Synthese
Qwen3 235B MoEAllgemeiner anspruchsvoller Default; tiefe Analyse, Geisteswissenschaften, Literatur, Synthese und breite Aufgaben
DeepSeek-R1 70BMathematik, formales und kontraintuitives Reasoning, Physik
Qwen 35B-KlasseSchnelle Steuerungs-, Planungs- und Bewertungsaufgaben
DSV4-FlashSehr lange Kontexte, zusätzliche Perspektive, Fallback
R1 671BExplizit angeforderter, langsamer Hochqualitäts-Spezialist
GLM-KlasseIsolierte Adjudikation, spezielle Agentenaufgaben

Zusätzliche Werkzeuge

über reine Chatmodelle hinaus

Retrieval: Lokaler wissenschaftlicher Bestand, lokaler arXiv-Korpus, bibliographische Pipelines, Spezialkorpora.

Formale Systeme: Lean 4 + mathlib für formale Beweise; SageMath, PARI/GP, Macaulay2, Julia, Z3 für mathematische und symbolische Berechnungen.

Infrastruktur: Wissensgraph-/Memory-Schicht, Router mit Aufgabenverteilung, rollengetrennte und teilweise blind arbeitende Prüfinstanzen.

Wichtig: Die formalen Werkzeuge sind real integriert und separat validiert. Der finale 48-Aufgaben-Test belegt jedoch keinen tatsächlichen CAS-/Lean-Einsatz und damit auch keinen kausalen Beitrag dieser Werkzeuge zu seinem 44/48-Ergebnis.

Im finalen 48er-Test deskriptiv: Qwen3 235B 23/23 C, DeepSeek-R1 70B 19/23 C, Qwen3.6 35B 2/2 C. Nicht als Modellvergleich zu lesen: Der Router wies unterschiedliche Aufgabentypen zu.

Warum das größte Modell nicht automatisch das beste System ergibt

ModellCIUTVerwertbar
R1 70B1253420/24 = 83,3 %
R1 70B1253420/24 = 83,3 %
R1 671B1320915/24 = 62,5 %

Systemvergleich, kein isoliertes Scaling-Experiment: Verglichen wurden die tatsächlich lokal eingesetzten 70B- und 671B-Repräsentationen. Quantisierung, Modellarchitektur und Runtime unterscheiden sich; die Resultate isolieren daher nicht den kausalen Effekt der Parameterzahl allein.

Bedingte Korrektheit

nur auf fertige Antworten

671B: 13/15 = 86,7 % korrekt. 70B: 12/17 = 70,6 % der akademisch aufgelösten Antworten korrekt. Das größere Modell war bei fertigen Antworten akademisch stärker — erzeugte aber unter dem experimentellen 8192-Token-Limit viel häufiger keine verwertbare Finalantwort.

Ein automatischer Router kennt das Ergebnis nicht im Voraus. Konsequenz: kein automatischer 671B-Selector. Das Modell bleibt expliziter Spezialist.

Das 671B-Limit von 8192 Tokens gilt für diesen Vergleichstest; die Production-Konfiguration erlaubt standardmäßig erheblich mehr. Bisherige Diagnose (2/9 ausgewählten Fälle): Einer erzeugte bei 24.576 Tokens eine verwertbare Finalantwort; der andere erreichte auch dieses höhere Limit erneut mit finish_reason=length. Eine bloße Erhöhung auf den Production-Default behebt also nicht alle Fälle.

Das System Die robustere Production-Architektur blieb bestehen: Der prospektiv getestete automatische 671B-Selector wurde nicht freigegeben. Genau diese Fähigkeit — nicht einfach „größer“ mit „besser“ gleichzusetzen — gehört zur eigentlichen Systemleistung.

Sehr gut geeignet

Lange wissenschaftliche Arbeit: Große Modelle verarbeiten Primärtexte, wissenschaftliche Literatur und umfangreichen Kontext lokal; Retrieval und Spezialkorpora einbindbar.

Mathematik & Physik mit Sicherungsebenen: Reasoning-Modelle kombinierbar mit Lean, SageMath, PARI/GP — Behauptungen formal oder rechnerisch prüfbar, nicht nur durch ein zweites LLM „bestätigt“.

Datenschutzkritische Arbeit: Die LLM-Inferenz und zu analysierende Dokumente können vollständig lokal bleiben; es ist keine externe LLM-API erforderlich. Externe Recherchequellen sind davon getrennte, optionale Dienste.

Langsame Spezialisten: 671B lokal als Eskalationsstufe nutzbar, wenn Qualitätssteigerung die lange Laufzeit rechtfertigt.

Nicht als pauschale Behauptung belegt

„Das System ist zu 91,67 % richtig.“ Nein — das gilt für einen genau definierten 48-Aufgaben-Test.

„671B ist besser als 70B.“ Bei fertigen Antworten war 671B stärker; End-to-End war seine technische Zuverlässigkeit deutlich schlechter.

„Formale Werkzeuge verhindern Halluzinationen.“ Sie können Aussagen verifizieren, wenn sie korrekt eingesetzt werden; allein ihre Installation ändert nichts.

„Ein Desktop ersetzt Frontier-Rechenzentren.“ Die Stärke liegt in lokaler Kapazität, Datenschutz und Auditierbarkeit — nicht im Rechenzentrumsdurchsatz.

Die wichtigste Erkenntnis: Die Qualität des Gesamtsystems entsteht erst eine Ebene über der Hardware — aus dem Zusammenspiel von großen lokalen Modellen, passender Spezialisierung, Retrieval, formalen Werkzeugen, rollengetrennter Bewertung, Ressourcenüberwachung und der Bereitschaft, negative Ergebnisse stehenzulassen.

Methodischer Hinweis: Die genannten Prozentwerte sind interne, vorab festgelegte Projekttests und keine allgemein standardisierten Benchmarks. Nicht direkt vergleichbar mit MMLU-, GPQA- oder kommerziellen Chatbot-Benchmarks. Stand: 29. August 2026. Familiengeclustertes 95 %-Bootstrap-Intervall der Trefferquote: 81,25 %–100 % (12 Familien, 20.000 Resamples). SHA-256 des geschlossenen finalen 48-Aufgaben-Tests: 2f50add0…ba39e112.

05 · Kompilierte Kognition

Rechenarbeit kann vor dem Problem stattgefunden haben.

Die tiefe Gemeinsamkeit zwischen Tier-Sensomotorik, trainiertem LLM und kumulativer Kultur: teure Suche wird in wiederverwendbare Struktur verwandelt.

Biologiephylogenetisch + ontogenetisch
Millionen Jahre
Evolution
Entwicklung +
Lernen
Millisekunden
Kontrolle
LLMoffline training → inference
Architektur +
Datenkurierung
Pretraining +
Posttraining
Sekunden
Inference
Kulturkollektive externe Kognition
Generationen
Entdeckung
Schrift, Formel,
Werkzeug
Minuten
Anwendung
Moravecs Paradox lässt sich so neu lesen: „mühelos“ heißt biologisch oft nicht „rechenarm“, sondern „über Evolution und Lernen extrem gut kompiliert“. Das Tier löst das Kontrollproblem nicht jedes Mal durch bewusste Suche — genau wie ein LLM sein Weltwissen nicht bei jedem Prompt neu trainiert.

Warum „kristallisiert“ nur halb passt

Cattell → breiterer Begriff

Cattells frühe Formulierung kristallisierter Fähigkeit bezog sich auf lang etablierte diskriminative Gewohnheiten, die ursprünglich unter Einsatz allgemeiner Fähigkeit erworben wurden. Das erklärt die Intuition hinter automatisierten Fertigkeiten.

Für Evolution, Motorik und LLM-Gewichte ist jedoch kompilierte Kompetenz der sauberere Oberbegriff: Er behauptet keine psychometrische Identität mit modernem Gc.

Sensorimotorik als gespeicherte Lösung

K ↔ E

Der menschliche Cortex und das Cerebellum enthalten extrem unterschiedliche Neuronenzahlen und Mikroarchitekturen. Schon das zerstört „ein Neuron = eine Einheit abstrakter Intelligenz“.

Vorhersage, Fehlerlernen und anticipatorische Kontrolle liefern ein funktionales Beispiel dafür, wie Erfahrung in schnelle Regelung übersetzt wird.

06 · Task-Abhängigkeit

Wer „gewinnt“, hängt von T ab.

Die Balken sind qualitative Illustrationen, keine Messdaten. Sie zeigen nur, wie radikal ein Ranking beim Wechsel der Aufgabe kippt.

Offene physische Welt · Nahrung, Gefahr, Navigation

H. erectus
lokale KI

Neue sensomotorische Fertigkeit über Wochen lernen

H. erectus
lokale KI

Literatur zu Proklos/Mathematik suchen und synthetisieren

H. erectus
lokale KI

Algebraisches Resultat mit Sage/Lean/PARI prüfen

früher Homo
lokale KI
Besser als ein skalarer Intelligenzwert:
P(T) = F(H, R, K, L, E, X ; T)
H = Hardware/Substrat · R/K/L/E/X = kognitives Profil · T = konkrete Aufgabe
Schema, kein kalibriertes Modell: keine bekannten Gewichte, keine behauptete berechenbare Form von F.
07 · Das lokale System

Nicht ein Gehirn — ein kognitives Verbundsystem.

Der aktuelle lokale Stack koppelt mehrere trainierte Modelle mit Retrieval, persistentem Gedächtnis und exakten symbolischen Werkzeugen. Das verändert vor allem K und X.

Repräsentative Kernmodelle · kompiliertes K

  • Qwen3 235B‑A22B · ≈22B aktiv
  • DeepSeek‑R1 Distill 70B · dense
  • Qwen3.6 35B‑A3B · schneller Steuerungs-/Interpreterpfad
  • DSV4‑Flash · Long-Context-/Diversity-/Fallback-Pfad
  • DeepSeek‑R1-0528 671B · stark quantisierter expliziter Heavy-Spezialist
  • GLM‑5-Klasse · ≈40B aktiv · isolierte Adjudikation/Agentik

Router · R-Orchestration

  • semantische Modellwahl
  • epistemischer Guard
  • Health-Probes
  • Tool- und Retrievalpfade
  • Session-/Slow-Memory

Externe Kognition · X

  • lokales arXiv + Vektorindizes
  • Neo4j Knowledge Graph
  • SageMath · PARI/GP · Macaulay2
  • Lean 4 · Julia
  • SearXNG / explizite Recherche

Modellarbeit pro Token · grobe FLOP-Äquivalente

≈2 × aktive Parameter
Q3
Qwen3‑235B‑A22B
≈44 GFLOP/tok.
R1
DeepSeek‑R1 Distill 70.6B dense
≈141 GFLOP/tok.
G5
GLM‑5 family · ≈40B aktiv
≈80 GFLOP/tok.

Die 2N-Regel ist nur eine erste Forward-Pass-Abschätzung („model-FLOP-equivalent“). Quantisierung, Attention, MoE-Routing, KV-Cache und Backend machen daraus keine physisch gemessenen FP16-Operationen des Macs.

Warum wenig raw FLOP viel Kompetenz tragen kann

Inference ≠ Training

Das Modell führt bei einer Frage nicht sein Pretraining erneut aus. Training hat statistisch-semantische Regularitäten bereits in Gewichte verdichtet. Das lokale System ergänzt diese Gewichte durch externe Such-, Rechen- und Beweiswerkzeuge.

Die momentane Rechenlast ist deshalb nur der letzte Abschnitt einer langen kausalen Kette aus Evolution/Kultur bzw. Architektur/Training.

08 · Synthese

Was kann man am Ende wirklich sagen?

Vier Aussagen bleiben robust, auch wenn einzelne Zahlen künftig revidiert werden.

01

Raw compute

Der einzelne M3 Ultra liegt deutlich unter dem hier verwendeten 10¹⁵-FLOP/s-Suffizienzanker und — in der ausdrücklich künstlichen Toy-Skalierung — deutlich unter den Frühhomininenwerten.

02

Profile kreuzen sich

Biologische Organismen dominieren bei Embodiment und dauerhaftem Lernen; das lokale System kann bei symbolischer, kulturgesättigter Arbeit dominieren.

03

Kompilation zählt

Evolution, individuelles Lernen, Pretraining und Kultur verschieben Problemlösearbeit zeitlich nach vorn und konservieren Lösungen in Struktur.

04

Task first

Es gibt ohne Aufgabe T keinen seriösen skalaren Vergleich „Mac gegen Gehirn“. Die richtige Frage lautet: welche Funktion, welche Vorarbeit, welche externen Stützen?

Der M3 Ultra ist weder „Mäusegehirn“ noch „Frühmensch im Kasten“. Das lokale System ist kategorial anders: relativ begrenzter momentaner Siliziumdurchsatz, sehr stark kompilierte Modellkompetenz und ungewöhnlich große externe symbolische Erweiterung.
09 · Methodik & Grenzen

Wo die Zahlen enden und die Analogie beginnt.

Messwerte, Literaturanker, Toy-Rechnungen, heuristische Profile und empirische Systemtests werden ausdrücklich getrennt. Empirische Systemtests: RM15, RM16 und RM17 messen das konkrete lokale KI-System unter jeweils vorab festgelegten Bedingungen; ihre Resultate gelten nur innerhalb des jeweiligen Testdesigns und werden nicht mit den Toy- oder Profilwerten verrechnet.

Gemessen / inventarisiert: Hardwarekonfiguration und Speicherbandbreite (Apple), lokale Modellgrößen und Dienste (read-only Systemhandbuch), publizierte Neuronenzahlen rezenter Primaten, fossile Endocast- und Morphometriedaten.

Literaturanker: Moravecs Retina-Hochrechnung und Carlsmiths FLOP/s-Suffizienzschätzung sind unterschiedliche Methoden und unterschiedliche Einheiten. Sie werden nicht als Naturkonstanten behandelt.

Toy-Rechnung: Frühhomininen-„Ops/s“ sind keine fossilen Messwerte. Sie entstehen nur, indem ECV/Primatenskalierung auf einen modernen menschlichen Rechenanker projiziert wird. Ihr Zweck ist zugleich Größenordnung und Fragilität eines eindimensionalen Rankings sichtbar zu machen.

5D-Profile: R/K/L/E/X sind eine analytische Taxonomie dieser Seite. Die Intervalle sind bewusst heuristisch, ordinal und evidenzgewichtend; sie sind weder psychometrische Scores noch paläoanthropologische Messwerte.

Nicht behauptet: Bewusstsein, subjektives Erleben, menschliche Generalität, neuronale Homologie oder eine FLOP↔Synapsen-Konversion.

10 · Quellen

Quellenbasis & technische Dokumentation.

Prüfstand: 13. August 2026 (Quellen 01–21); Systemtests RM15, RM16 und RM17.1.1A: 29. August 2026. Externe Engineering-Schätzungen sind als solche gekennzeichnet.

Apple — Mac Studio (2025), Technical Specifications. M3 Ultra: bis 32‑Core CPU, 80‑Core GPU, 32‑Core Neural Engine, 819 GB/s; Unified Memory bis 512 GB konfigurierbar. Das hier verwendete System besitzt 256 GB.
EXO Labs — DGX Spark + M3 Ultra. Engineering-Annahme ≈26 TFLOP/s FP16.
Community-Projekt guruswami-ai/mlx-benchmarks — systematische MLX-Inferenzbenchmarks; verwendet ≈28 TFLOP/s FP16 als Compute-Modell.
Joseph Carlsmith (2020) — How Much Computational Power Does It Take to Match the Human Brain?. 10¹⁵ FLOP/s als subjektiver Suffizienz-/Mediananker; große Unsicherheit.
Hans Moravec (2003) — Robots, After All. Retina als „Rosetta Stone“; riskante Hochrechnung auf ≈10¹⁴ Instruktionen/s.
Herculano-Houzel (2009) — The Human Brain in Numbers. ≈86 Mrd. Neuronen; Cortex ≈16 Mrd.; Cerebellum ≈69 Mrd.
Miall (1998) — The cerebellum, predictive control and motor coordination. Klassische Formulierung der Forward-Model-Hypothese für prädiktive Zustandsabschätzung und Online-Motorsteuerung; hier nur als funktionales Beispiel, nicht als vollständige Theorie des Cerebellums verwendet.
Herculano-Houzel, Mota & Lent (2006), PNAS — Cellular scaling rules for rodent brains. Maus ≈70,9 Mio. und Ratte ≈200,1 Mio. Gesamtneuronen in der zugrunde liegenden Stichprobe.
Tattersall (2023) — Endocranial volumes and human evolution. Quelle der auf der Seite verwendeten repräsentativen ECV-Mittelwerte; Taxonomie und Stichproben werden dort ausdrücklich differenziert.
Gunz et al. (2020), Science Advances. A. afarensis: ape-like brain organization und verlängertes Gehirnwachstum.
Ponce de León et al. (2021), Science. Früher Homo/Dmanisi: primitive Frontalorganisation; abgeleitetere Organisation später.
Hubbe & Harvati (2026), Nature Communications. 3D-Kranialmorphometrie: geringe Unterstützung für einfache graduelle Richtungsselektion.
Stout et al. (2015), PLOS ONE. Experimentelle Neuroarchäologie: Acheuléen, dorsale präfrontale Kontrolle und strategische Urteile.
Woolgar et al. (2010), PNAS. Fluide Intelligenz und frontal-parietales Multiple-Demand-Netz.
Cattell (1943), Psychological Bulletin. Frühe Unterscheidung fluid vs. crystallized.
Kirby, Cornish & Smith (2008), PNAS. Iteriertes Lernen und kumulative kulturelle Struktur.
Qwen Team — Qwen3. Qwen3‑235B‑A22B: 235B total, 22B pro Token aktiviert.
DeepSeek — R1 repository. Distill-Llama-70B als dense 70B-Distillmodell.
Z.ai — GLM‑5 model card. 744B Gesamtparameter, ≈40B aktiv; Architekturreferenz für den großen GLM-Pfad.
Autark Data — Lokales KI-Ökosystem und read-only Systeminventar vom 13.08.2026. Lokale Modelle, Router, Retrieval, Memory und symbolische Werkzeuge.
AUTARK Academic V3 — finaler 48-Aufgaben-Benchmark (RM15.12.28). C44 / I4 / U0 / T0 · 91,67 % fachlich korrekt · 100 % technische Reliability. SHA-256: 2f50add0…ba39e112.
AUTARK Academic V3 — RM16 matched R70-vs-R671 closure. R70 20/24 verwertbar · R671 15/24 verwertbar (exp. max_tokens=8192) · automatischer R671-Selector: REJECT. SHA-256: 0d825df9…e42054.
AUTARK Academic V3 — RM17.1.1A selected-failure budget diagnostic. 2/9 Diagnoseläufe bei max_tokens=24576: 1 recovered, 1 erneut finish_reason=length. SHA-256: 4a175a8e…749043af.
AUTARK Academic V3 — RM15.12.20 Final Architecture Freeze. Eingefrorene Production-Rollen: Qwen3-235B für Deep-Analysis/Philosophie/Synthese/Breadth; DeepSeek-R1 70B für Math/Proof/Formal/Counter-intuitive; Qwen3.6 für Control/Planner/Evaluator; DSV4 für Very-long/Document/Diversity/Fallback; GLM für isolierte Adjudication/Agentic; R1-671B als explizite High-Quality-Lane ohne automatischen Selector. SHA-256: ffa5569d50be4b53b2ad8d55ecdb60845f2714c3cacbc7cafd8d536041f83ac8.