Alle artikelen
2 min leestijd

OpenAI bouwt zijn eigen silicium om de gigantische rekening van miljoenen agent-loops te drukken

Door AI Gekkie ·

OpenAI gaf tijdens de Hot Chips 2026-conferentie in augustus 2026 volledige openheid over Jalapeño, zijn eerste op maat gemaakte AI-inference chip die samen met Broadcom en TSMC op een 3nm-procedé is ontwikkeld, meldt SemiAnalysis. De blank-slate ASIC is specifiek ontworpen om grote taalmodellen te draaien in gigawatt-datacenters en levert volgens OpenAI 1,5 tot 1,9 keer meer rekenkracht per watt dan Nvidia Blackwell-systemen, aldus Tom's Hardware. Met 216 GB snel HBM4-geheugen en 64 gekoppelde reken- en geheugenslices optimaliseert OpenAI de volledige stack van modelarchitectuur tot silicium. Opmerkelijk: OpenAI ontwierp de chip in slechts 16 maanden door zijn eigen AI-modellen in te zetten voor het chiplay-out- en verificatieproces, meldt TechRepublic.

Een chip die maar één ding hoeft te kunnen

Traditionele GPU's van marktleiders zoals Nvidia zijn universele rekenmonsters: ze kunnen graphics renderen, fysica simuleren en modellen trainen. Maar zodra miljoenen gebruikers en autonome agents continu tokens opvragen bij een getraind model, is die universele flexibiliteit vooral dure ballast en energieverspilling, meldt SemiAnalysis.

Jalapeño gooit alle overbodige hardwareballast overboord. Door de chip uitsluitend in te richten voor transformer-inference en autoregressieve decodering haalt OpenAI maximale doorvoer met minimale latency, precies wat nodig is om complexe redeneer- en multi-agent workflows betaalbaar te houden.

Waarom geheugenbandbreedte de echte bottleneck is

Bij het genereren van tekst en redeneerketens zit de vertraging vrijwel nooit in de rekenkernen, maar in het ophalen van gewichten en context uit het werkgeheugen. Wie duizenden agent-sessies tegelijk wil bedienen, loopt direct vast op de geheugenbandbreedte.

Met 216 GB HBM4-geheugen per chip en een ruimtelijke NUMA-architectuur met 64 slices kan Jalapeño gigantische contextwindows en zware redeneermodellen direct in snel geheugen houden, aldus Tom's Hardware. Hierdoor schalen parallelle agent-taken zonder de dramatische snelheidsval die optreedt wanneer geheugenlijnen overbelast raken.

De AI die zijn eigen hardware tekent

Het ontwikkelen van een state-of-the-art 3nm-chip kostte vroeger jaren en legers aan hardware-engineers. OpenAI bracht de doorlooptijd terug tot slechts 16 maanden — waarvan negen maanden van tekentafel tot tape-out — door eigen AI-modellen in te zetten voor timinganalyse, routering en testgeneratie, meldt TechRepublic.

Het markeert een kantelpunt waarin AI niet alleen software schrijft, maar ook de fysieke halfgeleiders ontwerpt waarop de volgende generatie modellen sneller en goedkoper moet draaien.

Wat dit betekent

Voor OpenAI is Jalapeño een strategisch wapen: door niet meer afhankelijk te zijn van torenhoge GPU-marges van externe leveranciers, kan het bedrijf de operationele kosten van gigantische datacenter-investeringen drastisch verlagen. Maar het betekent ook dat OpenAI's infrastructuur steeds meer een gesloten, verticaal geïntegreerd cloud-fort wordt.

Tegenover die gecentraliseerde datacenters staat de filosofie van aioffline.nl: rekenkracht en modellen die je lokaal bezit, op hardware die van jou is, zonder afhankelijk te zijn van gesloten cloudplatformen die bepalen wat een token kost of wie toegang krijgt.

🤖 Verdiep of relativeer dit artikel

Plak deze prompt in ChatGPT, Claude of een andere chatbot om dieper op dit onderwerp in te gaan, of het juist te laten tegenspreken.

Reageren? Volgend artikel
💬