Semiconductori de generație următoare: Cum inteligența artificială și supercomputerele depășesc limitele tranzistoarelor mai mici

Răspunsul scurt: Câștigurile inteligenței artificiale provin acum din întregul sistem de semiconductori

Următoarea generație de hardware pentru inteligența artificială și supercomputer nu este alimentată de o singură descoperire. Este construită din mai multe tehnologii care trebuie să funcționeze împreună: tranzistoare gate-all-around, alimentare backside, arhitecturi chiplet, împachetări avansate, memorie cu lățime de bandă mare, legături die-to-die mai rapide și o creștere a interfețelor optice. Rezultatul practic este mai multă putere de calcul, mai multă lățime de bandă a memoriei și o scalare mai bună, fără a se baza doar pe dimensiuni mai mici ale tranzistoarelor.

Acest lucru contează deoarece acceleratoarele moderne de inteligență artificială și supercomputerele științifice se confruntă adesea cu limite de transfer de date și de putere înainte de a epuiza capacitatea aritmetică brută. Un motor matricial mai rapid ajută doar dacă ponderile modelului, activările și rezultatele intermediare îl pot atinge suficient de repede. În mod similar, adăugarea mai multor acceleratoare ajută doar dacă pachetul, rețeaua de rack-uri, sistemul de memorie, sistemul de răcire și stiva de software le pot menține ocupate.

Prim-plan al unui modul accelerator multi-cip cu pachete de memorie stivuite în fața unor rack-uri de servere răcite cu lichid
Un modul accelerator multi-cip cu mai multe pachete de memorie suprapuse ilustrează direcția hardware-ului modern de inteligență artificială: calculul, memoria, împachetarea, furnizarea de energie și răcirea sunt proiectate din ce în ce mai mult ca un singur sistem.

1. Noile structuri ale tranzistoarelor îmbunătățesc eficiența, dar reprezintă doar punctul de plecare

Logica de vârf depășește structura FinFET care a dominat cipurile avansate ani de zile. Design-urile de tip „gate-all-around” sau GAA înfășoară poarta în jurul unei nano-folii sau a unei structuri de canal similare, oferind proiectanților de cipuri un control electrostatic mai strict pe măsură ce caracteristicile se micșorează. Acest lucru poate îmbunătăți performanța, reduce scurgerile sau oferă un echilibru mai bun între cele două.

TSMC afirmă că procesul său N2 de 2 nanometri a intrat în producția de volum în al patrulea trimestru al anului 2025, în timp ce tehnologia sa A16 combină tranzistoare nano-pliuri cu o linie de alimentare din spate, destinată în special produselor de calcul de înaltă performanță cu nevoi dense de furnizare a energiei. TSMC a declarat că producția de volum a A16 este programată pentru a doua jumătate a anului 2026. Consultați pagina despre tehnologia A16 a turnătoriei și raportul anual pe 2025 .

Intel urmează o direcție similară cu Intel 18A. Procesul său combină tranzistoarele RibbonFET GAA cu alimentarea prin backside PowerVia. Intel raportează că modelul 18A a intrat în producție în 2025, în timp ce versiunea îmbunătățită 18A-P a intrat în producție cu risc în iunie 2026. Intel publică, de asemenea, informații comparative privind performanța, puterea și densitatea nodului; aceste cifre sunt raportate de furnizor și ar trebui validate în raport cu un design specific, mai degrabă decât tratate ca câștiguri universale la nivel de cip. Detaliile actuale se găsesc pe pagina Intel dedicată procesului 18A .

Alimentarea cu energie electrică din spate este importantă deoarece cipurile avansate trebuie să direcționeze atât semnalele, cât și energia electrică prin cabluri extrem de dense. Mutarea unei părți din rețeaua de alimentare cu energie electrică în spate poate elibera resurse de rutare pe partea semnalului și poate îmbunătăți furnizarea tensiunii. Pentru acceleratoarele de inteligență artificială, unde rețele mari de unități de calcul comută la rate mari, acest lucru poate fi la fel de important ca densitatea tranzistoarelor.

2. Chipleturile și ambalajele avansate transformă un pachet într-un sistem de calcul de mici dimensiuni

Pe măsură ce cresc, matrițele monolitice devin mai greu și mai scumpe de scalat. Chipleturile oferă o altă cale: funcții separate pot fi fabricate pe tehnologii de proces care li se potrivesc cel mai bine, apoi conectate într-un singur pachet. O matriță de calcul poate necesita cel mai avansat proces logic, în timp ce I/O, memoria cache, circuitele analogice sau alte funcții pot să nu aibă nevoie.

Împachetarea este ceea ce face ca acest lucru să fie practic. Platforma avansată de packaging CoWoS de la TSMC , de exemplu, este concepută pentru a integra mai multe dispozitive logice și stive de memorie cu lățime de bandă mare într-o capsulare 2.5D. TSMC poziționează CoWoS în mod specific pentru produsele AI și HPC, unde conexiunile scurte și largi dintre calcul și HBM sunt critice.

De asemenea, apar standarde pentru a face chipleturile mai puțin proprietare. Specificația UCIe 3.0 , lansată în august 2025, acceptă rate de transfer de date de 48 GT/s și 64 GT/s și adaugă caracteristici pentru eficiență energetică, gestionabilitate și sisteme multi-cip mai flexibile. UCIe nu face chipleturile interschimbabile peste noapte, dar oferă industriei un cadru electric și de protocol comun pentru legăturile integrate în pachet.

Această abordare este deosebit de atractivă atunci când o companie dorește să construiască mai multe variante de acceleratoare din blocuri de construcție reutilizabile. Este mai puțin atractivă atunci când costul pachetului, densitatea termică sau complexitatea designului depășesc beneficiul modularității. Un produs mai mic, cu nevoi modeste de memorie și I/O, poate fi totuși mai bine deservit de un dispozitiv monolitic mai simplu.

3. Memoria cu lățime de bandă mare devine la fel de strategică ca acceleratorul în sine

Sarcinile de lucru bazate pe inteligență artificială mută în mod repetat tensori mari între memorie și unități de calcul. Acest lucru face ca lățimea de bandă a memoriei să fie o constrângere de proiectare de ordinul întâi. Memoria cu lățime de bandă mare, sau HBM, abordează problema prin stivuirea matrițelor DRAM și plasarea lor fizic aproape de accelerator printr-o interfață foarte lată.

HBM4 trece acum de la limbajul de tip „roadmap” la sistemele comerciale. Samsung a anunțat livrări comerciale de HBM4 în februarie 2026 și a declarat că produsul său a intrat în producția de masă cu o rată de transfer susținută de 11,7 Gb/s, cu o capacitate de până la 13 Gb/s. În mai 2026, Samsung a anunțat, de asemenea, livrarea de mostre HBM4E. Aceste detalii sunt disponibile în anunțul Samsung privind producția de HBM4 .

În rezultatele sale din al doilea trimestru al anului 2026, SK Hynix a anunțat că a început livrările în masă de HBM4 în cursul trimestrului și că intenționează să intensifice producția în a doua jumătate a anului. Compania a livrat, de asemenea, mostre de HBM4E cu 12 straturi. Consultați rezultatele SK Hynix din trimestrul 2 al anului 2026 pentru starea actuală.

De ce contează acest lucru în practică? Specificațiile actuale Vera Rubin de la NVIDIA listează 288 GB de HBM4 pe un GPU Rubin și 19,2 TB/s de lățime de bandă a memoriei GPU. Prin comparație, acceleratoarele din seria MI350 de la AMD utilizează HBM3E; AMD listează până la 288 GB și 8 TB/s pentru MI355X. Acestea sunt arhitecturi diferite și nu ar trebui comparate doar pe baza unei cifre de lățime de bandă, dar ambele ilustrează modul în care capacitatea memoriei și lățimea de bandă sunt acum specificații de bază ale acceleratorului, mai degrabă decât detalii secundare. Consultați specificațiile oficiale NVIDIA Vera Rubin NVL72 și pagina AMD Instinct MI350 Series .

4. Interconexiunile de tip scaling-up și scaling-out determină dacă mai multe acceleratoare acționează ca unul singur

Modelele mari și simulările științifice rareori se potrivesc perfect pe un singur dispozitiv. Sistemul trebuie să împartă munca între mai multe acceleratoare și să facă schimb frecvent de rezultate parțiale. Dacă comunicarea este lentă, unitățile de calcul scumpe stau inactive.

De aceea, structurile structurale proprietare de tip scale-up avansează alături de GPU-urile în sine. Platforma Rubin de la NVIDIA utilizează NVLink de a șasea generație; NVIDIA listează o lățime de bandă NVLink de 3 TB/s per GPU Rubin și 216 TB/s pe un sistem NVL72. AMD utilizează Infinity Fabric pe platformele sale de accelerare. Pentru cumpărători, întrebarea importantă nu este doar lățimea de bandă maximă a legăturii, ci și modul în care se comportă structura structurală în funcție de operațiunile colective exacte, modelele paralele cu modelul și topologia utilizate de aplicație.

La nivel de memorie de sistem, Compute Express Link este, de asemenea, în continuă evoluție. Consorțiul CXL afirmă că CXL 4.0 dublează viteza de semnalizare de la 64 GT/s la 128 GT/s, adaugă porturi incluse și extinde funcțiile de fiabilitate a memoriei. CXL este relevant atunci când arhitecții doresc o extindere coerentă a memoriei, pooling sau dezagregare fără a trata fiecare nivel de memorie ca un dispozitiv de stocare la distanță.

5. Fotonica pe siliciu se apropie de siliciul de comutare

Cuprul rămâne excelent pentru conexiuni electrice scurte și dense, dar legăturile optice devin din ce în ce mai atractive pe măsură ce distanța și lățimea de bandă agregată cresc. Un pas important următor este optica co-ambalată, în care componentele optice sunt mutate mai aproape de ASIC-ul de rețea în loc să se afle în întregime în transceivere conectabile la marginea unui comutator.

NVIDIA afirmă că platforma sa Spectrum-X Ethernet Photonics utilizează optică integrată și raportează o eficiență energetică a rețelei de până la 5 ori mai bună decât modelele tradiționale de transceivere conectabile. Aceasta este o comparație între furnizori, nu o garanție pentru fiecare topologie de centru de date, dar evidențiază direcția în care se află lucrurile: alimentarea rețelei devine suficient de importantă încât integrarea optică face acum parte din proiectarea sistemelor semiconductoare. Consultați prezentarea generală a fotonicii pe siliciu de la NVIDIA .

Ce înseamnă acest lucru pentru sarcinile de lucru reale legate de inteligența artificială și supercomputer

Sarcină de lucruCaracteristicile semiconductorilor de prioritizatDe ce contează
Pre-antrenament pentru modele mariCapacitate și lățime de bandă HBM, legături rapide de scalare, carcase dense, răcire puternicăAntrenamentul constă în mare măsură în mișcarea tensorală și comunicarea sincronizată între mai multe acceleratoare.
Inferență agentială și contextuală lungăPool-uri HBM mari, calcul eficient cu precizie redusă, lățime de bandă mare de interconectare, suprapunere de memorie pe niveluriCache-ul KV și pașii de raționament repetați pot face ca capacitatea memoriei și mișcarea datelor să fie mai limitative decât numărul maxim de FLOPS-uri.
HPC științificCapacitate FP64, lățime de bandă a memoriei, interconexiuni fiabile, biblioteci numerice matureCodurile de simulare depind adesea de precizie dublă și lățime de bandă susținută, mai degrabă decât doar de randament tensorial de precizie scăzută.
Inferență la nivel de întreprinderePerformanță per watt, compatibilitate software, memorie de dimensiuni potrivite, opțiuni de implementare PCIeCel mai bun sistem ar putea fi unul care se potrivește serverelor și anvelopelor de alimentare existente, mai degrabă decât arhitectura rack cu cea mai mare densitate.
Acceleratoare personalizateStrategie pentru chipleți, ecosistem de ambalaje, suport UCIe, maturitate a procesuluiModularitatea poate scurta ciclurile de reutilizare, dar complexitatea ambalajelor și calificarea lanțului de aprovizionare pot compensa beneficiul.

Un exemplu concret: de ce un GPU mai rapid nu este suficient

Să luăm în considerare o echipă care deservește un model lingvistic extins, cu ferestre de context lungi. Să presupunem că profilarea arată că GPU-urile așteaptă frecvent transferuri de memorie și comunicare între GPU-uri. Trecerea la un accelerator mai nou ar putea ajuta, dar numai dacă noul sistem oferă și suficientă capacitate HBM, o lățime de bandă a memoriei mai rapidă și o topologie care reduce blocajele de comunicare. Achiziționarea unui dispozitiv cu performanțe tensoriale teoretice mai bune, păstrând în același timp aceleași blocaje de memorie și de rețea, ar putea oferi o îmbunătățire mult mai mică decât sugerează specificația principală.

Același principiu apare și în supercalculul tradițional. Sistemul Frontier al Laboratorului Național Oak Ridge combină acceleratoarele AMD MI250X cu HBM și o interconectare de sistem de mare viteză. Ghidul utilizatorului Frontier documentează modul în care funcționează împreună calculul, HBM, legăturile CPU-GPU și rețeaua Slingshot. Generația hardware este mai veche decât cele mai noi platforme de inteligență artificială din 2026, dar lecția arhitecturală este încă actuală: performanța susținută a aplicațiilor depinde de calea dintre calcul, memorie și alte noduri.

Când merită modernizarea hardware-ului semiconductor de generație următoare?

O modernizare este cea mai justificabilă atunci când rezolvă o problemă semnificativă, în loc să înlocuiască pur și simplu o piesă mai veche. Înainte de a vă angaja într-o nouă generație de acceleratoare, verificați următoarele:

  • Presiune asupra memoriei: Modelul sau simularea se revarsă în memoria gazdă, necesită puncte de control agresive sau forțează un grad incomod de partiționare a modelului?
  • Presiune asupra lățimii de bandă: Nucleele sunt limitate de memorie în profilare sau acceleratoarele petrec un timp semnificativ așteptând operațiunile all-reduce și alte operațiuni colective?
  • Alimentare și răcire: Pot rack-ul, instalația și bucla de răcire să suporte noua densitate de putere? Performanța mai mare poate fi totuși o opțiune nepotrivită dacă modernizările infrastructurii domină costurile.
  • Pregătire software: Sunt compilatorul, bibliotecile, nucleele, stiva de orchestrare și instrumentele de monitorizare mature pentru noua arhitectură?
  • Cerințe de precizie: Poate sarcina de lucru să utilizeze în siguranță formate cu precizie mai mică sau necesită FP64 sau o altă cale de precizie mai mare?
  • Utilizare: Va menține volumul de lucru noul hardware suficient de solicitat pentru a-i justifica costul? Capacitatea inactivă nu devine economică deoarece cipul este mai nou.

Compromisurile devin mai fizice

Progresul în domeniul semiconductorilor produce capacități impresionante, dar factorii limitatori sunt din ce în ce mai tangibili. Carcasele avansate sunt mai mari și mai dificil de fabricat. Stivele HBM concentrează căldura în apropierea logicii de mare putere. Sistemele la scară rack pot necesita răcire cu lichid, distribuție densă a energiei și rețele specializate. Optica co-ambalată poate reduce puterea de rețea, dar introduce noi considerații de fabricație și service. Chipleturile pot îmbunătăți modularitatea, dar adaugă validare, împachetare și gestionare a randamentului.

Există, de asemenea, un compromis software. Aritmetica de precizie scăzută, cum ar fi FP8, FP6 sau FP4, poate crește considerabil randamentul inteligenței artificiale, dar software-ul trebuie să păstreze calitatea modelului. Codurile științifice pot să nu poată utiliza aceleași scurtături. O caracteristică a semiconductorilor este valoroasă numai atunci când stiva de aplicații o poate exploata fără a încălca cerințele de precizie sau fiabilitate.

Ce să urmărești în continuare

Pentru restul anului 2026 și începutul anului 2027, cele mai utile semnale nu sunt doar numele noilor noduri. Urmăriți dacă procesele A16 de la TSMC și familia 18A de la Intel se integrează în produse pentru clienții largi; cât de repede HBM4 și HBM4E devin disponibile la scară largă; dacă UCIe 3.0 creează o interoperabilitate semnificativă a chipletelor multi-vendor; unde apare CXL 4.0 în sistemele de producție; și dacă optica co-ambalată se dovedește economică și funcțională la scară largă.

Aceste etape importante vor arăta dacă industria semiconductorilor poate continua să extindă inteligența artificială și supercomputerele fără a permite ca mișcarea memoriei, furnizarea de energie, crearea de rețele și răcirea să consume câștigurile obținute de logica mai densă.

Concluzie

Viitorul inteligenței artificiale și al supercomputerelor este alimentat mai puțin de un singur „nod următor” și mai mult de ingineria coordonată a semiconductorilor. Tranzistoarele GAA și alimentarea backside îmbunătățesc fundația logică. Chipleturile și ambalajele avansate permit proiectanților să asambleze sisteme mai mari decât poate oferi confortabil un singur die. HBM4 alimentează acceleratoarele la lățime de bandă extremă. UCIe, CXL, NVLink, Infinity Fabric și rețelele optice mută datele pe domenii progresiv mai mari.

Dacă alegeți hardware, începeți cu blocajul real al sarcinii de lucru. Pentru inteligența artificială limitată la memorie, acordați prioritate capacității și lățimii de bandă HBM. Pentru antrenamentul distribuit, acordați prioritate structurii de scalare verticală și orizontală. Pentru calculul științific, verificați performanța FP64 și a bibliotecii. Pentru implementarea la nivel de întreprindere, includeți în decizie alimentarea, răcirea, suportul software și efortul de integrare. Cel mai rapid semiconductor pe hârtie nu este automat cel mai rapid sau cel mai economic sistem pentru sarcina de lucru.

Referințe primare

Lasă un comentariu

Îngrijirea seniorilor bazată pe tehnologie în 2026: Ce pot face - și ce nu pot face - inteligența artificială și casele inteligente pentru îmbătrânirea la domiciliu

Îngrijirea seniorilor bazată pe tehnologie în 2026: Ce pot face - și ce nu pot face - inteligența artificială și casele inteligente pentru îmbătrânirea la domiciliu

Un ghid practic pentru 2026 despre inteligența artificială, senzorii pentru case inteligente, monitorizarea de la distanță, siguranța în caz de cădere, confidențialitate și cum tehnologia poate sprijini îmbătrânirea la domiciliu fără a înlocui îngrijirea.

Planificare urbană bazată pe date: Construirea de orașe inteligente sustenabile și accesibile pietonilor

Planificare urbană bazată pe date: Construirea de orașe inteligente sustenabile și accesibile pietonilor

Aflați cum orașele pot transforma datele privind mobilitatea, utilizarea terenurilor, clima și comunitatea în cartiere mai sigure, mai ecologice și mai accesibile pietonilor, fără a pune tehnologia mai presus de oameni.

Unde să studiezi ingineria UAV în 2026: Cele mai bune programe aerospațiale în funcție de obiectivul de carieră

Unde să studiezi ingineria UAV în 2026: Cele mai bune programe aerospațiale în funcție de obiectivul de carieră

Comparați programele de top de inginerie aerospațială și drone pentru drone, autonomie, controale, operațiuni UAS și cercetare postuniversitară, cu actualizări verificate din 2026.

Robotică chirurgicală bazată pe inteligență artificială: un ghid practic pentru precizie, autonomie și ce se află de fapt în sala de operație

Robotică chirurgicală bazată pe inteligență artificială: un ghid practic pentru precizie, autonomie și ce se află de fapt în sala de operație

Un ghid practic pentru robotica chirurgicală bazată pe inteligență artificială: capacități actuale, niveluri de autonomie, beneficii de precizie, limite, reglementări și criterii de evaluare.

Scalarea CCUS: Poate capturarea carbonului să inverseze cu adevărat emisiile globale?

Scalarea CCUS: Poate capturarea carbonului să inverseze cu adevărat emisiile globale?

Investițiile în CCUS sunt în creștere, dar poate captarea carbonului să inverseze emisiile globale? Vedeți unde funcționează, ce limitează scara și ce dovezi contează.

Where to Study Cross-Border Digital Supply Chain Management: 7 Programs to Compare

Where to Study Cross-Border Digital Supply Chain Management: 7 Programs to Compare

Compare seven global programs for digital supply chains, logistics, analytics, global trade, and operations, with practical guidance on choosing the right fit.

De la science-fiction la realitate: Cum tehnologia BCI restabilește mobilitatea și vorbirea

De la science-fiction la realitate: Cum tehnologia BCI restabilește mobilitatea și vorbirea

Aflați cum interfețele creier-computer decodifică semnalele neuronale pentru a restabili comunicarea și mișcarea, ce au realizat studiile recente și ce limitează încă utilizarea BCI.

Anatomia dronelor comerciale: descoperiri hardware și zbor autonom

Anatomia dronelor comerciale: descoperiri hardware și zbor autonom

Vedeți cum dronele comerciale combină senzorii, inteligența artificială de la margine, bateriile, comunicațiile și software-ul de control al zborului - și unde autonomia depinde încă de misiune și reglementări.

Where Should You Study Energy Storage Engineering? 7 Battery Tech Programs Compared

Where Should You Study Energy Storage Engineering? 7 Battery Tech Programs Compared

Compare seven strong battery and energy storage master's options by materials, systems, research, industry exposure, flexibility, language, and cost trade-offs.

Engineering the Sky: How Industrial UAVs Can Overcome Battery and Payload Constraints

Engineering the Sky: How Industrial UAVs Can Overcome Battery and Payload Constraints

Learn how payload mass, battery limits, weather, propulsion efficiency, and aircraft architecture shape industrial UAV endurance—and how to improve it.