Attention Is All You Need: Zásadní práce 21. století, která položila základy dnešní generativní AI
V roce 2017 představila skupina osmi výzkumníků společnosti Google novou architekturu neuronové sítě nazvanou Transformer. Přelomová práce s názvem „Attention Is All You Need“ se původně zabývala především strojovým překladem. Transformery se ale následně staly technologickým základem dnešních populárních generativních modelů GPT, Gemini nebo Claude a pomohly odstartovat současný rozmach umělé inteligence.
Schéma původní architektury Transformer, zdroj: Vaswani et al. (2017), Attention Is All You Need.
Nejprve je potřeba představit, co je to neuronová síť. Neuronová síť je matematický model volně inspirovaný fungováním lidského mozku. Skládá se z vrstev jednoduchých výpočetních jednotek propojených vazbami, kterým jsou přiřazeny číselné váhy. Na rozdíl od běžného programu není její chování definováno souborem předem napsaných pravidel, ale trénuje se. Síť dostane obrovské množství příkladů a algoritmus postupně upravuje váhy tak, aby model co nejlépe plnil zadaný úkol.
Před příchodem architektury Transformer využívaly nejvýkonnější systémy pro práci s jazykem především rekurentní neuronové sítě (RNN), zejména jejich variantu LSTM. Rekurentní sítě zpracovávaly text postupně, tedy jedno slovo po druhém, a informace si předávaly mezi jednotlivými kroky. Tento přístup měl ale dvě zásadní omezení. Zaprvé výpočty nebylo možné při trénování jednoduše provádět souběžně a zadruhé modely obtížněji zachycovaly vztahy mezi slovy, která se v textu nacházela daleko od sebe, protože čím delší byla věta nebo dokument, tím obtížnější bylo udržet potřebný kontext.
Řešením se stal mechanismus „self-attention“, česky sebepozornost. Model při něm vyhodnocuje, které části vstupního textu jsou pro pochopení konkrétního slova nejdůležitější. Ve větě „Myš se schovala do nory“ může například přikládat větší význam slovu „nora“, zatímco ve větě „Myš přestala reagovat a kurzor zůstal stát“ je důležitým vodítkem slovo „kurzor“. Díky okolnímu kontextu dokáže rozlišit, zda „myš“ označuje zvíře, nebo počítačové zařízení. Během trénování se model sám učí, kterým částem textu má v dané situaci věnovat pozornost.
Samotný mechanismus pozornosti existoval již před rokem 2017. Autoři práce však jako první postavili celou architekturu pouze na něm a odstranili rekurentní i konvoluční vrstvy. Novou architekturu pojmenovali Transformer.
Hlavní výhodou Transformeru nebyla pouze vyšší kvalita výsledků. Architektura umožnila při trénování zpracovávat jednotlivé části textu souběžně, díky čemuž dokázala mnohem lépe využívat výpočetní kapacitu. Možnost efektivně rozdělit výpočty mezi velké množství čipů se později ukázala jako rozhodující. Vývojáři mohli modely postupně zvětšovat, trénovat je na rozsáhlejších souborech dat a využívat stále větší výpočetní kapacitu.
Práce vznikla primárně s cílem zlepšit strojový překlad. Její autoři však již tehdy předpokládali, že by se nová architektura mohla uplatnit také při práci s obrazem, zvukem nebo videem. Google již v roce 2018 představil jazykový model BERT, který v následujícím roce začal využívat také ve svém internetovém vyhledávači.
Společnost OpenAI postavila na Transformeru modelovou řadu GPT. Samotná zkratka GPT znamená Generative Pre-trained Transformer, česky generativní předtrénovaný transformer. Z této řady později vzešel chatbot ChatGPT.
Právě schopnost Transformerů využívat stále větší množství dat a výpočetního výkonu pomohla proměnit umělou inteligenci v hlavní investiční téma současnosti. Společnostem Anthropic a OpenAI, které vyvíjejí přední generativní modely, v posledních letech strmě rostou tržby. Trénování a provoz (inference) těchto modelů však vyžadují rozsáhlé výpočetní kapacity. Vedle takzvaných hyperscalerů, mezi něž například patří Amazon, Microsoft, Alphabet a Oracle, je budují také specializovaní cloudoví poskytovatelé, tzv. „neocloudy“ (CoreWeave, Nebius,..).
Z budování této infrastruktury těží celý dodavatelský řetězec. NVIDIA je dominantním dodavatelem grafických akcelerátorů využívaných při trénování a provozu modelů. Broadcom vyvíjí zakázkové AI akcelerátory pro velké technologické společnosti a dodává síťové čipy, zatímco značnou část nejpokročilejších čipů vyrábí tchajwanská TSMC. Z rostoucích investic do výroby polovodičů těží také dodavatelé výrobních zařízení. Nizozemská ASML dodává litografické systémy EUV nezbytné pro výrobu nejpokročilejších čipů, zatímco Lam Research poskytuje zařízení pro leptání, nanášení materiálových vrstev a pokročilé pouzdření čipů. Rostoucí poptávku pociťují také výrobci pamětí SK Hynix, Samsung Electronics a Micron Technology, protože moderní AI akcelerátory využívají vysokorychlostní paměti typu HBM.
Důležitým článkem řetězce se stává také energetika. Datová centra potřebují rozsáhlé a stabilní dodávky elektřiny, což podporuje zájem o provozovatele elektráren i výrobce zařízení pro energetickou a přenosovou infrastrukturu.
Zdroj: Google, arXiv, Medium, IBM
Michal Bárta
Fio banka, a.s.
Prohlášení
Nejnovější:
- Attention Is All You Need: Zásadní práce 21. století, která položila základy dnešní generativní AI
- ČR: Kalendář výsledkové sezóny za 2Q 2026
- Evropa: Kalendář výsledkové sezóny za 2Q 2026
- USA: Kalendář výsledkové sezóny za 2Q 2026
- ČEZ: Zvyšujeme cílovou cenu z 1044 Kč na 1150 Kč, doporučení měníme ze stupně "redukovat" na "držet"
- Co je formulář 10-K a proč by ho měl investor číst?
- Vydáváme novou analýzu na akcie Komerční banky s cílovou cenou 1043 Kč a doporučením „Akumulovat“
- Zvyšujeme doporučení na akcie Colt CZ z „redukovat“ na „držet“, cílovou cenu 981 Kč potvrzujeme
- Vydáváme novou analýzu na akcie KARO Leather s cílovou cenou 172 Kč a doporučením „Akumulovat“





