AI és LLM szótár

50 fogalom, amivel akkor találkozol, amikor egy nagy nyelvi modell valódi termékbe kerül — olyan fejlesztőtől, aki ezeket a rendszereket élesbe is adja, nem marketingcsapattól.

Minden szócikk megmondja, mit jelent a fogalom, és a gyakorlatban miért számít — közérthetően, anélkül hogy megoldottnak tüntetné fel a nehéz részeket. Minden fogalomnak saját horgonylinkje van, így egyetlen definícióra is ráirányíthatsz egy kollégát vagy egy asszisztenst.

LLM alapok8 fogalom

Nagy nyelvi modell (LLM)
Hatalmas szövegmennyiségen tanított neurális háló, amely a következő tokent jósolja meg. Ez az egyetlen mechanizmus elég az összefoglaláshoz, fordításhoz, klasszifikációhoz és kódíráshoz — de azt is jelenti, hogy a modell hihető folytatást állít elő, nem ellenőrzött tényt.
Token
Az az egység, amit az LLM ténylegesen olvas és ír: nagyjából egy szótöredék, angolban négy karakter körül, magyarul és németül érezhetően rosszabb hatásfokkal. A kontextuskorlát, a késleltetés és a számlázás is tokenben mérődik, nem szóban.
Kontextusablak
Az a maximális tokenszám, amit a modell egyszerre figyelembe vehet — a rendszerprompt, a beszélgetés, a behúzott dokumentumok és a saját válasza együtt. Túllépésnél a legrégebbi tartalom levágódik, ezért kezd egy hosszú beszélgetés csendben elfelejteni utasításokat.
Prompt
Minden, amit egy kéréshez elküldünk a modellnek: utasítások, példák, behúzott kontextus és a felhasználó kérdése. Éles rendszerben a prompt nem egy ügyes mondat, hanem verziózott, tesztelt artefaktum — ugyanúgy megváltoztatja a viselkedést, mint egy kódmódosítás.
Rendszerprompt
Az az állandó utasítás, amely a beszélgetés minden kérését keretezi: szerep, hangnem, szabályok, kimeneti formátum. Nagyobb súllyal esik latba, mint a felhasználó üzenete, ezért ez a védőkorlátok természetes helye — és a prompt injection gyakori célpontja.
Temperature (hőmérséklet)
Mintavételi paraméter, amely azt szabályozza, mennyi véletlenszerűség megengedett a következő token kiválasztásánál. 0 közelében a kimenet ismételhető és konzervatív — ez kell kinyeréshez és klasszifikációhoz; a magasabb érték változatosságot vesz, megbízhatóságért cserébe.
Top-p és top-k mintavétel
Két módszer annak korlátozására, mely tokenek választhatók. A top-k a k legvalószínűbb jelöltet tartja meg; a top-p (nucleus sampling) a legkisebb olyan halmazt, amelynek valószínűségei p-t adnak ki. Ezek szorítása általában jobban stabilizál, mint önmagában a temperature.
Hallucináció
Gördülékeny, magabiztos válasz, ami egyszerűen hamis — kitalált hivatkozás, API-metódus vagy szám. Nem javítható hiba, hanem a következő-token-jóslás tulajdonsága, ezért retrievallel, megalapozással, kimenet-validálással és kiértékeléssel kezeljük, nem megszüntetjük.

RAG és keresés9 fogalom

RAG (retrieval-augmented generation)
Előbb kikeressük a releváns részleteket a saját adatodból, aztán a modell csak azokból válaszol. Így jut az LLM privát, friss vagy a kontextusba be nem férő tudáshoz — és így lesz a válasz forrásig visszavezethető.
Embedding (beágyazás)
Számvektor, amely egy szövegrészlet jelentését reprezentálja úgy, hogy a hasonló jelentések közel kerülnek egymáshoz. Az embedding teszi lehetővé a szemantikus keresést, a klaszterezést és a duplikátumszűrést egyetlen kulcsszóegyezés nélkül.
Vektor adatbázis
Olyan tároló, amely milliós nagyságrendben is ezredmásodpercek alatt megtalálja a kérdésvektorhoz legközelebbi vektorokat — pgvector, Qdrant, Pinecone. Közepes adatmennyiségnél általában elég egy Postgres-kiterjesztés; külön szolgáltatás nagy méretben térül meg.
Chunkolás (darabolás)
A dokumentumok visszakereshető darabokra vágása. A RAG legalulértékeltebb döntése: az a darabolás, amely elszakítja a táblázatot a fejlécétől vagy a választ a kérdésétől, csendben tönkreteszi a keresést, bármilyen jó is a modell.
Reranking (újrarangsorolás)
Második menet, amely egy lassabb, pontosabb modellel átrendezi a találatokat, mielőtt az LLM elé kerülnének. Húszat behúzni, újrarangsorolni, ötöt megtartani: egy működő RAG-rendszerben rendszerint ez a legolcsóbb minőségjavítás.
Megalapozás (grounding) és forrásmegjelölés
Annak megkövetelése, hogy a modell csak a megadott forrásokból válaszoljon, és megnevezze, melyik részletből származik az adott állítás. A forrásmegjelölés nem dísz: auditálhatóvá teszi a választ, a hibás választ pedig diagnosztizálhatóvá.
llms.txt
Az oldal gyökerében elhelyezett egyszerű szöveges fájl, amely strukturált összefoglalót és térképet ad az AI-asszisztenseknek a fontos oldalakról — mintha a robots.txt nem engedélyről, hanem jelentésről szólna. Párja, az llms-full.txt a teljes tartalmat adja egyetlen lekérésben.

Tanítás és finomhangolás8 fogalom

Előtanítás (pre-training)
Az az eredeti, rendkívül drága tanítási futás széles szövegkorpuszon, amely az alapmodell általános képességét adja. A nagy laborokon kívül ezt szinte senki nem csinálja; amit a legtöbb csapat „tanításnak” hív, az a rá épülő olcsóbb adaptációk egyike.
Finomhangolás (fine-tuning)
A tanítás folytatása saját példákon, hogy a modell átvegyen egy formátumot, hangnemet vagy szűk feladatot. Viselkedést tanít, nem tényeket — ha az adataidat kell ismernie, retrieval kell; finomhangolás akkor, ha következetesen adott módon kell válaszolnia.
LoRA és paraméterhatékony hangolás
A teljes modell helyett egy kis extra súlyhalmaz tanítása, nagyságrendekkel kisebb költséggel és hardverigénnyel. Az adapterek ügyfelenként vagy feladatonként cserélhetők, és egyetlen közös alapmodellre rétegezhetők.
RLHF (megerősítéses tanulás emberi visszajelzésből)
A modell hangolása aszerint, hogy emberek melyik válaszjelöltet részesítik előnyben. Ettől lesz a nyers szövegjóslóból olyan asszisztens, amely követi az utasításokat, és visszautasítja azt, amit vissza kell utasítania.
Instrukciós hangolás
Tanítás utasítás–válasz párokon, hogy a modell megbízhatóan azt tegye, amit kérnek tőle, ahelyett hogy folytatná a szöveget. Ez a különbség egy szövegfolytató motor és egy olyan rendszer között, amelynek feladatot lehet adni.
Zero-shot és few-shot promptolás
A zero-shot csak utasítással kérdez, a few-shot néhány kidolgozott példát is betesz a promptba. Három jó példa rendszeresen többet ér, mint egy oldalnyi prózai utasítás — és sokkal olcsóbb, mint a finomhangolás.
Kvantálás
A modellsúlyok alacsonyabb számábrázolási pontosságú tárolása, hogy a modell kisebb hardveren is elférjen és gyorsabban fusson. A minőségromlás a legtöbb feladatnál körülbelül 4 bitig mérsékelt — ettől lesz reális a saját üzemeltetésű modell.
Desztilláció
Kis, olcsó modell tanítása egy nagy modell kimenetein. Szűk, jól definiált feladaton megközelítheti a nagy modell minőségét a késleltetés és a költség töredékéért — jó módszer arra, hogy egy drága pipeline elérje az éles üzem gazdaságosságát.

Ágensek és eszközhasználat8 fogalom

AI ágens
Olyan LLM, amely cselekedni is tud — eszközöket hív, elolvassa az eredményt, eldönti a következő lépést —, nem csak szöveget állít elő. A mérnöki munka ritkán a gondolkodás: a köré húzott határok, jogosultságok és leállási feltételek.
Ágens munkafolyamat
Többlépéses folyamat, amelyben a modell ciklusban tervez, cselekszik és ellenőrzi a saját munkáját. Nyílt végű feladatokra erős, de minden extra lépés sokszorozza a költséget, a késleltetést és a hibalehetőségeket — éles problémák többségét jobban szolgálja egy fix pipeline.
Eszközhívás (function calling)
A modell kap egy típusos függvénylistát, amit meghívhat — adatbázis-lekérdezés, API-hívás, számítás —, és próza helyett strukturált hívást ad vissza. Így ér hozzá egy LLM valódi rendszerekhez biztonságosan és ellenőrizhetően.
MCP (Model Context Protocol)
Nyílt protokoll, amely közös interfészen köti a modelleket eszközökhöz és adatforrásokhoz, így az egyszer megírt integráció több asszisztenssel is működik. Kiváltja azt az egyedi ragasztókódot, amit korábban minden csapat gyártónként megírt.
Többágenses rendszer
Több specializált ágens dolgozik egy feladaton, gyakran koordinátorral. Valóban segít, ha a részfeladatok eltérő eszközöket vagy jogosultságokat igényelnek; többnyire csak költséget és kiszámíthatatlanságot ad, ha egyetlen jól megírt hívás is elég lenne.
Védőkorlátok (guardrails)
A modell köré épített ellenőrzések: bemenetszűrés, kimeneti séma validálása, engedélyezett műveletek listája, költség- és lépéskorlátok. A védőkorlát hagyományos szoftver — determinisztikus, tesztelhető kód —, és ettől lesz élesbe adható egy nem determinisztikus komponens.
Ember a hurokban (human in the loop)
Emberi jóváhagyás megkövetelése minden drága, visszafordíthatatlan vagy ügyfél felé menő művelet előtt. A kérdés nem az, hogy legyen-e ember a folyamatban, hanem hogy pontosan mely lépéseknél — túl sok jóváhagyásnál az automatizálás már nem térül meg.
Orkesztráció
Az a réteg, amely eldönti, mi mikor fut: retrieval, modellhívások, eszközök, újrapróbálkozások, tartalékutak és állapot. Az olyan keretrendszerek, mint a LangChain vagy a LangGraph, itt élnek — hasznosak, de gyakran egy egyszerű állapotgép a karbantarthatóbb választás.

Kiértékelés és minőség8 fogalom

Benchmark
Szabványos tesztkészlet modellek összehasonlítására. Szűkítéshez hasznos, döntésnek félrevezető: a nyilvános benchmarkok beszivárognak a tanítóadatba, és egyik sem a te dokumentumaidat, felhasználóidat és jó-válasz-definíciódat méri.
Eval (kiértékelés)
Saját, automatizált tesztkészlet egy LLM-funkcióra: rögzített bemenetek, elvárt tulajdonságok, és egy pontszám, amit modell- és promptváltozásokon át követni tudsz. Evalok nélkül nem mérnökölsz AI-funkciót, hanem érzésre állítgatod.
Golden dataset (referencia-adathalmaz)
Gondozott halmaz valódi bemenetekből és ellenőrzött helyes kimenetekből, amelynek a gazdája a szakterületi szakértő, nem a fejlesztő. Száz jól választott eset többet ér tízezer legyűjtöttnél — és ez az az eszköz, amitől minden későbbi modellváltás mérhetővé válik.
LLM mint bíró (LLM-as-a-judge)
Egy modell értékeli egy másik modell kimenetét egy értékelési szempontrendszer alapján. Olyan mennyiségre skálázza a kiértékelést, amit ember nem tud átnézni — de örökli a bíró torzításait, ezért emberi értékelésekhez kell kalibrálni, mielőtt hiszel a számoknak.
Determinizmus és reprodukálhatóság
Azt jelenti, hogy ugyanaz a bemenet megbízhatóan ugyanazt a kimenetet adja-e. Teljes determinizmus felhős modellekkel nem érhető el, de a nulla közeli temperature, a rögzített promptok, a kikötött modellverziók és a strukturált kimenet elég közel visz ahhoz, hogy tesztelni lehessen.
Pontosság és fedés (precision, recall)
A precision azt méri, a visszaadott találatok közül hány volt helyes; a recall azt, a helyesek közül hányat találtunk meg. Egymás rovására mennek, és üzleti döntés, melyik számít jobban — egy kihagyott csalás és egy hamis vád nem ugyanannyiba kerül.
LLM-alapú klasszifikáció
Modell használata szövegek kategóriákba sorolására — ticketek, dokumentumok, szándékok — dedikált osztályozó tanítása nélkül. Gyorsan felépíthető, és jól bírja a rendezetlen nyelvet; kell hozzá rögzített címkekészlet, bizonyossági küszöb és explicit út az „egyik sem” esetre.
Megfigyelhetőség és tracelés
Minden prompt, behúzott chunk, eszközhívás, tokenszám és késleltetés rögzítése kérésenként. Amikor egy felhasználó rossz választ jelez, ezen múlik, hogy percek alatt reprodukálod-e, vagy egy napig találgatsz.

Integráció és üzemeltetés9 fogalom

Inferencia és inferencia API
Az inferencia a modell egyszeri lefuttatása a bemeneteden; az inferencia API az a felhős végpont, amit ehhez hívsz. Kezeld külső függőségként, SLA-val: lehet lassú, korlátozott vagy leállt — és a terméknek ilyenkor is értelmesen kell viselkednie.
Prompt cache
Egy hosszú, változatlan prompt-előtag feldolgozott formájának újrahasznosítása kérések között. Nagy rendszerprompt vagy fix dokumentumkészlet mellett jelentősen csökkenti a költséget és az első tokenig eltelt időt — feltéve, hogy a stabil rész van elöl.
Streamelés
A tokenek küldése a kliensnek generálás közben, a teljes válasz kivárása helyett. Nem gyorsítja a generálást, de drámaian csökkenti az érzékelt késleltetést — és ahhoz, hogy működjön, a teljes stacknek, a proxykkal együtt, pufferelés nélkül kell továbbítania a darabokat.
Rate limit (kérés-korlát)
A szolgáltató percenkénti kérés- vagy tokenkorlátja. A leggyakoribb oka annak, hogy egy AI-funkció demóban működik, indulásnál viszont elhasal — ezért a sorbaállítás, a visszalépkedés és a tartalék modell a tervezésbe tartozik, nem az incidens utáni elemzésbe.
Tokenköltség
A számlázás bemeneti és kimeneti tokenenként történik, eltérő díjszabással. Gyakorlati következmény: a behúzott kontextus, a hosszú rendszerpromptok és a beszélgetési előzmény a valódi költséghajtók — egy korlátlan beszélgetés korlátlan számla.
Késleltetés és első tokenig eltelt idő
A teljes idő kevésbé számít, mint az, mikor lát a felhasználó történni valamit. Az első tokenig eltelt idő az igazán optimalizálandó szám: streamelés, prompt cache, kisebb modell az egyszerű lépésekre, és párhuzamos retrieval a soros helyett.
Saját üzemeltetésű vs. felhős modell
A saját hardveren futó nyílt súlyú modell adatkontrollt, kiszámítható árat és gyártói kikapcsolásoktól való függetlenséget ad; a felhős élvonalbeli modell nagyobb képességet, üzemeltetési teher nélkül. A legtöbb rendszer vegyes lesz: helyi a tömeges és érzékeny munkára, felhős a nehéz kérésekre.
Adatvédelem LLM-rendszerekben
A GDPR szerint a személyes adat elküldése egy modellszolgáltatónak harmadik fél általi adatkezelés: kell hozzá jogalap, adatfeldolgozói szerződés, ismert tárolási régió és megőrzési válasz. Hogy a szolgáltató tanul-e az adataidon, szerződéses kérdés, nem technikai.
AEO és GEO
Answer Engine Optimization és Generative Engine Optimization: az oldal olyanná tétele, hogy az AI-asszisztensek visszakereshessék és idézhessék, ne csak a keresők rangsorolhassák. A gyakorlatban strukturált adat, gépi összefoglalók és darabolásbiztos tartalom.

Építesz valamit LLM-mel?

Éles környezetbe szánt AI-rendszereket tervezek és adok át — RAG pipeline-ok, szemantikus keresés, kiértékelés és a köré épülő mérnöki munka.