Természetes nyelvi és szemantikus technológiák

VIMIAC22  |  Mérnökinformatikus BSc  |  Félév: 5  |  Kredit: 5  |  Hivatalos tantárgyi adatlap

A tantárgy célkitűzése

A tantárgy bevezetést nyújt a természetesnyelv-feldolgozás és a szemantikus technológiák területébe, a különböző megközelítéseket gazdagon illusztrálja gyakorlati ismeretekkel. Ismerteti az egyszerű statisztikai módszerektől a nagy nyelvi modellekig terjedő eszközök működését és alkalmazását az információkeresés, a szövegannotálás, a tudáskinyerés, a természetes nyelvű ember-gép interfészek és további területeken. Kitér különféle tudásreprezentációs technikák, szakértői és következtető rendszerek alkalmazására, valamint kiemelt hangsúlyt helyez modern gépi tanulási megoldások bemutatására. A tantárgyi gyakorlatokon lehetőséget biztosít széles körben alkalmazott eszközök gyakorlati kipróbálására, ipari projektekből származó tapasztalatok megismerésére is.
Mészáros Tamás
Mészáros Tamás

docens

tárgyfelelős

A tárgy oktatói

A tantárgy részletes tematikája

Bevezetés. A természetesnyelv-feldolgozás (natural language processing, NLP) áttekintése, alapfogalmak, áttekintő irodalmak, célkitűzések, kihívások, alkalmazási területek, ajánlott szoftvereszközök áttekintése.

Tudásmenedzsment, tárgyterületek modellezése. Tudásmodellezés, explicit és implicit tudás, tudásreprezentációs megközelítések, szakértői rendszerek, következtetés, magyarázatgenerálás. Szemantikus web koncepció, szemantikus web technológiák, nyílt világ feltételezés alapú információleírás.

Statisztikai nyelvi modellek és alkalmazásaik. Az NLP-feldolgozólánc elemei: adattisztítás, szegmentálás és tokenizálás, modellépítés. Szózsák, n-gram, TF-IDF és rejtett szemantikai modellek. Hatékonyság mérése (pontosság, felidézés, F1-score). Tipikus alkalmazások: információkeresés, szövegklaszterezés, szövegkivonatolás, hangulatelemzés, stilometria, spamszűrés és témamodellezés (topic modelling).

Ontológiák, logikai reprezentációk. Szótárak, tezauruszok, ontológiák építése és alkalmazása, szemantikus adatmodellek, egységes erőforrás azonosító (URI), erőforrás leíró keretrendszer (RDF), Linked Data koncepció, nyílt adatforrások a világban, nyílt szótárak, szemantikus hálózatok

A nyelvtani elemzés és kontrollált nyelvű interfészek. Nyelvi szabályszerűségek leírása nyelvtanokkal, szintaktikai elemzés és jellemző algoritmusai, az elemző működése, kifejezésstruktúra, levezetési szabály, elemzési fa, nyelvtanok tanulása, kontrollált természetes nyelvű interfészek (ANTLR).

Logikai következtetés. Ontológiák reprezentálása leíró logikákban, leíró logikai következtetés, Tableau algoritmus, szabály alapú reprezentáció, előre és hátrafelé láncoló következtetés.

Gépi tanuláson alapuló és nagy nyelvi modellek. Szövegek nyelvi és szemantikai tulajdonságainak tanulása korpuszból, mélytanulási módszerek (szóbeágyazások, RNN, LSTM, transzformer), generatív és nagy nyelvi nyelvi modellek (GPT, LLM) működése.

Megbízhatóság a mesterséges intelligenciában. Gépi tanulás és logikai következtetés integrálása, kompozit MI (gépit tanulás, természetesnyelv-feldolgozás és tudás gráfok integrációja), magyarázható mesterséges intelligencia.

Nagy nyelvi modellek alkalmazásai. Online és lokális modellek használata: képességeik összehasonlítása, programozói felületeik bemutatása, alkalmazásfejlesztési esettanulmányok (csetbotok, copilot megoldások, új generációs keresőgépek: retrieval-augmented generation, RAG).

Párbeszédkezelés, érvelés. Párbeszédek leírása, modellezése szabály alapú megközelítéssel és kompozit MI alkalmazásával, érvelési rendszerek, magasabb rendű logikai modellek, modális logikák alkalmazása érvelések leírására

Szövegannotálás és információkinyerés. Szófaji címkézés, szemantikus annotálás, egyértelműsítés, nagy nyelvi modellek alkalmazása információkinyerésre (tudásgráf kinyerése szövegből és Graph-RAG).
Esettanulmányok. Tudástárak építése és alkalmazása, szemantikus annotálás információkinyerési céllal, természetes nyelvű robotinterfészek megvalósítása, böngésző alkalmazásokba beépülő nyelvi technológiák.

Gyakorlatok:
Elemi nyelvfeldolgozás (szegmentálás, tokenizálás, szófaji címkézés) NLTK és Spacy segítségével.
RDF adatmodellek vizsgálata (RDF4J adatbázis, múzeumi adatok elemzése)
Szózsák és n-gram modellek építése és alkalmazásuk információkeresési és klaszterezési feladatokban (hangulatelemzés, stilometria). Apache Solr.
Ontológiák vizsgálata (Protege ontológiaszerkesztő eszköz), következtetés a múzeumi adatmodellen
Szóbeágyazások és nagy nyelvi modellek használata (online és lokális modellek), prompttervezés, csetbotkészítés.
Ontológiák építése, egyszerűbb modellek létrehozása Protege környezetben, kompozit MI megoldás vizsgálata.
RAG-alapú keresőrendszer megvalósítása.
Nagy nyelvi modellek vizsgálata, magyarázhatóság.
Tudásalapú nyelvi modellek alkalmazása (szótövesítés, lemmatizálás), nyelvtani elemző készítése ANTLR segítségével, gyakorlati alkalmazásuk.
Érvelés szakértői rendszermodellben.
Szövegannotálás és információkinyerés Spacy-vel és nagy nyelvi modellekkel.
Tudásalapú rendszerek demó, egyszerű szabályalapú környezet vizsgálata.