Manažment znalostí


Rozsah: týždenne 2h prednášok, 1h výpočtové cvičenie a 1h projektová práca. Predmet končí zápočtom a skúškou.


Určený pre: 2. ročník inžinierskeho štúdia – zimný semester, študijný program Hospodárska informatika (povinný), 1. ročník inžinierskeho štúdia, študijný program Inteligentné systémy (povinne voliteľný)

Prerekvizity: žiadne

Prednášajúci: prof. Ing. Ján Paralič, PhD., e-mail: Jan.Paralic at tuke.sk
                         doc. Ing. Peter Bednár, PhD., e-mail: Peter.Bednar at tuke.sk

Cvičiaci: Ing. Samuel Fodor, e-mail: Samuel.Fodor at tuke.sk

Anotácia

I. Vyhľadávanie informácií. Proces vyhľadávania informácií z textových dokumentov, klasické modely vyhľadávania (boolovský, vektorový a pravdepodobnostný model), reprezentácia a indexovanie dokumentov, operácie s dopytmi a hodnotenie efektívnosti vyhľadávania. Vyhľadávanie na webe, architektúra prehľadávač-indexovač, typy dopytov, prezentácia výsledkov, marketing založený na vyhľadávaní a využitie štruktúry liniek (PageRank a HITS).

II. Dolovanie znalostí z textov. Predspracovanie a vektorová reprezentácia textov, latentné sémantické indexovanie, počítačová lingvistika a jazykové úrovne. Morfologická, syntaktická a sémantická analýza, znalostné grafy a extrahovanie informácií. Jazykové modely a architektúra Transformer, trénovanie a používanie veľkých jazykových modelov, promptovanie a vyhľadávaním rozšírené generovanie (RAG). Rozpoznávanie reči, automatický preklad, viacjazyčná reprezentácia a sumarizácia textu. Klasifikácia, analýza sentimentu a emócií, zhlukovanie, modelovanie tém a extrahovanie pomenovaných entít, koreferencií a relácií.

III. Manažment znalostí: Dáta, informácie a znalosti, kategórie znalostí, definície manažmentu znalostí a životný cyklus znalostí (model SECI). Úrovne práce so znalosťami, intelektuálny kapitál a rôzne pohľady na manažment znalostí. Architektúra systémov na podporu manažmentu znalostí, znalostné procesy, znalostné sklady, znalostná kartografia a komunity znalostných pracovníkov. Faktory ovplyvňujúce manažment znalostí, univerzalistický a podmienený pohľad na MZ a výber vhodného typu riešenia. Identifikácia vhodného typu riešenia manažmentom znalostí. Vplyv manažmentu znalostí na organizáciu a hodnotenie MZ.

Podklady k prednáškam a cvičeniam, ako aj ďalšie aktuálne informácie, priebežne zverejňované v MS Teams.


Prednášky     Cvičenia     Spôsob hodnotenia     Literatúra


Približný harmonogram prednášok

Harmonogram sa môže v priebehu semestra aktualizovať.

Téma

1. Úvod do vyhľadávania informácií. Organizácia predmetu; proces vyhľadávania informácií z textových dokumentov; boolovský, vektorový a pravdepodobnostný model; invertovaný index; váhovanie termov a výpočet podobnosti dopytu a dokumentu.

2. Hodnotenie a rozšírenie vyhľadávania informácií. Hodnotenie neusporiadaných a usporiadaných výsledkov; presnosť, návratnosť, F-miera, krivka presnosť-návratnosť a sumarizačné miery; operácie s dopytmi a spätná väzba; ďalšie typy indexov.

3. Vyhľadávanie na webe. Vývoj a nové trendy, architektúra prehľadávač-indexovač, typy používateľských dopytov, prezentácia výsledkov, znalostná databáza a marketing založený na vyhľadávaní; algoritmy PageRank a HITS.

4. Predspracovanie a vektorová reprezentácia textov. Tokenizácia, regulárne výrazy, normalizácia, stemming, lematizácia a stop slová; rozšírený invertovaný index; kontrolované slovníky, tezaury, ontológie, WordNet a MeSH; latentné sémantické indexovanie; nejednoznačnosť, mnohotvárnosť a kontext

5. Počítačová lingvistika a reprezentácia významu. Jazykové úrovne, morfologické značkovanie, syntaktické parsovanie a závislostné stromy; sémantická reprezentácia a znalostné grafy; extrahovanie entít a relácií, rozlíšenie koreferencií; distribuované reprezentácie slov (Word2Vec, GloVe, ELMo).

6. Jazykové modely. Úlohy a testovanie jazykových modelov; tokenizácia a vektorová reprezentácia slov; samo-pozornosť, pozičné kódovanie a architektúra Transformer; trénovanie veľkých jazykových modelov, ladenie inštrukciami a promptovanie.

7. Jazykové modely, vyhľadávanie a spracovanie reči. Nedostatky jazykových modelov pri odpovedaní na otázky; vyhľadávaním rozšírené generovanie (RAG) a vektorové databázy; prehľad úloh spracovania prirodzeného jazyka; rozpoznávanie hovorenej reči a architektúry Transformer pre reč.

8. Vybrané úlohy spracovania prirodzeného jazyka. Morfosyntaktická analýza, lematizácia, morfologické značkovanie a syntaktické parsovanie; automatický preklad, jeho hodnotenie a viacjazyčná reprezentácia slov; sumarizácia textu a jej hodnotenie.

9. Klasifikácia a zhlukovanie textov. Klasické a neurónové metódy klasifikácie, redukcia a selekcia termov; analýza sentimentu, aspektová analýza a klasifikácia emócií; zhlukovanie textov, redukcia príznakového priestoru, k-means/k-medoids, SOM a DBSCAN; interpretácia zhlukov.

10. Modelovanie tém a extrahovanie informácií. LSI a pravdepodobnostné modelovanie tém, latentná Dirichletova alokácia (LDA), vývoj a vizualizácia tém; extrahovanie pomenovaných entít, koreferencií a relácií; využitie syntaktických štruktúr, pozornostných a grafových konvolučných sietí.

11. Manažment znalostípraxi. Pozvaná prednáška

12. Konceptuálne základy manažmentu znalostí. Dáta, informácie a znalosti; kategórie znalostí a definície manažmentu znalostí; životný cyklus znalostí a model SECI; úrovne práce so znalosťami; intelektuálny kapitál; procesný, technologický, organizačný, implementačný a manažérsky pohľad.

13. Systémy a stratégie manažmentu znalostí. Všeobecná architektúra systémov na podporu manažmentu znalostí, tok znalostí, znalostné sklady, kartografia a komunity znalostných pracovníkov; faktory ovplyvňujúce manažment znalostí; univerzalistický a podmienený pohľad; metodológia výberu vhodného riešenia.

 


Približný harmonogram cvičení

Týždeň

Náplň cvičenia

Poznámky

1.

Oboznámenie sa s organizáciou cvičení, modelom práce na cvičeniach a zadaniach, ako aj spôsobom ich hodnotenia.

 

2.

Boolovský model - vnútorná reprezentácia incidenčnou maticou term-dokument, invertovaný index, vyhodnotenie základných dopytov nad invertovaným indexom.

Vektorový model - rôzne spôsoby váhovania a výpočet miery relevancie dokumentu voči dopytu - ranking.

 

3.

Hodnotenie efektívnosti vyhľadávania: výpočet metrík presnosť, návratnosť, F miera (výsledky vyhľadávania bez usporiadania). Krivka presnosť-návratnosť a jej normovaná verzia (usporiadané výsledky vyhľadávania). Sumarizačné mierky MAP a R-presnosť.

 

4.

1. písomka

1. písomka (max. 10b)

5.

Projektová práca, konzultácie

6.

Projektová práca, konzultácie

 

7.

Algoritmus PageRank.

8.

Algoritmus HITS.

 

9.

2. písomka

2. písomka (max. 10b)

10.

Projektová práca, konzultácie

11.

Projektová práca, konzultácie

12.

Odovzdávanie zadaní (max. 20b)

Skupinové zadanie (max 20b)

13.

Predtermín

 

 


Spôsob hodnotenia

·        2. písomka: max. 10 bodov

        -------------------------------------------
          Spolu za cvičenia: max. 40 bodov

 

·        Skúška: spolu max 60 bodov

        -------------------------------------------
          Spolu: max. 100 bodov


Študijná literatúra:

  1. Paralič, J., Furdík, K., Tutoky, G., Bednár, P., Sarnovský, M., Butka, P., Babič, F.: Dolovanie znalostí z textov. Equilibria, s.r.o., Košice, 2010, 184 s.
  2. Paralič J. (editor): Knowledge Management. Technical University Kosice, 2015, ISBN 978-80-553-2100-4, 90 p.
  3. Manning, C.D., Raghavan, P., Schutze, H.: Introduction to Information Retrieval, Cambridge University Press, 2008.
  4. Baeza-Yates, R. - Ribeiro-Neto, B.: Modern Information Retrieval. Addison Wesley, 1999.
  5. Bureš, V.: Znalostní management a proces jeho zavádění. Grada, 2007.
  6. Becerra-Fernandez, I. - Gonzalez, A. - Sabherwal, R.: Knowledge Management - Challenges, Solutions, and Technologies. Pearson, Prentice Hall, 2004.
  7. Borghoff, U. - Pareschi, R.: Information Technology for Knowledge Management. Springer, 1998.
  8. Tiwana, A.: The Knowledge Management Tookit. Practical Techniques for Building a Knowledge Management System. Prentice Hall, 2000.
  9. Elektronické databázy zahraničné (autorizovaný prístup do databáz sprostredkovaný univerzitnou knižnicou TU. Prístup do väčšiny externých elektronických databáz (bibliografické databázy, úplné texty článkov z časopisov a zborníkov, online knihy, ...) je viazaný na IP adresu proxy servera tuke.sk (iba v rámci TU) a je potrebné správne nastavenie prehliadača.