
A rangos Journal of Medical Internet Research folyóiratban megjelent új közleményben Dr. Posta Máté és Prof. Dr. Győrffy Balázs vezetésével egy új, nagy nyelvi modellre (LLM) épülő rendszert, a CIDER-t mutatják be, amelynek célja a strukturálatlan klinikai dokumentációban található információk automatizált kinyerése és strukturált adatokká alakítása. A fejlesztés különösen a nagy mennyiségű orvosi dokumentáció kutatási célú feldolgozásában kínál új lehetőségeket.
A CIDER-t 2073 magyar nyelvű onkológiai szövettani leleten validálták, és hét klinikailag releváns változó – többek között a beteg neme, a műtét éve, a TNM-stádium, az érintett szerv, a szövettani típus és a tumor mérete – automatizált kinyerését vizsgálták. A rendszer több változó esetében kiemelkedő pontosságot ért el: a nem meghatározásánál 99,5%-os, a műtét évének kinyerésénél 98,1%-os, az érintett szerv azonosításánál 95,8%-os, a T-stádium meghatározásánál pedig 95,6%-os egyezést mutatott. A vizsgálat azt is igazolta, hogy a rendszer a szakértői adatbázisban hiányzó információk azonosítására is alkalmazható, jelentősen növelve a strukturált adatok teljességét.
A CIDER egyik fontos újdonsága, hogy a rendszer teljes egészében helyi, intézményi infrastruktúrán futtatható, így az érzékeny klinikai adatok feldolgozása kontrollált, akár izolált környezetben is megvalósítható. A kutatás jól példázza, hogy a bioinformatika és a modern mesterségesintelligencia-módszerek összekapcsolása miként teheti lehetővé a nagy mennyiségű, korábban nehezen hasznosítható klinikai szöveges adat gyors és reprodukálható feldolgozását. A megközelítés hozzájárulhat nagyméretű klinikai adatbázisok és regiszterek hatékonyabb létrehozásához, valamint a retrospektív és valós klinikai adatokon alapuló kutatások támogatásához.
cikk innen tölthető le.
