Türkçe varlık ismi bağlama
Yükleniyor...
Dosyalar
Tarih
Yazarlar
Bölüm / Program
Bilgisayar Mühendisliği
Dergi Başlığı
Dergi ISSN
Cilt Başlığı
Yayıncı
Lisansüstü Eğitim Enstitüsü
Türü
Özet
Yapısal olmayan dijital metinlerin hacmindeki hızlı artış, bu verilerin anlamlandırılmasını Doğal Dil İşleme alanının temel araştırma problemlerinden biri haline getirmiştir. Bu tez çalışmasında, bilgi çıkarımı sürecinin önemli bir aşaması olan Varlık İsmi Bağlama problemi Türkçe özelinde incelenmiştir. Çalışma kapsamında öncelikle Türkçe Varlık İsmi Bağlama literatüründeki nitelikli veri kümesi eksikliğini gidermek amacıyla; Vikipedi ve Vikiveri tabanlı, zengin dilbilimsel özellikler içeren geniş ölçekli "TurkLink" veri kümesi oluşturularak açık kaynak olarak araştırmacıların erişimine sunulmuştur. Veri kümesinin kalitesini artırmak ve model eğitimine uygun hale getirmek üzere iki aşamalı bir filtreleme mekanizması geliştirilmiştir. Kural tabanlı filtreleme aşamasında, Vikiveri'nin hiyerarşik bilgi grafiği üzerindeki ontolojik ilişkiler kullanılarak hedeflenen on bir varlık sınıfı ile ön eşleştirmeler gerçekleştirilmiştir. Kural tabanlı yaklaşımın neden olabileceği bağlamsal belirsizlikleri gidermek amacıyla uygulanan model tabanlı filtreleme aşamasında ise, Büyük Dil Modelleri tabanlı bir topluluk yapısı kullanılarak kelimelerin cümle içindeki bağlamı analiz edilmiş ve çoğunluk oylaması yöntemiyle nihai etiketler belirlenmiştir. Modelleme aşamasında, literatürdeki popüler ReFinED Varlık İsmi Bağlama mimarisi BERTurk ön-eğitimli dil modeliyle entegre edilerek Türkçeye uyarlanmıştır. Gerçekleştirilen deneylerde, varlık sınırlarının önceden verildiği Anlam Belirsizliği Giderme senaryolarında sistemin hem TurkLink hem de Mewsli-9 test kümelerinde %90'ın üzerinde F1-skoru ile yüksek bir başarım gösterdiği gözlemlenmiştir. Buna karşın, varlık sınırlarının model tarafından tahmin edildiği uçtan uca Varlık İsmi Bağlama senaryolarında, Varlık İfadesi Tespiti aşamasının genel sistem performansını sınırlandıran bir darboğaz oluşturduğu görülmüştür. Bu problemi çözmek amacıyla Varlık İsmi Bağlama görevi; Varlık İfadesi Tespiti ve Anlam Belirsizliği Giderme görevleri olarak ayrıştırılmış, harici bir BERTurk tabanlı Varlık İfadesi Tespiti modelinin sürece dahil edildiği ardışık bir mimari oluşturulmuştur. Gerçekleştirilen karşılaştırmalı analizler ve harici çapraz alan doğrulama testleri sonucunda; uçtan uca çalışan bütünleşik modellerin TurkLink test kümesinde 0,3478, haber metinlerinden oluşan Mewsli-9 test kümesinde ise 0,2927 F1-skorunda kaldığı görülmüştür. Önerilen ardışık mimarinin ise TurkLink'te 0,5317, Mewsli-9 kümesinde ise 0,4773 F1-skoruna ulaşarak modelin farklı metin türlerindeki genellenebilirlik kapasitesini önemli ölçüde artırdığı gözlemlenmiştir. Diğer bir taraftan, geliştirilen Türkçe odaklı ardışık model, Mewsli-9 testlerinde literatürdeki en iyi çok dilli modelleri açık ara geride bırakmıştır. Çok dilli modeller Türkçenin yapısında zorlanıp çok fazla hatalı tahmin yaparak en fazla 0,2960 F1-skorunda kalırken; çalışma kapsamında sunulan sistem 0,4773 F1-skoruna ulaşmış ve en güçlü rakibine 0,1813 puan farkla büyük bir fark atmıştır. Sonuç olarak, Türkçe Varlık İsmi Bağlama uygulamalarında görevlerin ardışık bir mimariyle gerçekleştirilmesinin, uçtan uca yaklaşımlara kıyasla daha kararlı, esnek ve yüksek başarımlı bir çözüm sunduğu sonucuna ulaşılmıştır.
Tanım
Tez (Yüksek Lisans)-- İstanbul Teknik Üniversitesi, Lisansüstü Eğitim Enstitüsü, 2026
Dergi veya Seri
ISSN
ISBN
Haklar
Anahtar Kelimeler
Doğal dil işleme, Natural language processing, Varlık isimleri, Named entities, Veri işleme, Data processing, Veri setleri, Data sets, Yapay zeka, Artificial intelligence