
Beş Teknik Gereksinimle Yapay Zeka Tekniklerinin Eşleştirilmesi
Gerçek uzman görüşmelerinden doğrudan elde edilen net bir teknik gereksinim kümesi elinde olan araştırma ekibi, bu ihtiyaçları gerçekçi biçimde karşılayabilecek yapay zeka teknolojilerini seçme işine geçti. Bu fizibilite çalışması gerçekten geniş bir ağ attı ve üç geniş teknoloji ailesinin bir kombinasyonunu inceledi: doğal dil işleme (NLP), makine öğrenmesi (ML) ve anlamsal teknolojiler. Tek bir yaklaşımı seçip onunla devam etmek yerine araştırmacılar, farklı algoritmaların daha önce tanımlanan beş teknik gereksinimi, yani sorgu genişletme, belge sınıflandırma, belge benzerliği, sıralama ve konu modellemeyi ne kadar iyi karşılayabileceğini sistematik olarak değerlendirdi.
Bu karşılaştırmayı somutlaştırmak için araştırmacılar, farklı yapay zeka ve NLP algoritma kategorilerini beş teknik gereksinimle eşleştiren bir tablo oluşturdu. Metin bölümleme, normalleştirme, lemmatizasyon, kök bulma, kelimeler arası birlikte geçiş tespiti ve çok kelimeli terimlerin çıkarılması gibi doğal dil işleme teknikleri, beş gereksinimin tamamına bir şekilde dokunarak genel olarak ilgili çıktı. Bu mantıklı, çünkü bunlar, daha gelişmiş algoritmaların metinle etkili biçimde çalışabilmesi için ham metni hazırlayan temel tekniklerdir.
Kelime gömme (word embeddings) ve dağılımsal anlambilime odaklanan denetimsiz makine öğrenmesi teknikleri de sorgu genişletme, belge sınıflandırma, belge benzerliği ve konu modellemeyi destekleyerek genel olarak faydalı çıktı, sıralama hariç her şey. Buna karşılık destek vektör makineleri, naif Bayes öğrenmesi, karar ağacı yöntemleri ve rastgele ormanlar gibi denetimli makine öğrenmesi teknikleri, özellikle belge sınıflandırmasıyla ilgili bulundu ve diğer dört gereksinim için daha az kullanışlı değerlendirildi. Sinir ağlarını ve daha geniş anlamda derin öğrenmeyi kapsayan ikinci bir denetimsiz öğrenme kategorisi de yine özellikle belge sınıflandırmasıyla eşleştirildi. Bu arada Jaccard benzerliği, Öklid mesafesi ve kosinüs benzerliği gibi özel benzerlik ölçütleri, esasen kendi temel amaçları olan belge benzerliği görevine eşlendi. Son olarak, sözlüksel-anlamsal bilgi kaynakları ve gizli Dirichlet tahsisi gibi anlamsal teknolojiler bir kez daha genel olarak faydalı çıktı ve sorgu genişletme, belge benzerliği, sıralama ve konu modellemeyi destekledi.
Genel tabloyu bir bakışta görmek isteyenler için eşleştirme kabaca şöyle özetlenebilir:
- NLP teknikleri (bölümleme, normalleştirme, kök bulma, birlikte geçiş tespiti): beş gereksinimin tamamıyla ilgili
- Denetimsiz ML (kelime gömme, dağılımsal anlambilim): sorgu genişletme, sınıflandırma, benzerlik ve konu modellemeyle ilgili
- Denetimli ML (destek vektör makineleri, naif Bayes, karar ağaçları, rastgele ormanlar): esas olarak sınıflandırmayla ilgili
- Sinir ağları ve derin öğrenme: esas olarak sınıflandırmayla ilgili
- Benzerlik ölçütleri (Jaccard, Öklid, kosinüs): belge benzerliğiyle ilgili
- Anlamsal teknolojiler (sözlüksel-anlamsal kaynaklar, gizli Dirichlet tahsisi): sorgu genişletme, benzerlik, sıralama ve konu modellemeyle ilgili
Teknoloji Eşleştirmesi Ne Ortaya Koydu
Bu eşleştirme çalışması, araştırmacılara herhangi bir şey inşa etmeden önce yapay zeka alanına dair net bir bakış açısı kazandırdı. Tek bir teknik ailesi tüm gereksinimleri karşılamıyordu, ancak farklı tekniklerin bir araya getirilmesi, uzmanların gerçekte ihtiyaç duyduğu kapsamın tamamını makul biçimde karşılayabilirdi. Bu bulgu, bugün yapay zeka destekli patent sorgulama araçlarını değerlendiren herkes için önemli, çünkü gerçekten işe yarayan bir sistemin tek bir algoritmaya güvenmek yerine genellikle birkaç yapay zeka yaklaşımını bir arada kullandığını açıklıyor.
Önceki Teknik Araştırması İçin Kavram Modelinin Tasarlanması
Bu alan haritası çıkarıldıktan sonra bir sonraki adım, genel bir kavram modeli tasarlamaktı; yani bir önceki teknik araştırmasının ve patent bilgisinin filtrelenmesinin baştan sona nasıl ilerlemesi gerektiğini ve farklı yapay zeka tekniklerinin bu akışın neresine yerleşeceğini tanımlayan bir taslak. Bu kavram modeli özellikle metodolojik bir araç olarak tasarlandı; araştırmacıların farklı algoritmaları, birbirinden kopuk biçimde test etmek yerine ortak bir çerçeve içinde yapılandırılmış ve karşılaştırılabilir şekilde denemesini sağlayan bir araç.
Önerilen model, tüm sürecin nasıl ilerlemesi gerektiğine dair belirli bir varsayım dizisine dayanır. Süreç, uzmanın başvuruyu okuyup hem bir arama ifadesi hem de buna karşılık gelen bir arama sorgusu tanımlamasıyla başlar; bu da daha önce açıklanan uzman görüşmelerinde gözlemlenen süreçle birebir örtüşür. Buradan itibaren sistem, ilk otomatik adımı devralır ve başvuruyu bir veya daha fazla ilgili sınıfa ayırır. Ardından sistem, basit bir anahtar kelime aramasının gözden kaçırabileceği çok kelimeli teknik terimler de dahil olmak üzere başvurudan en ilgili anahtar kelimeleri çıkarır. Bu çıkarılan anahtar kelimelere dayanarak sistem, sorguyu eş anlamlılar, daha geniş terimler, daha dar terimler gibi ilgili diğer kelimelerle genişletmeyi önerir. Bu noktada kontrol yeniden insana geçer: uzman, kendi uzman değerlendirmesine dayanarak sistemin önerilerini gözden geçirip düzenleyerek arama sorgusunu düzenler.
Sorgu Düzenlemesinden Renk Kodlu Sonuçlara
Sorgu uzman tarafından nihai hale getirildikten sonra sistem, daha önce belirlenen ilgili sınıflardan belgeleri getirmek için gerçek bir arama başlatır. Sistem, uzmana uzun ve farklılaşmamış bir sonuç listesi sunmak yerine alınan belgeleri, her biri kendi temsilci anahtar kelime kümesiyle tanımlanan farklı konulara ayırır. Bu noktada uzman ikinci kez devreye girer ve başvuruyla en ilgili görünen konu ya da konuları seçer. Ardından seçilen konu veya konular içindeki belgeler, orijinal başvuruyla ne kadar benzer olduklarına göre sıralanır. Son bir dokunuş olarak her belgenin içeriği, başvuruyla ne kadar ilgili olduğunu görsel olarak vurgulamak amacıyla renk kodlanır; bu da uzmanın sonuçları hızlı ve sezgisel biçimde taramasını kolaylaştırır.
Bu iş akışının tamamı, araştırmacıların Şekil 1 olarak adlandırdığı, önceki teknik araştırması ve patent bilgisi filtrelemesinin kavram modelini gösteren kavramsal bir diyagramda özetlenir. Burada vurgulanması gereken nokta, bu modelin daha önce tartışılan insan döngüde (human in the loop) felsefesini ne kadar yakından yansıttığıdır; çünkü hiçbir noktada yapay zeka sürecin tamamını tek başına devralmaz. Bunun yerine sistem, otomatik adımlar (sınıflandırma, anahtar kelime çıkarma, sorgu genişletme önerileri, erişim, konu ayırma, sıralama ve renk kodlama) ile uzmanın değerlendirme yaptığı anlar (sorguyu düzenleme ve ilgili konuları seçme) arasında düzenli biçimde geçiş yapar. Bu kasıtlı gidiş geliş, sistemin uzmanın yerini almaya çalışmak yerine onun uzmanlığını desteklemesini sağlayan şeyin ta kendisidir. WOIPS'in pratikte hedeflediği denge de tam olarak budur; otomatik erişim ve sıralamayı açık, incelenebilir bir sonuçla birleştirmek. Bunu kendi buluşunuz için ücretsiz bir yenilik araştırması deneyerek görebilirsiniz.
Modelin Test Edilmesi: Sistemin Kurulması ve Doğrulanması
Bu kavram modelini yalnızca teorik bir çerçeve olarak bırakmak yerine pratikte gerçekten test etmek için araştırma ekibi, bu tasarıma dayanan çalışan bir sistemi Python programlama dili kullanarak hayata geçirdi. Bu sistemin dayandığı belirli harici yazılım kütüphaneleri, teknik uygulama ayrıntılarını incelemek isteyenler için raporun ekinde ayrıca belgelenmiştir.
Araştırmacılar bu sistemi deneysel olarak doğrularken her olası teknoloji alanını aynı anda kapsamaya çalışmadı. Bunun yerine geliştirme sürecinde odaklanılacak üç belirli alanı bilinçli olarak seçti: inşaat mühendisliği, bilgisayar teknolojisi ve ulaşım. Bunlar rastgele seçimler değildi. Araştırmacılar bu alanları, 35 farklı alanı kapsayan standart Dünya Fikri Mülkiyet Örgütü (WIPO) teknoloji alanı sınıflandırma sistemine göre, son on yılda IPO'ya yapılan patent başvurusu sayısı açısından en çok başvurulan ilk üç teknoloji alanını temsil ettikleri için seçti. En yoğun, en çok başvuru alan alanlara odaklanmak, doğrulama çalışmasının dar veya sıra dışı bir niş yerine gerçekçi, yüksek hacimli koşullara dayanmasını sağladı.
Bu üç alanın her biri daha sonra yalnızca gayri resmi değil, patentleri teknik konularına göre sınıflandırmak için Dünya Fikri Mülkiyet Örgütü tarafından yürütülen, uluslararası kabul görmüş bir sistem olan Uluslararası Patent Sınıflandırması (IPC) şeması içindeki karşılık gelen kodlarla tanımlanan belirli buluş alanlarının birleşimi olarak resmi ve kesin biçimde tanımlandı. Her üç alanı temsil etmek için seçilen belirli IPC kodları, raporun ayrı bir ekinde listelenmiştir. Benzer bir mantıkla çalışan Türkiye'deki patent sınıflandırma ve arama sistemine, TÜRKPATENT'in resmi arama sistemi epats.turkpatent.gov.tr üzerinden ulaşılabilir.
Üç alan resmi olarak tanımlandıktan sonra araştırmacılar, IPO'nun kendisi tarafından belirlenen veri kaynaklarından yararlanarak bu IPC sınıf ve alt sınıfları kapsamındaki gerçek patentleri toplayıp karşılık gelen doğrulama veri kümelerini oluşturdu. Orijinal veri, raporun ekinde belgelenen belirli bir şemaya uygun biçimde XML formatında geldi. Yayın tarihi, başvuru sahibi veya sınıflandırma kodu gibi meta verilere göre bu veriyle kolayca çalışıp sorgu yapabilmek için araştırmacılar tüm veriyi özel bir XML veritabanında sakladı; bu da çalışmanın geri kalanı için tüm deneysel iş hattına sağlam ve düzenli bir teknik temel kazandırdı. Bu hattın temelindeki yapılandırılmış, sınıflandırma odaklı yaklaşım, tek bir manuel sorgunun çok ötesinde, ölçekli ve sistematik bir patent bilgisi araştırmasını da mümkün kılan şeydir.
Sıkça Sorulan Sorular
Otomatik patent önceki teknik araştırması için hangi yapay zeka teknikleri değerlendirildi?
Çalışma; doğal dil işleme, makine öğrenmesini (hem denetimli hem denetimsiz) ve anlamsal teknolojileri değerlendirdi ve her kategoriyi sorgu genişletme, sınıflandırma, belge benzerliği, sıralama ve konu modelleme olmak üzere beş teknik gereksinimle eşleştirdi.
Yapay zeka destekli patent aramasında kavram modeli nedir?
Kavram modeli, yapay zeka destekli bir önceki teknik araştırmasının baştan sona nasıl ilerlemesi gerektiğini tanımlayan bir taslaktır; sınıflandırma ve sıralama gibi otomatik adımlarla uzmanın sorguyu düzenlediği ve ilgili konuları seçtiği insan adımları arasında geçiş yapar.
Patent aramasında belge sınıflandırması için en iyi yapay zeka tekniği hangisidir?
Çalışma, sınıflandırmayla ilgili birkaç seçenek buldu; bunlar arasında destek vektör makineleri ve rastgele ormanlar gibi denetimli makine öğrenmesi yöntemleri ile sinir ağları ve denetimsiz kelime gömme teknikleri yer alıyor.
Araştırmacılar modeli neden inşaat mühendisliği, bilgisayar teknolojisi ve ulaşım alanlarında test etti?
Bu üç alan, WIPO'nun teknoloji alanı sınıflandırmasına göre son on yılda IPO'ya en çok patent başvurusu yapılan alanlardı ve bu da onları sistemi doğrulamak için gerçekçi, yüksek hacimli alanlar haline getirdi.
Bu modelde yapay zeka patent uzmanının yerini alıyor mu?
Hayır. Kavram modeli, uzmanı kritik karar noktalarında döngüde tutar; uzman arama sorgusunu düzenler ve ilgili konuları seçerken yapay zeka sınıflandırma, anahtar kelime çıkarma, erişim, sıralama ve görsel vurgulama işlerini yürütür.
This article is adapted from: UK Intellectual Property Office, AI-assisted patent prior art searching – feasibility study, April 2020, ISBN 978-1-910790-80-9, © Crown Copyright 2020, licensed under the Open Government Licence v3.0.
