Patent Metninden Özellik Çıkarımı Nasıl Yapılır?

Yapay zekanın ham patent metnini TF-IDF, çok kelimeli terimler ve kelime gömmeleriyle nasıl anlamlandırdığını keşfedin ve ücretsiz yenilik araştırması deneyin

Patent Metninden Özellik Çıkarımı Nasıl Yapılır?

Ham Patent Metninden Kelime Torbası Özelliklerine

Patent metninden özellik çıkarımı, algoritmaların bir belgeyle çalışabilmesi için belgedeki sözcüksel ve anlamsal yapı taşlarının otomatik olarak ayıklanması işlemidir ve sorgu genişletme, belge sınıflandırma ve konu modelleme gibi sonraki aşamaların temelini oluşturur. Herhangi bir yapay zeka sistemi belgeleri sınıflandırmadan, bir arama sorgusunu genişletmeden veya patentler arasındaki benzerliği ölçmeden önce, metnin kendisini makinenin işleyebileceği bir biçimde temsil etmenin bir yoluna ihtiyaç duyar. Araştırma ekibi bu konuya, her biri farklı bir dilsel ayrıntı düzeyini yakalayan üç katmanlı bir yaklaşımla yaklaştı: tek kelimeler, çok kelimeli terimler ve son olarak anlamın kendisini yakalayan kelime gömmeleri (word embeddings).

En temel düzeyde sistemin belge temsili, "kelime torbası" (bag-of-words) modeline dayanır. Her belge, dilbilgisi, cümle yapısı veya kelime sırası hiçbir şekilde dikkate alınmadan, içerdiği kelimelerden oluşan basit bir koleksiyon yani bir "torba" olarak ele alınır. İlk bakışta bu kaba bir basitleştirme gibi görünebilir ve bir ölçüde öyledir de. Yine de bu temsil, bilgi erişimi ve belge sınıflandırmada dikkat çekici ölçüde başarılı olduğunu kanıtlamıştır; bunun başlıca nedeni, söz konusu kelime sayısının çokluğunun, belirli bir kelimenin yerel olarak ne kadar ilgili olduğunu ölçmeyi kolaylaştırmasıdır. Bunun için kullanılan standart ölçüt, terim sıklığı-ters belge sıklığı yani kısaca TF-IDF'dir; bu, kökeni Spärck Jones (1972) ile Salton ve McGill (1986) tarafından yapılan temel çalışmalara uzanan, köklü bir tekniktir.

Kelimeleri Normalleştirerek Varyantları Eşleştirme

Tek tek kelimeler, ancak sistem farklı yazım biçimlerinin aslında aynı kelime olduğunu fark edebilirse yararlı özellikler haline gelir. Bunu sağlamak için araştırmacılar, anlamca aynı olan kelimeler arasındaki önemsiz yazım farklarını ortadan kaldıran temel bir dilsel ön işleme uyguladı:

  • Harf büyüklüğü, böylece "Bayesian learning" ve "bayesian learning" tek bir terim olarak ele alınır
  • ASCII dışı karakterler, böylece "naïve Bayes" ve "naive Bayes" eşleşir
  • İngilizce lehçeler arasındaki yazım farkları, örneğin "nearest neighbour" ve "nearest neighbor"
  • Yazım hataları, ki bunlar otomatik olarak düzeltilir

Bunun ötesinde sistem, kelimeleri temel köküne veya çekirdek anlamına indirgeyen lemmatizasyon ve kök bulma (stemming) tekniklerini uyguladı. Örneğin "transportation," "transported" ve "transporter" kelimelerinin tümü ortak "transport" köküne indirgenir; böylece sistem, bu farklı biçimlerin aynı temel kavramla ilgili olduğunu anlayabilir. Patent yazarları aynı fikir için nadiren birebir aynı ifadeyi kullandığından, bu tür bir normalleştirme her ciddi patent bilgisi araştırmasının temel yapı taşlarından biridir. Türkiye'deki patent kayıtlarını incelemek isteyenler için TÜRKPATENT'in resmi arama sistemi epats.turkpatent.gov.tr de başvurulabilecek güvenilir bir kaynaktır.

Çok Kelimeli Özellikler ve N-gramların Sınırları

Tek kelimeler, yalnızca belirli kombinasyonlarda bir araya geldiklerinde ortaya çıkan anlamın büyük bölümünü kaçırır. Araştırmacılar, tek tek kelimeler arasındaki ilişkileri yakalamak için kelimelerin birlikte geçişine dayanan iki tamamlayıcı yaklaşımı denedi: n-gram adı verilen sabit boyutlu metin pencereleri ve alana özgü çok kelimeli terimlere odaklanan ayrı bir yöntem.

N-gramlar, tek tek kelimelerin etrafındaki yerel bağlamı korur; bu nedenle kelime torbası temsilinin üzerine eklenerek belgeler arasında daha ayrıntılı bir karşılaştırma yapılmasını sağlayabilir. Ancak gerçek bir sınırlılıkları vardır. Metni yalnızca fiziksel yakınlığa göre sabit boyutlu bloklara böler, kelimeler arasındaki mantıksal, sözdizimsel veya anlamsal ilişkileri hiç dikkate almazlar ve bu durum gerçek bilginin kaybolmasına yol açabilir. Araştırmacılar sorunu öğretici bir örnekle gösterir. Bir belge "the way of doing things on the Internet has evolved" ifadesini, bir diğeri ise "five ways the Internet of Things is transforming businesses" ifadesini içerir. Kelime torbası olarak temsil edildiğinde bu iki belge, her ikisi de "Internet" ve "things" kelimelerini içerdiği için oldukça benzer görünür. Oysa yalnızca ikincisi, internet üzerinden birbirine bağlanan ve veri gönderip alabilen gündelik bilgisayar cihazlarını tanımlayan standart teknik terim olan Nesnelerin İnterneti'ne (Internet of Things) atıfta bulunur. Art arda iki kelimeyi eşleştiren bi-gram yaklaşımı bu ayrımı yakalayamaz. Tri-gramlar "Internet of Things" ifadesini tek bir özellik olarak başarıyla yakalardı, ancak bu bile "Internet Small Computer System Interface" gibi daha uzun teknik terimler için yeterli değildir. Yani kaç kelimeye yayılırsa yayılsın önemli ifadeleri yakalayabilecek, daha esnek bir yaklaşıma açıkça ihtiyaç vardı.

FlexiTerm ile Teknik Terimleri Çıkarma

Çok kelimeli terimler tam da bu noktada devreye girer. Bunlar alana özgü kavramların dilsel temsili olarak işlev görür ve teknik ile bilimsel bilgiyi bütünlüklü birimler halinde ilettikleri için metin sabit boyutlu n-gramlara mekanik olarak bölündüğünde kaybolma eğilimindedirler. Bunları doğru biçimde ele almak için araştırma ekibi, metinden çok kelimeli terimleri anında çıkarmak üzere geliştirilmiş ve Spasić ve arkadaşlarının önceki araştırmalarına (2013, 2018) dayanan, yerel olarak geliştirilmiş FlexiTerm adlı bir yazılım aracını kullandı. Özellikle yararlı bir yeteneği, kısaltmaları temsil ettikleri tam terimlere bağlayabilmesidir; örneğin "Internet of Things" ifadesini "IoT" kısaltmasına veya "Internet Small Computer System Interface" ifadesini "ISCSI" kısaltmasına bağlar. Bir kısaltmayı tam biçimine açmak, onu oluşturan kelimeleri aranabilir hale getirir ve anlaşılmaz bir kısaltmayı, sonraki belge analizi için kullanılabilir bir özelliğe dönüştürür. Yapay zeka destekli bir aracın yoğun teknik terminolojiyle pratikte nasıl başa çıktığını görmek isterseniz, kendi buluşunuz için WOIPS ile ücretsiz bir yenilik araştırması deneyebilirsiniz.

Sistem ayrıca, aynı temel terimin farklı varyantlarını tek bir özellik altında gruplandıracak şekilde tasarlandı. Belgelenmiş bir örnek, basit bir yazım farkıdır: "bottom hole assembly" ve "bottomhole assembly" ifadelerinin her ikisi de sistem tarafından ortak "BHA" kısaltmasına bağlanır. Daha karmaşık bir örnek ise kelime sırasının kendisinin farklılaştığı gerçek bir sözdizimsel varyasyonu içerir: "network functions virtualization" ve "virtual network function". Bunlar, temelde aynı kavram için NFV ve VNF olmak üzere iki farklı kısaltma üretir. Burada bile kök bulma, "virtual" ve "virtualization" kelimelerinin aynı kökü paylaştığını fark ederek varyantları yüzey biçimleri yerine çekirdek anlamları üzerinden birbirine bağladı. Çıkarılan terimlerin taranabilir olması için sistem, bunları ilgili terimleri türe göre bir araya getiren ağaç benzeri diyagramlar olan dendrogramlar halinde de düzenleyebiliyordu.

Kelime Gömme: Anlamın Kendisini Yakalamak

Tek kelimeli ve çok kelimeli yaklaşımların ikisi de kelimeleri ayrık, birbirinden bağımsız değişkenler olarak temsil eder; bu da iki kelimenin anlamca ne kadar benzer olduğunu karşılaştırmanın veya aralarındaki daha ince anlamsal ilişkileri yakalamanın yerleşik bir yolu olmadığı anlamına gelir. Bu boşluğu kapatmak için araştırmacılar, temelden farklı bir temsil türüne yöneldi: kelime gömmeleri.

Kelime gömmeleri, anlama aşağıdan yukarıya yaklaşan ve dağılımsal hipotez etrafında şekillenen dağılımsal anlambilime dayanır; bu hipoteze göre bir metin kütlesinde benzer bağlamlarda görünen kelimeler benzer anlamlara sahip olma eğilimindedir. Uygulamada her kelime, sinir ağları veya boyut indirgeme gibi tekniklerle metinden otomatik olarak öğrenilen, nispeten düşük boyutlu gerçek değerli bir vektör olarak temsil edilir. Bir kelimenin göründüğü tipik bağlamı genelleyerek gömmeler, kelimeler arasındaki anlamlı ilişkileri korur ve bunları vektör uzayında geometrik olarak mesafeler ve yönler biçiminde ifade eder. Ayrıca, Hughes (1968) tarafından ilk kez tanımlanan ve verideki boyut sayısı çok büyüdüğünde birçok makine öğrenmesi algoritmasının performansının düştüğü bir olgu olan "boyutluluk laneti"ni de aşmaya yardımcı olurlar.

Alana Özgü Kelime Gömmelerinin Önemi

Bu çalışmada araştırmacılar, köklü ve en gelişmiş kelime gömme algoritmalarından biri olan word2vec'i (Mikolov ve ark., 2013) kullanarak seçilen üç alanın her biri için ayrı kelime gömmeleri eğitti. Sonuç, herkese uyan tek tip gömmeler yerine gerçekten alana özgü kelime temsilleri oldu ve bu, pratikte büyük önem taşıyor. Raporun eklerinden birinde belgelenen "driver" kelimesini ele alalım. İnşaat mühendisliğinde fiziksel bir mekanik nesneyi, bilgisayar teknolojisinde bir yazılım parçasını, ulaşım alanında ise bir aracı kullanan kişiyi ifade edebilir. Gömmeler her alan için ayrı eğitildiğinden, kelimenin benzer veya ilişkili diğer kelimelerle olan farklı ilişkileri üzerinden bu farklı anlamları yakaladı.

Ulaşım alanında "driver", "vehicle-operator" gibi eş anlamlılara, "cyclist" gibi daha özel terimlere (alt kavramlar) ve "passenger" gibi ilişkili kavramlara yakın konumlanır. Bilgisayar teknolojisinde ise aynı kelime, bunun yerine "controller" gibi eş anlamlıların ve "I/O" gibi ilişkili terimlerin yakınında kümelenir ve bu, o alandaki tamamen farklı teknik anlamını yansıtır. Anlamı alan bağlamından ayırt edebilme yeteneği, daha basit tek kelimeli ve çok kelimeli yaklaşımlara göre gerçek bir ilerlemedir. Aynı zamanda güvenilir bir önceki teknik araştırmasının yalnızca anahtar kelime eşleştirmeye değil, bağlamı anlamaya dayanması gerektiğini de gösterir. Yapay zeka destekli bir aramanın kendi buluşunuzu nasıl ele aldığını görmek için WOIPS Yenilik Araştırması hizmetini inceleyin.

Sıkça Sorulan Sorular

Patent aramasında özellik çıkarımı nedir?
Özellik çıkarımı, algoritmaların belgeleri sınıflandırabilmesi, sorguları genişletebilmesi ve patentleri karşılaştırabilmesi için tek kelimeler, çok kelimeli terimler ve kelime gömmeleri gibi sözcüksel ve anlamsal yapı taşlarının ham patent metninden otomatik olarak ayıklanması işlemidir.

Kelime torbası modeli nedir ve patentler için neden kullanılır?
Kelime torbası modeli, her belgeyi dilbilgisini ve kelime sırasını yok sayarak içerdiği kelimelerden oluşan bir koleksiyon olarak temsil eder. TF-IDF gibi ölçütler her kelimenin bir belgeyle ne kadar ilgili olduğunu sayısallaştırabildiği için erişim ve sınıflandırmada iyi sonuç verir.

N-gramlar teknik patent terminolojisi için neden yeterli değildir?
N-gramlar metni yalnızca yakınlığa göre sabit boyutlu bloklara böler; bu nedenle "Internet Small Computer System Interface" gibi daha uzun teknik terimleri kaçırabilir ve "Internet of Things" gibi ifadeleri, "Internet" ile "things" kelimelerinin ilgisiz geçişlerinden ayıramayabilir.

FlexiTerm bir patent arama sisteminde ne yapar?
FlexiTerm, metinden çok kelimeli teknik terimleri çıkarır, aynı terimin yazım ve kelime sırası varyantlarını gruplandırır ve kısaltmaları tam biçimlerine bağlar; bu da bu terimlerin içindeki tek tek kelimeleri aranabilir hale getirir.

Kelime gömmeleri neden her teknoloji alanı için ayrı eğitilir?
Aynı kelime farklı alanlarda çok farklı anlamlara gelebilir. Gömmeleri alan bazında eğitmek, sistemin "driver" gibi bir kelimeyi ulaşımda araçla ilgili terimlerin yakınına, bilgisayar teknolojisinde ise "controller" gibi terimlerin yakınına yerleştirmesini sağlar.


This article is adapted from: UK Intellectual Property Office, AI-assisted patent prior art searching – feasibility study, April 2020, ISBN 978-1-910790-80-9, © Crown Copyright 2020, licensed under the Open Government Licence v3.0.