Yapay zeka temelleri

Yapılandırılmış ve Yapılandırılmamış Veri

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapılandırılmış veri tanımlı bir şemaya uyar, yapılandırılmamış veri ise sabit bir alan tablosuna düzgün şekilde sığmaz. Aralarında yarı‑yapılandırılmış veri bulunur; bu veri etiketler, anahtarlar veya diğer düzenlemeler içerir, ancak her kaydın aynı katı sütunları paylaşmasını gerektirmez.

Bu ayrım, bilginin nasıl temsil edildiğini ve yönetildiğini açıklar; değerli, sayısal, niteliksel veya anlaşılır olup olmadığıyla ilgili değildir. Bir belge depolama katmanında yapılandırılmamış olabilir, ancak yine de bir AI sisteminin çıkarabileceği isimler, tarihleri, tabloları ve ilişkileri içerebilir.

Temel Çıkarımlar

  • İlişkisel bir tablodaki satırlar yapılandırılmıştır; JSON olayları ve birçok günlük yarı‑yapılandırılmıştır; metin, görseller, ses ve video genellikle yapılandırılmamış olarak kabul edilir.
  • NoSQL veritabanları yapılandırılmış veya yarı‑yapılandırılmış kayıtları depolayabilir; bunlar yapılandırılmamış veri ile eş anlamlı değildir.
  • Veri gölleri, veri ambarları, göl evleri ve vektör veritabanları, depolama ve analiz sorunlarının farklı bölümlerini çözer.
  • Üç kategori boyunca meta veri, köken, erişim kontrolleri ve kalite kontrolleri önem taşır.
Three-column comparison of structured tables, semi-structured JSON records, and unstructured documents and media, with typical storage and AI processing methods
Yapılandırılmış, yarı‑yapılandırılmış ve yapılandırılmamış veriler, şemalarının ne kadar açık temsil edildiğine göre temel olarak farklılık gösterir.

Yapılandırılmış veri nedir?

Yapılandırılmış veri, her alana bir tür ve anlam atayan önceden tanımlı bir model kullanır. İlişkisel bir veritabanında satırlar kayıtları, sütunlar ise öznitelikleri temsil eder. Kısıtlamalar, benzersiz bir tanımlayıcı, geçerli bir tarih veya başka bir tabloyla ilişki gerektirebilir.

Örnekler arasında işlem kayıtları, envanter sayımları, sensör ölçümleri, hesap bakiyeleri ve etiketli eğitim tabloları bulunur. CSV ve elektronik tablo dosyaları da yapılandırılmış veri içerebilir; ancak genellikle bir veritabanına göre daha az kısıtlama uygular.

Yapılandırılmış veri, filtreleme, toplama, birleştirme ve geleneksel makine öğrenimi iş akışları için uygundur. Ancak otomatik olarak temiz veya güvenilir değildir: yinelenen varlıklar, değişen tanımlar, eksik değerler ve veri sızıntısı analizleri geçersiz kılabilir.

Yarı‑yapılandırılmış veri nedir?

Yarı‑yapılandırılmış formatlar organizasyon işaretleri taşır ancak kayıtların değişken olmasına izin verir. JSON, XML, e‑posta başlıkları, uygulama olayları ve birçok web ya da ağ günlüğü yaygın örneklerdir. Bir JSON kaydı, tüm geçmiş kayıtların yeniden yazılmasını zorunlu kılmadan yeni bir alan ekleyebilir.

Bu esneklik, gelişen uygulamaları destekler, ancak işi ayrıştırma, doğrulama, sürümleme ve şema keşfine kaydırır. Üretim sistemleri, temel format esnek olsa bile genellikle bir sözleşme uygular.

Yapılandırılmamış veri nedir?

Yapılandırılmamış veri, ana içeriği için önceden tanımlı bir tablo modeline sahip değildir. Örnekler arasında raporlar, destek konuşmaları, kaynak kod dosyaları, fotoğraflar, tıbbi görüntüler, kayıtlar ve videolar bulunur. “Yapılandırılmamış” rastgele anlamına gelmez: bir fotoğrafın uzamsal yapısı, dilin dilbilgisi ve sesin zamansal desenleri vardır.

Yapılandırılmamış veri genellikle dosya ya da nesne olarak depolanır; sahip, zaman damgası, izinler ve içerik türü gibi meta veriler ise yapılandırılmış bir katalogda tutulur. Sistemler daha sonra arama, metin sınıflandırması, bilgisayarlı görme, transkripsiyon veya bilgi çıkarımı kullanarak içeriği kullanılabilir hâle getirebilir.

Yazma‑esnasında şema ve okuma‑esnasında şema

Yazma‑esnasında şema, veriyi analiz için depolanmadan önce doğrular ve dönüştürür. Tutarlı raporlamayı destekler ancak daha fazla ön modelleme gerektirir. Okuma‑esnasında şema, ham ya da hafif işlenmiş veriyi depolar ve bir iş yükü okuduğunda yapıyı uygular. Bu esneklik sağlar, ancak yönetişim güçlü değilse çelişkili tanımlara yol açabilir.

Modern sistemler genellikle ikisini birleştirir. Ham olaylar nesne depolamaya düşebilir, doğrulanmış tablolar analizleri destekleyebilir ve görev‑özel özellikler ya da gömmeler (embeddings) ML uygulamalarına besleme yapabilir.

Veri ambarları, göller, göl evleri ve vektör veritabanları

  • Veri ambarları, analiz, raporlama ve yönetilen SQL erişimi için düzenlenmiş tabloları organize eder. Unite.AI’nin veri ambarı rehberine bakın.
  • Veri gölleri, genellikle nesne depolamada, ham ve işlenmiş dosyaların büyük hacimlerini depolar. Bir göl hâlâ kataloglara, erişim kontrollerine, yaşam döngüsü politikalarına ve kalite yönetimine ihtiyaç duyar.
  • Göl evleri (lakehouses), veri gölü depolamasına tablo yönetimi ve yönetişim yetenekleri ekler, böylece analiz ve ML aynı mimariyi paylaşabilir.
  • Vektör veritabanları ve indeksleri, vektör benzerlik araması için kullanılan gömmeleri (embeddings) depolar. Bir gömme, orijinal içeriğin gerçek yapılandırılmış gerçeklere dönüştürülmesi değil, türetilmiş sayısal bir temsildir.

İçeriği kullanılabilir veriye dönüştürmek

Bir belge iş akışı OCR çalıştırabilir, düzeni algılayabilir, varlıkları çıkarabilir, pasajları bölüp gömmeler (embeddings) oluşturabilir ve kaynak meta verisini ekleyebilir. Bir görsel iş akışı etiketler, sınırlayıcı kutular veya öğrenilmiş özellikler ekleyebilir. Bu süreçler, özgün öğeyi ve kökenini korurken yapılandırılmış türevler üretir.

Bir otomatik kod çözücü (autoencoder) sıkıştırılmış bir temsil öğrenebilir, ancak yapılandırılmamış içeriği otomatik olarak doğrulanmış satır veya etiketlere dönüştürmez. İnsan incelemesi, alan kuralları ve kalite ölçümü hâlâ gerekebilir.

Yönetişim ve güvenlik

Her format kişisel, gizli, telif hakkı korumalı veya düzenlenmiş bilgiler içerebilir. Yönetişim, sınıflandırma, köken, saklama, onay, erişim kontrolü, silme ve bir model çıktısını kaynağına izleyebilme yeteneğini kapsamalıdır. Yapılandırılmamış depolar, hassas bilginin normal dosyalar içinde gömülü olabileceği için özellikle gözden kaçması kolaydır.

Depolama modelleri, şemalar ve analitik sonuçlar

Yapılandırılmış veri açık bir şemaya uyar: satırlar, sütunlar, türler, anahtarlar ve kısıtlamalar doğrulamayı ve birleştirmeyi öngörülebilir kılar. Metin, görseller, ses ve video gibi yapılandırılmamış veriler tek bir tablo modeline sahip değildir, ancak hâlâ formatlar, meta veriler, iç yapı ve kökeni vardır. Yarı‑yapılandırılmış JSON, günlükler, belgeler ve olaylar alanları ortaya çıkarırken değişkenliğe izin verir. Bu nedenle ayrım, bilginin var olup olmadığı değil, yapının gücü ve konumuyla ilgilidir. Yazma‑esnasında şema depolamadan önce doğrularken; okuma‑esnasında şema veri kullanıldığında yorumlar.

İlişkisel veritabanları işlemler ve yönetilen ilişkiler için uygundur; sütunlu ambarlar analitik taramalar için; nesne depoları büyük dosyalar ve açık tablo formatlarını tutar; arama indeksleri sözcüksel geri getirmeyi destekler; vektör indeksleri benzerliği; grafik veritabanları ilişkileri temsil eder. Tek bir veri kümesi, farklı erişim kalıpları için birden çok sistemde bulunabilir. Kopyaların sessizce farklılaşmaması için yetkili kaynakları ve kökeni tanımlayın. Meta veriler, sahip, sınıflandırma, zaman damgaları, birimler, şema sürümü, haklar, saklama ve türetilmiş temsil ile özgün içerik arasındaki bağlantıları içermelidir.

Karışık veriyi AI sistemleri için hazırlamak

Yapılandırılmış özellikler, tür kontrolleri, eksik değer politikası, kategori işleme ve sızıntı önleme gerektirir. Metin için ayrıştırma, dil tespiti, segmentasyon ve kodlama gerekir; görseller için kod çözüm doğrulaması, renk ve yön işleme; ses için örnekleme hızı ve kanal kontrolü gerekir. Çıkarılan metin, gömmeler, etiketler, altyazılar ve model çıktıları kendi sürüm ve kalitesine sahip türetilmiş verilerdir. Dönüşümleri yeniden üretilebilir tutun ve çıkarım hatalarını ayrı ayrı değerlendirin; çünkü sonraki bir model, daha önceki ayrıştırıcı tarafından atılan veya bozulmuş bilgiyi geri kazanamaz.

Güvenlik ve gizlilik kontrolleri, ham ve türetilmiş biçimleri kapsamalıdır. Yapılandırılmamış dosyalar gizli kişisel veri, kötü amaçlı makrolar, gömülü talimatlar veya telif hakkı korumalı materyal içerebilir; yapılandırılmış tablolar birleştirmelerle yeniden tanımlamayı mümkün kılabilir. Yüklemeleri tarayın, ayrıştırıcıları izole edin, toplama miktarını azaltın, amaca yönelik erişimi zorlayın ve silmeyi yaygınlaştırın. Tamamlanma, geçerlilik, çoğaltma, tazelik ve anlamsal tutarlılığı, her modaliteye uygun kontrollerle ölçün. Tek bir birleşik göl, birleşik bir anlam yaratmaz—yönetişimli tanımlayıcılar, sözleşmeler ve sahiplik, heterojen verilerin birlikte kullanılabilir olmasını sağlar.

Uygulamalı örnek: destek kayıtları ve çağrı sesinin birleştirilmesi

Bir hizmet ekibi, yapılandırılmış bilet alanlarını çağrı transkriptleri ve onaylanmış ses‑türevi özelliklerle bağlar. Kararlı etkileşim kimlikleri ve zaman damgaları kayıtları ilişkilendirirken, ham ses daha kısa saklama süresi olan kısıtlı bir sistemde kalır. Ayrıştırıcılar, transkripsiyon ve dil tespiti sürümlendirilir ve ayrı ayrı değerlendirilir. Veri ambarı yönetilen bilet gerçeklerini depolar, nesne depolama izin verilen medyayı tutar ve bir arama indeksi metin geri getirmeyi destekler; her kopyanın bir sahibi ve silme yolu vardır.

Kalite testleri eksik çağrıları, yinelenen biletleri, dil bazlı transkript hatalarını, saat dilimi uyumunu ve bir CRM geçişi sonrası anlamı değişen alanları kapsar. Türetilmiş gömmelere erişim, anonim olarak değil, orijinal hassasiyete göre izlenir. Analistler bir gösterge tablosu sonucunu kaynak etkileşim ve model sürümüne bağlayabilir. Bir arayan silme talep ettiğinde, ham veri, transkript, indeks ve sonraki eğitim uygunluğu tek bir belgelenmiş iş akışıyla ele alınır.

Uygulama kanıtları ve operasyonel hazırlık

Bir üretim kararı, başarılı bir gösteriden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce yeniden üretilebilir bir temel ve sürümlendirilmiş bir değerlendirme seti oluşturun. Normal durumları, sınır koşullarını, hatalı ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, kötü kullanımı ve muhtemelen yetersiz hizmet alabilecek grup ya da ortamları test edin. Görev kalitesini kalibrasyon veya belirsizlik, gecikme, verim, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir gözden geçirenin sonucu yeniden üretebilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşümü ve eşiği kaydedin.

Başlamadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkisini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüşü koruyun ve kasıtlı olarak eklenmiş hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamayarak giriş kalitesini, çıktı davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve doğrulanmış sonuçları ortaya koymalıdır. Uyarı eşikleri ve bir yanıt sorumlusu tanımlayın, ardından çevrim dışı performansın devam edeceğini varsaymak yerine dağıtımdan sonra gerçek dünyadaki kanıtları inceleyin. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım veya hedefler değiştiğinde yeniden değerlendirin. Sürekli bakım yapılan bir sistem, belgelenmiş bir kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gereken net bir noktaya da ihtiyaç duyar.

Ana referanslar

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.