Röportajlar

Astronomer’in Veri ve Yapay Zeka Başkan Yardımcısı Steven Hillion – Röportaj Serisi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Steven Hillion, Astronomer’de Veri ve Yapay Zeka Başkan Yardımcısı’dır. Burada, araştırma matematiği alanındaki kapsamlı akademik geçmişini ve Silicon Valley’deki makine öğrenimi platformu geliştirme deneyimini kullanmaktadır. Astronomer’de, özellikle ML ve AI takımları için tasarlanmış Apache Airflow özellikleri oluşturmayı yönlendirmekte ve dahili veri bilimcisi ekibini denetlemektedir. Liderliği altında, Astronomer modern veri düzenleme platformunu geliştirmiştir. Bu, çeşitli veri kaynaklarına ve görevlere destek sağlamak için veri boru hattı yeteneklerini önemli ölçüde artırmıştır.

Veri biliminde ve yapay zekada yolculuğunuz hakkında bilgi verebilir misiniz? Bu, mühendislik ve analitik takımlarını yönetme yaklaşımınızı nasıl şekillendirdi?

Önce Berkeley’de araştırma matematiği geçmişim vardı, daha sonra Silicon Valley’ye geçip başarılı birkaç start-up’ta mühendis olarak çalıştım. Akademiden politikaları ve bürokrasisini geride bırakmaktan memnun olduğum halde, birkaç yıl içinde matematiği özlediğimi fark ettim. Böylece makine öğrenimi ve analitik platformları geliştirmeye yöneldim ve bundan sonra da bunu yapmaya devam ettim.

Saf matematik eğitimim, veri bilimcilerin ‘parsimoni’ dediği şeyi tercih etmemi sağladı – işi yapmak için doğru araç ve hiçbir şey daha fazlası değil. Matematikçiler, karmaşık makinelerden ziyade zarif çözümlere eğilimlidir, bu nedenle iş sorunlarına makine öğrenimi uygularken basitliği vurgulamaya çalıştım. Derin öğrenme bazı uygulamalar için harikadır – büyük dil modelleri, örneğin, belgeleri özetlemek için mükemmeldir – ancak bazen basit bir regresyon modeli daha uygun ve açıklamaya daha kolaydır.

Son yirmi yılda, özellikle makine öğrenimi yaygınlaştıktan sonra, veri bilimcisi ve yazılım mühendisinin rolünün değişimini görmek ilginçti. Her iki şapka da giydim ve makine öğrenimi projelerine uygulanacak yazılım geliştirme yaşam döngüsünün (özellikle otomasyon ve test) önemini çok iyi anladım.

AI ve büyük dil modelleri (LLM’ler) için yapılandırılmamış verilerin taşınması, işlenmesi ve analizinde en büyük zorluklar nelerdir?

Yapay Zeka dünyasında, veriniz en değerli varlığınızdır. Modeller giderek daha çok standart hale gelmektedir, bu nedenle farklılaşma, kazanılmış kurumsal bilgilerinizdir. Bu, sizin özel ve düzenlenmiş veri kümelerinizdedir.

Doğru veriyi doğru zamanda teslim etmek, veri boru hatlarınız üzerinde yüksek talepler oluşturur – ve bu, yapılandırılmamış veri için olduğu kadar yapılandırılmış veri için de geçerlidir, belki de daha fazla. Çoğu zaman, birçok farklı kaynaktan ve birçok farklı formattan veri alırsınız. Verileri model çıkarımı veya model eğitimi için hazırlamak için çeşitli yöntemlere erişiminiz olmalıdır. Ayrıca verilerin kökenini ve nereye gittiğini anlamak zorundasınız, böylece “çalışmanızı gösterebilirsiniz”.

Eğer bunu sadece arada bir modeli eğitmek için yapıyorsanız, bu sorun değil. Bunu operasyonelleştirmek zorunda değilsiniz. Ancak modeli günlük olarak, müşteri sentimentini çevrimiçi forumlardan anlamak veya faturaları özetlemek ve yönlendirmek için kullanıyorsanız, bu, herhangi bir diğer operasyonel veri boru hattı gibi görünmeye başlar, bu nedenle güvenilirlik ve tekrar üretilebilirlik hakkında düşünmelisiniz. Veya modeli düzenli olarak ince ayarlıyorsanız, doğruluk ve maliyet hakkında endişelenmelisiniz.

İyi haber, veri mühendislerinin veri boru hatlarını yönetmek için harika bir platform geliştirmiş olmasıdır – Airflow. Bu, dünyanın en sofistike ML takımları tarafından zaten model dağıtımı ve izleme için başarıyla uygulanmıştır. Böylece modeller yeni olabilir, ancak orkestrasyon değildir.

Sentetik veri kullanarak daha küçük modelleri doğruluk için ince ayarlamak hakkında daha fazla bilgi verebilir misiniz? Bu, daha büyük modelleri eğitmekle karşılaştırıldığında nasıl karşılaştırılır?

Bu, güçlü bir tekniktir. En iyi büyük dil modellerini, dünyanın hakkında ne öğrendiklerini kapsayan bir şekilde düşünün ve bunları daha küçük modellere aktarabilirler. LLM’ler, çeşitli veri kümelerinden öğrenilen大量 bilgiyi kapsüller. Bu modeller sentetik veri üretebilir, bu da öğrenilen kalıpları, yapıları ve bilgileri yakalar. Bu sentetik veri daha sonra daha küçük modelleri eğitmek için kullanılabilir, böylece daha büyük modellerden daha küçük olanlara bazı bilgiler aktarılır. Bu işlem genellikle “bilgi damıtma” olarak adlandırılır ve verimli, daha küçük modeller oluşturur, bunlar da belirli görevlerde iyi performans gösterir. Ayrıca sentetik veri kullanarak gizlilik sorunlarını önleyebilir ve eğitim verisinin küçük veya eksik olduğu durumlarda boşlukları doldurabilirsiniz.

Bu, daha domain-spesifik bir yapay zeka modeli eğitmek için faydalı olabilir ve hatta daha “büyük” bir modeli eğitmekten daha etkili olabilir, daha fazla kontrol sağlar.

Veri bilimcileri zaten bir süredir sentetik veri üretiyorlar ve verilerin dağılımı hakkında yanlış varsayımlar yapmadan veya yanlılıklar tanıtmadan çok dikkatli olmak gerekiyor. Şimdi sentetik veri üretimi çok daha kolay ve güçlü, bu nedenle daha da dikkatli olmak gerekiyor. Hatalar büyütülebilir.

Üretilen veride çeşitlilik eksikliği ‘model çökmesi’ne neden olabilir. Model iyi performans gösteriyor gibi görünür, ancak bunun nedeni tüm resmi görmemesidir. Ayrıca, genel olarak, eğitim verisinde çeşitlilik eksikliği, veri takımlarının her zaman dikkat etmesi gereken bir şeydir.

Temel düzeyde, sentetik veya organik veri kullanıyor olmanızdan bağımsız olarak, herhangi bir modeli eğitmek veya ince ayarlamak için soy ve kalite çok önemlidir. Modeller, eğitildiği verilerin sadece kadar iyidir. Sentetik veri, duyarlı bir veri kümesini açığa vurmadan temsil etmek veya temsil edilen bir veri kümesinin boşluklarını doldurmak için harika bir araç olabilir, ancak veri nereden geldiğini ve kalitesini kanıtlamanız gerekir.

Astronomer’deki ekibiniz, veri boru hatlarının verimliliğini ve güvenilirliğini artırmak için hangi yenilikçi teknikleri uygulamaktadır?

Çok fazla! Astro’nun tam olarak yönetilen Airflow altyapısı ve Astro Hypervisor, gelişmiş sağlık ölçümleri aracılığıyla dinamik ölçeklendirme ve proaktif izleme sağlar. Bu, kaynakların verimli bir şekilde kullanıldığını ve sistemlerin her ölçekte güvenilir olduğunu garantiler. Astro, çeşitli kanallar aracılığıyla gönderilebilen özelleştirilebilir bildirimler ile güçlü veri odaklı uyarılar sağlar. Bu, sorunlar büyümeden zamanında müdahale edilmesini sağlar.

Veri doğrulama testleri, birim testleri ve veri kalitesi kontrolleri, veri boru hatlarının ve sonunda işinizi güçlendirip destekleyen verilerin güvenilirliğini, doğruluğunu ve verimliliğini sağlamak için hayati bir rol oynar. Bu kontroller, veri boru hatlarını hızlı bir şekilde oluştururken, arka planda hataları yakaladığınızı, geliştirme süresini iyileştirdiğini ve beklenmedik hataları azalttığını garantiler. Astronomer’de, veri boru hatlarınızdaki kod işlevselliğini veya entegrasyon sorunlarını sorunsuz bir şekilde kontrol etmeye yardımcı olmak için Astro CLI gibi araçlar geliştirdik.

Yapay Zeka’nın gelecekteki gelişimi hakkında ne düşünüyorsunuz? Yapay Zeka’nın daha fazla aracı oluşturmak için hangi önlemler alınmalıdır?

Yönetişim, Yapay Zeka uygulamalarının başarılı olmasının zorunludur. Şeffaflık ve tekrar üretilebilirlik hakkında her şeydir. Sonuç nasıl elde edildi, nereden ve kim tarafından alındı? Airflow, already, bireysel veri boru hatlarının ne yaptığını görmenizi sağlayan bir yol sunar. Kullanıcı arayüzü, erken benimseme nedenlerinden biriydi ve Astronomer’de, takımlar ve dağıtımlar genelinde görünürlüğü artırmak için bunu güçlendirdik. Müşterilerimize, platform kullanımı, performansı ve maliyet tahsisatı hakkında kapsamlı içgörüler sunan Raporlama Panelleri sunuyoruz. Ayrıca, Astro API, ekiplerin Airflow boru hatlarını programlı bir şekilde dağıtmaya, otomatikleştirmeye ve yönetmeye olanak tanır, bu da manuel işlemlerle ilgili riskleri azaltır ve büyük ölçekli multiple Airflow ortamlarını yönetirken sorunsuz operasyonları garanti eder. Soy yetenekleri platforma dahildir.

Bunlar, veri yönetimini desteklemek için atılan adımlardır ve şirketlerin tüm boyutlarda, AI uygulamalarında güvenliği sağlamak için veri yönetimine önem verdiklerini düşünüyorum. Bu tanınma ve farkındalık, veri yönetim araçları talebini sürükleyecek ve bu araçların yaratılmasını hızlandıracaktır. Ancak bunlar, daha büyük orkestrasyon yığınının bir parçası olmalıdır, bu nedenle bunları platformumuzun temel bir parçası olarak görüyoruz.

Astronomer’in çözümlerinin müşterilerinize operasyonel verimliliği ve üretkenliği nasıl verbessirdiğini örneklerle açıklayabilir misiniz?

Yapay Zeka işlemleri, dikkatlice optimize edilmesi ve tekrar tekrar yürütülmesi gereken karmaşık ve kaynak yoğun görevleri içerir. Astro, Astronomer’in yönetilen Apache Airflow platformu, bu görevleri basitleştirmeye ve hızlı bir şekilde yenilikler yapma yeteneğini artırmaya yardımcı olur.

Yapay Zeka görevlerini düzenleyerek, işletmeler, hesaplama kaynaklarının verimli bir şekilde kullanıldığını ve iş akışlarının optimize edildiğini ve gerçek zamanlı olarak ayarlandığını garantileyebilir. Bu, özellikle generatif modellerin yeni veriler temelinde sık sık güncellenmesi veya yeniden eğitilmesi gereken ortamlarda önemlidir.

Airflow’in iş akışı yönetimini ve Astronomer’in dağıtım ve ölçeklendirme yeteneklerini kullanarak, ekipler altyapı yönetimiyle daha az zaman harcayabilir ve dikkatlerini veri dönüşümü ve model geliştirme üzerine yoğunlaştırabilir, bu da Yapay Zeka uygulamalarının dağıtımını hızlandırır ve performansı artırır.

Bu şekilde, Astronomer’in Astro platformu, müşterilerinin çeşitli kullanım örneklerinde Yapay Zeka’nın operasyonel verimliliğini artırmalarına yardımcı olmuştur. Bunlara, e-ticaret ürün keşfi, müşteri terk risk analizi, destek otomasyonu, yasal belge sınıflandırma ve özeti, müşteri yorumlarından ürün içgörülerini kazanma ve ürün görüntü oluşturması için dinamik küme sağlama dahildir.

Astronomer, AI ve ML uygulamalarının performansını ve ölçeklenebilirliğini artırmada nasıl bir rol oynamaktadır?

Ölçeklenebilirlik, 2024’te Yapay Zeka’ya dahil olan işletmeler için büyük bir zorluktur. Prototipmaktan üretime geçerken, kullanıcılar Yapay Zeka uygulamalarının güvenilir ve performanslı olmasını ve ürettikleri çıktıların güvenilir olmasını bekler. Bu, maliyet etkin bir şekilde yapılmalıdır ve tüm boyutlardaki işletmelerin potansiyelini kullanabilmesi gerekir. Astronomer’i kullanarak, görevler büyük miktarda veri kaynağını işleyecek şekilde yatay olarak ölçeklenebilir. Astro, dağıtımları ve barındırıldıkları kümeleri esnek bir şekilde ölçekleyebilir ve kuyruğa dayalı görev yürütme, adanmış makine türleri ile daha büyük güvenilirlik ve hesap kaynaklarının verimli kullanımı sağlar. Maliyet etkinlik parçasmı için, Astro, maliyetleri kontrol etmeye ve bulut harcamalarını azaltmaya yardımcı olan ölçeklenebilirlik ve uykuya alma özelliklerine sahiptir. Ayrıca, platformun maliyeti hakkında tam şeffaflık sunar. Kendi veri ekibim, müşterilerimize günlük olarak sunulan tüketim raporları üretir.

AI ve veri biliminde gelecekteki trendlerden heyecan duyduğunuz hangileri vardır ve Astronomer bu trendlere nasıl hazırlanıyor?

Açıklayıcı AI, çok önemli ve ilginç bir gelişme alanıdır. Büyük modellerin iç işleyişine bakabilmek neredeyse ürkütücüdür. Ayrıca, model eğitimi ve ayarlamasının çevresel etkisiyle topluluğun nasıl başa çıkacağına ilgi duyuyorum. Astronomer’de, en son tümleştirmelerle Registry’mizi sürekli güncelliyoruz, böylece veri ve ML takımları, en iyi model hizmetlerine ve en verimli hesaplama platformlarına herhangi bir ağır yük olmadan bağlanabilir.

İleri AI araçlarının, özellikle LLM’lerin, geleneksel veri yönetim sistemleriyle entegrasyonunun gelecekteki birkaç yıl içinde nasıl gelişeceğini öngörüyorsunuz?

Databricks ve Snowflake, platformlarında LLM’lerin kullanımını ve geliştirilmesini entegre etme konusunda yakın zamanda açıklamalar yaptılar. Diğer DBMS ve ML platformları da aynı şeyi yapacaklardır. Veri mühendislerine, komut satırından veya SQL.prompt’undan böyle güçlü yöntemlere kolayca erişebilmeleri görmek harika.

İlişkisel veritabanlarının makine öğrenimini entegre etmesini özellikle ilginç buluyorum. ML yöntemlerinin SQL standardına dahil edilmesini her zaman bekledim, ancak bu iki disiplin hiçbir zaman gerçekten bir araya gelmedi. Belki bu sefer farklı olacaktır.

Büyük dil modellerinin, veri mühendislerinin işini desteklemek için gelecekteki potansiyellerinden heyecan duyuyorum. İlk olarak, kod oluşturma konusunda already başarılı oldular, ancak veri bilimcilerine AI tarafından yönlendirilen öneriler sunma çabaları karışık oldu: Hex harika, örneğin, ancak Snowflake henüz ilham verici değil. Ancak, veri mühendisleri için, geliştiricilerden daha fazla potansiyel vardır, çünkü geliştiriciler için.prompt, bir fonksiyon adı veya belgelerdir, ancak veri mühendisleri için, veri de vardır. Modellerin çalışabileceği çok fazla bağlam vardır, böylece faydalı ve doğru önerilerde bulunabilirler.

AI ve Yapay Zeka mühendisleri olarak endüstriye etki etmek isteyenlere neler önerirsiniz?

Yaparak öğrenin. Uygulamalar oluşturmak artık çok kolay ve bunları yapay zeka ile güçlendirmek de öyle. Bir şey yapın ve bir arkadaşınıza veya beğendiğiniz bir şirkette çalışan bir arkadaşınızın arkadaşına gönderin! Ya da bana gönderin ve bana bakacağımı vaat ediyorum!

Sırlar, bir şeyleri bulmaktan ve bir arkadaşınızın ilgisini çekebilecek bir veri kaynağından ilham almaktır. Bir arkadaşım, 19. yüzyıla kadar uzanan anormal beyzbol sezonları hakkında fascinasyon edici bir analiz yaptı ve film yapılmasına layık hikayeler keşfetti. Astronomer’in mühendislerinden bazıları da bir hafta sonu, kendi kendine iyileştirme veri boru hatları için bir platform oluşturmak için bir araya geldi. Birkaç yıl önce böyle bir şey denemeye çalıştığımı hayal bile edemiyorum, ancak sadece birkaç günün çabasıyla Cohere’in hackathon’unu kazandık ve platformumuzun önemli bir yeni özelliğinin temelini oluşturduk.

Harika röportaj için teşekkür ederiz. Daha fazla bilgi öğrenmek isteyen okuyucular, Astronomer’i ziyaret edebilir.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.