Amazon Web Services (AWS), yapay zekânın kullanıcı komutlarını anlık, akıllı yanıtlara dönüştüren, saliselik çıkarım yapma (inference) sürecini hızlandırmak ve optimize etmek için tasarlanan altyapı geliştirmelerini paylaştı.
Üretken yapay zekâ, deneysel modellerden devasa ölçekteki canlıya alma uygulamalarına geçerken, çıkarım altyapısına yapılan yatırımlar eğitim harcamalarının önüne geçti. AWS, bu talebi karşılamak için özel olarak geliştirilmiş, tam katmanlı (full-stack) bir mimariyi hayata geçiriyor. Özel tasarım Trainium silikonunu, birleşik bir ağ çerçevesini ve Project Mantle gibi akıllı yönlendirme teknolojilerini bir araya getirerek kurumsal düzeydeki yapay zekâyı daha hızlı, daha dayanıklı ve daha ekonomik hale getiriyor.
AWS Bilgi İşlem ve Makine Öğrenimi Hizmetlerinden Sorumlu Başkan Yardımcısı Dave Brown, konuyla ilgili olarak şunları söyledi:
“Çıkarım, yeni bir bilgi işlem türü. Kendine has ölçeklendirme kalıpları, kısıtlamaları ve gereksinimleri var. Bu milisaniyelerin günde milyarlarca kez güvenilir bir şekilde gerçekleşmesini sağlamak, karmaşık mimari sorunları en temelden çözmeyi gerektiriyor.”
İki saniyelik yapay zekâ yanıtının arkasındaki gizli mekanizmalar
Bir üretken yapay zekâ asistanıyla etkileşime girmek, doğal dilde bir soru yazmak kadar basit hissettirse de arka planda muazzam bir teknik orkestrasyon gerçekleşiyor. MIT Technology Review verilerine göre yapay zekâya ayrılan tüm bilgi işlem gücünün yüzde 80-90’ını çıkarım işlemleri oluşturuyor.
Amazon Bedrock platformu, iki saniyenin altında doğru bir yanıt sunabilmek için oldukça yoğun, dört aşamalı bir teknik süreci otomatik olarak yönetiyor:
- Adım 1: Tokenization (5-10 milisaniye): Kullanıcı komutu anında “belirteçlere” (token), yani makine tarafından okunabilir metin parçalarına bölünüyor.
- Adım 2: Prefill (10-100 milisaniye): Model, kesin bağlamı oluşturmak için komutun tamamını milyarlarca parametre üzerinden değerlendiriyor ve üretim sürecine rehberlik edecek özel bir anahtar-değer önbelleği oluşturuyor.
- Adım 3: Decode (100–1.000+ milisaniye): Yapay zekâ, nihai yanıtını her seferinde tek bir belirteç olacak şekilde inşa ediyor. Tahmin edilen her belirteç, geçmiş bağlamın tamamından yararlanıyor ve bu da arka plandaki bilgi işlem gücünü ve bellek bant genişliğini ciddi şekilde zorluyor.
- Adım 4: Detokenization (Son milisaniyeler): Üretilen belirteçler sorunsuz bir şekilde yeniden insan tarafından okunabilir metne dönüştürülüyor ve doğrudan kullanıcının arayüzüne aktarılıyor.
“Üretken Yapay Zekâ” engelini aşmak
Yapay zekâ aracılarının hızlı yükselişine paralel olarak, optimize edilmiş çıkarım altyapısına olan ihtiyaç da artıyor. Basit metin giriş-çıkış taleplerini işleyen geleneksel üretken yapay zekâ uygulamalarının aksine, modern yapay zekâ aracıları oldukça karmaşık ve çok adımlı iş akışlarını yürütmek için birbirine bağlı birden fazla modeli koordine ediyor.
Çok kişili bir takvimi koordine etmek, restoranların doluluk durumunu analiz etmek ve gerçek zamanlı inceleme verilerini sentezlemek gibi tek bir görev, ayrı ve birbirine bağımlı bir çıkarım zinciri gerektiriyor. On adımlı bir zincirin tek bir adımında bile altyapı hatası veya gecikme yaşanırsa, kullanıcı deneyimi olumsuz etkileniyor. Geleneksel bulut ortamları ise, bu gelişmiş iş akışlarının doğasında bulunan katlanarak artan maliyetleri, gecikmeleri ve güvenilirlik risklerini yönetecek şekilde inşa edilmedi.
Project Mantle: Yüksek performanslı yapay zekâ için akıllı yönlendirme
AWS, bu çoklu model zorluklarını çözmek için Amazon Bedrock’ın performansını dört temel yenilikle optimize eden gelişmiş bir çıkarım motoru olan Project Mantle’ı geliştirdi. Akıllı Önceliklendirme, düşük gecikme süresini maliyet etkin bir şekilde korumak için iş yüklerini öncelik seviyelerine göre eşleştiriyor. Özel Kuyruğa Alma, kullanım dalgalanmalarının diğer kullanıcıları etkilemesini önlemek için müşteri iş yüklerini izole ediyor. Kesintisiz Kontrol Noktaları (Journal), olası bir kesinti sonrası bilgi işlem gücünü boşa harcamadan sorunsuz bir şekilde devam etmek için istek durumlarını otomatik olarak kaydediyor ve Birleşik Ağ Mimarisi ise makine öğrenimi ağlarını birleştirerek hata noktalarını ortadan kaldırıyor ve yanıt sürelerini hızlandırıyor.
Özel Silikon, yapay zekânın maliyetini düşürüyor
Kurumsal yapay zekânın ekonomik olarak sürdürülebilir olması, büyük ölçüde bireysel çıkarım başına düşen maliyetin azaltılmasına bağlı olduğundan AWS, donanım verimliliğinin katlanarak artan küresel talebe yanıt verebilmesi için özel silikon yol haritasını büyütmeye devam ediyor. Şu anda Amazon Bedrock’ın belirteç kullanımının büyük bir kısmı, AWS’in özel tasarımı olan Trainium çipleri üzerinde çalışıyor. Geleceğe bakıldığında ise yeni nesil özel silikonlar, yüksek talebe sahip kurumsal ortamlar için çok daha büyük bir ekonomik rahatlama sağlayacak.
Trainium3’ün en zorlu iş yüklerinde bile yüzde 40’a varan maliyet tasarrufu sağlayacağı öngörülüyor. Genel Pazar talebi ve belirteç hacimlerinin katlanarak artmasıyla bireysel çıkarım başına maliyetin düşmeye devam edeceğini öngören AWS, silikondan daha akıllı ağ protokollerine kadar teknoloji yığınının her katmanını optimize ederek kurumların yüksek kârlılığa sahip ve şirket genelinde kullanılabilecek yapay zekâ uygulamaları geliştirmesini sağlıyor.

Kaynak : 