Ana sayfa›Ürünler›Serverless Inference
Modeli ver, URL al. vLLM tabanlı, OpenAI-uyumlu bir endpoint; trafik bitince sıfıra iner, faturası da iner. Bu sayfa bir plandır: ürün henüz yayında değil.
E-posta adresi yer tutucudur; posta kutusu yakında açılıyor. Form yok, takip pikseli yok — yazarsan sırayı biz elle tutarız.
Hedeflenen ürün
Aşağıdakiler tasarım hedefleridir. Ölçtüğümüz gün bu sayfayı ölçüm rakamlarıyla değiştireceğiz; o güne kadar hedef olarak okunmalı.
Yol: imajın host'a önceden çekilmesi ve model ağırlıklarının host NVMe'sinde önbelleklenmesi. Bu bir taahhüt değil, mühendislik hedefi — yayına aldığımızda gerçek dağılımı (p50, p95) yayımlayacağız.
Trafik bitince endpoint uyur; uyuyan endpoint için compute ücreti işlemez. İlk istekte uyanır. Nöbetçi replika zorunluluğu olmaması, "çalışmayan saniyeye para yok" sözünün inference tarafındaki karşılığıdır.
OpenAI-uyumlu API: mevcut istemcini, ajan çerçeveni, değerlendirme betiklerini olduğu gibi getir. Değişen tek şey base_url ve anahtar olsun istiyoruz — kod taşıma maliyeti sıfıra yakın olmalı.
Planlanan arayüz
Yandaki örnek, hedeflediğimiz çağrı biçimidir. Bugün çalışan bir uç değildir; sözleşme kesinleştiğinde dokümanlarda yayımlanır ve bu sayfa güncellenir.
Dürüst durum
Sıralama keyfî değil: inference ürünü, altında güvenilir bir pazar yeri ve kendi arzımız olmadan dürüst çalışmaz. Teknik plandaki faz sırası şöyle.
Sıfıra ölçeklenen bir endpoint'in faturası, saniye bazlı ve sağlık kapılı bir ölçüm altyapısı olmadan dürüst kurulamaz. O altyapı Faz 0 ve Faz 1'de kuruluyor; inference onun üstüne biner.
İki saniyenin altı ancak model ağırlıkları host'un yerel diskinde hazırsa mümkün. Bu da host agent'ın ve kendi arzımızın olmasını gerektirir — yani Faz 1'i.
Bir kullanıcının Hugging Face model adını yapıştırıp on dakika içinde üretim endpoint'i alması. Bu olmadan "yayında" demeyeceğiz; yarım ekran teslim etmiyoruz.
Faz takvimi teknik planımızdaki ay aralıklarına dayanır ve bir taahhüt değil, plandır. Kayarsa değişiklik günlüğünde yazacağız. Bugün inference işini çalıştırmak istiyorsan yolu açık: GPU pod kaldırıp vLLM'i kendin koşturabilirsin — inference çözümü sayfasında anlatılıyor.
Haber ver
Bir satır yaz, hangi modeli koşturmak istediğini söyle. Kapsamı sıraya girenlerin işlerine göre kilitleyeceğiz.
Posta kutusu yakında açılıyor. Bekleme listesi bir e-posta listesidir; pazarlama akışına eklenmezsin.