Ana sayfaÜrünlerServerless Inference

Serverless Inference

Modeli ver, URL al. vLLM tabanlı, OpenAI-uyumlu bir endpoint; trafik bitince sıfıra iner, faturası da iner. Bu sayfa bir plandır: ürün henüz yayında değil.

Faz 2 · yakında Henüz yayında değil Aşağıdaki rakamlar hedeftir, ölçüm değildir

E-posta adresi yer tutucudur; posta kutusu yakında açılıyor. Form yok, takip pikseli yok — yazarsan sırayı biz elle tutarız.

Hedeflenen ürün

Üç söz, üçü de henüz hedef.

Aşağıdakiler tasarım hedefleridir. Ölçtüğümüz gün bu sayfayı ölçüm rakamlarıyla değiştireceğiz; o güne kadar hedef olarak okunmalı.

< 2 sn

Cold start hedefi

Yol: imajın host'a önceden çekilmesi ve model ağırlıklarının host NVMe'sinde önbelleklenmesi. Bu bir taahhüt değil, mühendislik hedefi — yayına aldığımızda gerçek dağılımı (p50, p95) yayımlayacağız.

0

Sıfıra ölçekleme

Trafik bitince endpoint uyur; uyuyan endpoint için compute ücreti işlemez. İlk istekte uyanır. Nöbetçi replika zorunluluğu olmaması, "çalışmayan saniyeye para yok" sözünün inference tarafındaki karşılığıdır.

1

Değişecek tek satır

OpenAI-uyumlu API: mevcut istemcini, ajan çerçeveni, değerlendirme betiklerini olduğu gibi getir. Değişen tek şey base_url ve anahtar olsun istiyoruz — kod taşıma maliyeti sıfıra yakın olmalı.

Planlanan arayüz

base_url'i değiştir, gerisine dokunma.

Yandaki örnek, hedeflediğimiz çağrı biçimidir. Bugün çalışan bir uç değildir; sözleşme kesinleştiğinde dokümanlarda yayımlanır ve bu sayfa güncellenir.

Sohbet ve tamamlama uçları OpenAI şemasıyla uyumlu olacak; akış (streaming) ilk günden hedefte.
Model adı Hugging Face deposundan gelecek; ağırlıklar host NVMe'sinde önbelleklenecek.
Aynı bütçe tavanı burada da geçerli olacak: endpoint'ler org bütçesine bağlanır, sürpriz fatura kategorisi açılmaz.
Python · planlanan
# Bu uç HENÜZ ÇALIŞMIYOR — hedeflenen kullanım from openai import OpenAI client = OpenAI( base_url="https://api.kaldera.ai/v1", api_key="kld_...", ) resp = client.chat.completions.create( model="meta-llama/Llama-3.1-8B-Instruct", messages=[{"role": "user", "content": "merhaba"}], stream=True, ) # Değişen tek satır: base_url

Dürüst durum

Neden henüz yok, ne zaman gelecek?

Sıralama keyfî değil: inference ürünü, altında güvenilir bir pazar yeri ve kendi arzımız olmadan dürüst çalışmaz. Teknik plandaki faz sırası şöyle.

Faz 0 — Broker MVPBugün buradayız · tek hesap, tek API, tek fatura
Faz 1 — Kendi arzımızHost agent, community GPU'lar, kendi ölçümümüz
Faz 2 — Serverless InferenceBu ürün · vLLM, sıfıra ölçekleme, model önbelleği
Faz 3 — Egemenlik ve VerifiedBölge sabitleme paketi, denetimli host katmanı
Önce ölçüm, sonra endpoint

Sıfıra ölçeklenen bir endpoint'in faturası, saniye bazlı ve sağlık kapılı bir ölçüm altyapısı olmadan dürüst kurulamaz. O altyapı Faz 0 ve Faz 1'de kuruluyor; inference onun üstüne biner.

Cold start önbelleğe bağlı

İki saniyenin altı ancak model ağırlıkları host'un yerel diskinde hazırsa mümkün. Bu da host agent'ın ve kendi arzımızın olmasını gerektirir — yani Faz 1'i.

Bitti kriteri açık

Bir kullanıcının Hugging Face model adını yapıştırıp on dakika içinde üretim endpoint'i alması. Bu olmadan "yayında" demeyeceğiz; yarım ekran teslim etmiyoruz.

Faz takvimi teknik planımızdaki ay aralıklarına dayanır ve bir taahhüt değil, plandır. Kayarsa değişiklik günlüğünde yazacağız. Bugün inference işini çalıştırmak istiyorsan yolu açık: GPU pod kaldırıp vLLM'i kendin koşturabilirsin — inference çözümü sayfasında anlatılıyor.

Haber ver

Açıldığında ilk sen duy.

Bir satır yaz, hangi modeli koşturmak istediğini söyle. Kapsamı sıraya girenlerin işlerine göre kilitleyeceğiz.

Posta kutusu yakında açılıyor. Bekleme listesi bir e-posta listesidir; pazarlama akışına eklenmezsin.