Ana sayfa/Çözümler/Inference

Üretim endpoint'i: bugün pod, yarın serverless.

Bugün kendi pod'unda vLLM koşturursun — kontrol tamamen sende, fatura saniye bazlı. Sıfıra ölçeklenen serverless endpoint Faz 2'de geliyor; henüz yok ve varmış gibi anlatmıyoruz.

Saniye bazlı ödersin, istediğin an durdurursun. Taahhüt yok.

Senin işin şuna benziyor

Trafik dalgalı, GPU sabit fiyatlı.

Bir model API'sini üretime aldığında sorun modeli çalıştırmak değil; gece 03:00'te kimse istek atmazken kartın para yakmaya devam etmesi.

Boş saatlerin faturası

Gündüz yoğun, gece boş bir endpoint'te ayın büyük kısmını beklemeye ödersin. Sürekli açık bir pod, kullanımdan bağımsız olarak saatini işletir.

Soğuk başlangıç korkusu

Kapatırsan tasarruf edersin ama ilk kullanıcı model yüklenmesini bekler. Bu yüzden çoğu ekip endpoint'i hiç kapatmaz — ve fazladan öder.

İstemciyi baştan yazma vergisi

Her sağlayıcı kendi SDK'sını dayatırsa taşınma maliyeti kilitlenmeye dönüşür. OpenAI-uyumlu bir uçta değişen tek satır base_url olmalıdır.

İki yol, dürüst karşılaştırma

Kendi pod'unda vLLM · Serverless (Faz 2)

Soldaki bugün çalışıyor. Sağdaki teknik planımızda Faz 2 (Ay 4–8) olarak duruyor: vLLM tabanlı, OpenAI-uyumlu, sıfıra ölçeklenen endpoint. Hedeflerini yazıyoruz, taahhüt olarak değil hedef olarak.

KalemKendi pod'unda vLLM — bugünServerless — Faz 2, yakında
Bugün kullanılabilir miEvet — Faz 0'da canlıHayır — Faz 2 kapsamında
Faturalanan şeyPod açık olduğu her saniyeHedef: yalnızca isteğin işlendiği saniye
Boş trafik saatiÖdersin (pod'u sen kapatmadıkça)Hedef: sıfıra ölçekler, ödemezsin
Soğuk başlangıçYok — süreç zaten ayaktaHedef: 2 saniyenin altı
Kontrolİmaj, sürücü, vLLM bayrakları, batching tamamen sendeŞablon üstünden; ince ayar alanı daha dar
API yüzeyiKendi kurduğun OpenAI-uyumlu uçHedef: hazır OpenAI-uyumlu URL
ÖlçeklemePod sayısını sen artırırsınHedef: istek yüküne göre otomatik

Sağ sütundaki her satır bir hedeftir, bir özellik değil. Faz 2'nin bitti kriteri teknik planımızda şöyle yazılı: bir kullanıcı Hugging Face model adını yapıştırıp 10 dakikada üretim endpoint'i alıyor. O gün gelene kadar bu sütun "yakında" kalır.

Akış

Bugünkü yol: pod'da vLLM, baştan sona

Modeline göre VRAM seç

Ağırlıklar + KV cache + eşzamanlı istek yükü VRAM'e sığmalı. 8B bir model 24 GB'ta rahat eder; 70B için 80 GB'lık sınıfa ya da niceleme kararına ihtiyacın olur.

Ağırlıkları kalıcı volume'e indir

Model dosyaları volume'de durursa pod'u yeniden kurduğunda tekrar indirmezsin. Aynı volume birden çok denemede yeniden kullanılır.

vLLM'i OpenAI-uyumlu sunucu olarak başlat

Kendi imajın ya da hazır bir PyTorch imajı; portu pod bağlantısı üzerinden dışa verirsin. İstemci tarafında değişen tek şey base_url olur.

Sert tavan ve uyarı eşiklerini kur

Sürekli açık bir endpoint aylık faturanın en öngörülebilir kalemidir — ama yine de tavanla korunur. %80 ve %95'te bildirim, %100'de duraklatma.

Sağlık ve maliyeti aynı ekranda izle

Sağlık probundan geçemeyen saniyeler faturaya girmez ve metrik grafiğinde işaretli kalır. Endpoint'in düştüğü zamanın parasını ödemezsin.

Trafik yoksa kapat, saniye bazlı fatura işini görsün

Serverless gelene kadar en dürüst tasarruf yöntemi budur: gece kapat, sabah aç. Açılış iki dakikanın altında hedeflenir ve yalnızca açık kaldığın saniyeyi ödersin.

Kurgu senaryo

Tipik bir endpoint şöyle görünür.

Gerçek bir müşteri değil: ürünü göstermek için kurgulanmış temsilî bir örnek. Rakamlar örnektir.

İş: Bir SaaS ürününün içinde 8B'lik bir sohbet modeli, mesai saatlerinde yoğun.
Kart: 1× L40S, 48 GB, Frankfurt — örnek fiyat $0.79/sa.
Kurulum: vLLM, OpenAI-uyumlu uç, ağırlıklar 200 GB'lık volume'de.
Karar: Bölge Frankfurt'a sabitlenir; verinin AB dışına çıkmaması ürün gereği.
CLIPythoncurl
# 48 GB, AB bölgesi, karneye göre sırala $ kaldera offers --min-vram 48 --region eu GPU VRAM BÖLGE $/SA KARNE PUAN L40S 48 Frankfurt 0.79 4.7 0.72 RTX A6000 48 Amsterdam 0.88 4.6 0.64 # Ağırlık volume'ünü bağla, pod'u aç $ kaldera pod create --offer kld-l40s-fra \ --image vllm/vllm-openai --volume weights:200 \ --port 8000 --budget-cap 220.00 ✓ pod hazır → https://fra1.kaldera.ai/p/8000/v1 # İstemcide değişen tek satır $ export OPENAI_BASE_URL=\ https://fra1.kaldera.ai/p/8000/v1

Maliyet

Sürekli açık pod mu, sıfıra ölçek mi?

Aşağıdaki iki hesap örnektir ve temsilîdir: aynı endpoint, aynı kart, iki farklı faturalama biçimi. Sağ sütundaki serverless satırı bugün mevcut değil; Faz 2 hedefine göre kurulmuş bir projeksiyondur.

Örnek senaryo (30 günlük ay)HesapÖrnek tutar
Sürekli açık pod — bugün1× L40S · 730 sa · $0.79/sa$576.70None
Ağırlık volume'ü (200 GB)200 GB · 1 ay · $0.10/GB-ay (örnek tarife)$20.00None
Çıkış trafiği300 GB · $0.01/GB (örnek tarife)$3.00None
Bugünkü toplam (örnek)compute + depolama + trafik$599.70None
Serverless projeksiyonu — Faz 2ayda 60 GPU-saatlik gerçek işlem · $0.79/sa$47.40None
Serverless — boş saatler670 sa boş · sıfıra ölçek hedefi$0.00None

Örnek ve temsilî rakamlardır. Serverless satırları bugünkü saatlik fiyat üzerinden kurulmuş bir projeksiyondur; Faz 2 tarifesi belirlenmedi. Gerçek kazanç trafiğinin ne kadar dalgalı olduğuna bağlıdır: 7/24 dolu bir endpoint'te iki model arasındaki fark küçülür.

GPU seçimi

Model boyutuna göre kart.

Inference'ta VRAM iki şeyi birden taşır: ağırlıklar ve eşzamanlı isteklerin KV cache'i. Aşağısı kaba bir yön tarifidir; niceleme ve bağlam uzunluğu tabloyu değiştirir.

GPUVRAMRahat ettiği iş (örnek)Örnek başlangıç fiyatı
RTX 309024 GB7B nicelenmiş, düşük eşzamanlılık, iç araçlar$0.21/sa
RTX 409024 GB7B–8B bf16, orta eşzamanlılık, hızlı yanıt$0.42/sa
L40S48 GB13B bf16, uzun bağlam, yüksek eşzamanlılık$0.79/sa
A100 PCIe80 GB70B nicelenmiş, çok kullanıcılı üretim$1.32/sa
H100 SXM80 GB70B üretim yükü, düşük gecikme hedefi$2.19/sa

Örnek fiyatlardır ve temsilîdir; pazar yerinde arz-talebe göre değişir. Tam liste ve depolama/trafik kalemleri Fiyatlar sayfasında.

Pod'lar ve pazar yeri

Teklif arama, karne skoru, bölge sabitleme: GPU Pod'lar.

Serverless yol haritası

Faz 2'de ne hedefliyoruz, bugün ne yok: Serverless Inference.

Sık Sorulanlar

Serverless ne zaman gelecek?

Teknik planımızda Faz 2 olarak duruyor ve bugün yok. Tarih vermek yerine bitti kriterini yazıyoruz: bir kullanıcı model adını yapıştırıp 10 dakikada üretim endpoint'i aldığında yayındadır. O güne kadar nav'da ve bu sayfada "yakında" rozetiyle görünür.

Endpoint düşerse o saatleri öder miyim?

Altyapı kaynaklı düşüşte hayır: sağlık probundan geçemeyen saniyeler faturaya hiç girmez ve metrik grafiğinde işaretlenir. Kendi sunucun kendi hatasından çökerse GPU çalışır durumdadır ve ücret işler — bu ayrımı gizlemiyoruz.

Mevcut OpenAI istemcimi kullanabilir miyim?

Evet, vLLM'in OpenAI-uyumlu sunucusunu kendi pod'unda çalıştırdığında değişen tek şey base_url olur. Serverless geldiğinde de aynı uyumluluk hedefleniyor: taşınma maliyetini kilitlenme aracına çevirmiyoruz.

Bölgeyi sabitleyebilir miyim?

Pod'unu bir ülkeye sabitleyebilirsin; ihlal eden bir yerleştirme isteği API tarafından reddedilir. AB tüzel kişiliği, denetimli Verified katman ve SOC 2 Type I süreci Faz 3'ün konusudur — SOC 2 alınmış değil, süreçtedir. Ayrıntı: Egemenlik.

Otomatik ölçekleme var mı?

Bugün hayır. Pod sayısını sen belirlersin; API üzerinden kendi ölçekleme mantığını yazabilirsin. İstek yüküne göre otomatik ölçekleme Faz 2'nin serverless ürününe ait bir hedeftir.

Başla

Endpoint'i bugün aç; serverless geldiğinde aynı API seni bekliyor.

Çalışmayan saniyeye para yok, sert bütçe tavanı, saniye bazlı fatura. Altta hangi sağlayıcının kartı döndüğünü de sana söyleriz — failover sessizlik değil, olay kaydıdır.

Konsol yerel geliştirme adresinde çalışır: localhost:3000