Ana sayfa/Çözümler/Inference
Bugün kendi pod'unda vLLM koşturursun — kontrol tamamen sende, fatura saniye bazlı. Sıfıra ölçeklenen serverless endpoint Faz 2'de geliyor; henüz yok ve varmış gibi anlatmıyoruz.
Saniye bazlı ödersin, istediğin an durdurursun. Taahhüt yok.
Senin işin şuna benziyor
Bir model API'sini üretime aldığında sorun modeli çalıştırmak değil; gece 03:00'te kimse istek atmazken kartın para yakmaya devam etmesi.
Gündüz yoğun, gece boş bir endpoint'te ayın büyük kısmını beklemeye ödersin. Sürekli açık bir pod, kullanımdan bağımsız olarak saatini işletir.
Kapatırsan tasarruf edersin ama ilk kullanıcı model yüklenmesini bekler. Bu yüzden çoğu ekip endpoint'i hiç kapatmaz — ve fazladan öder.
Her sağlayıcı kendi SDK'sını dayatırsa taşınma maliyeti kilitlenmeye dönüşür. OpenAI-uyumlu bir uçta değişen tek satır base_url olmalıdır.
İki yol, dürüst karşılaştırma
Soldaki bugün çalışıyor. Sağdaki teknik planımızda Faz 2 (Ay 4–8) olarak duruyor: vLLM tabanlı, OpenAI-uyumlu, sıfıra ölçeklenen endpoint. Hedeflerini yazıyoruz, taahhüt olarak değil hedef olarak.
| Kalem | Kendi pod'unda vLLM — bugün | Serverless — Faz 2, yakında |
|---|---|---|
| Bugün kullanılabilir mi | Evet — Faz 0'da canlı | Hayır — Faz 2 kapsamında |
| Faturalanan şey | Pod açık olduğu her saniye | Hedef: yalnızca isteğin işlendiği saniye |
| Boş trafik saati | Ödersin (pod'u sen kapatmadıkça) | Hedef: sıfıra ölçekler, ödemezsin |
| Soğuk başlangıç | Yok — süreç zaten ayakta | Hedef: 2 saniyenin altı |
| Kontrol | İmaj, sürücü, vLLM bayrakları, batching tamamen sende | Şablon üstünden; ince ayar alanı daha dar |
| API yüzeyi | Kendi kurduğun OpenAI-uyumlu uç | Hedef: hazır OpenAI-uyumlu URL |
| Ölçekleme | Pod sayısını sen artırırsın | Hedef: istek yüküne göre otomatik |
Sağ sütundaki her satır bir hedeftir, bir özellik değil. Faz 2'nin bitti kriteri teknik planımızda şöyle yazılı: bir kullanıcı Hugging Face model adını yapıştırıp 10 dakikada üretim endpoint'i alıyor. O gün gelene kadar bu sütun "yakında" kalır.
Akış
Ağırlıklar + KV cache + eşzamanlı istek yükü VRAM'e sığmalı. 8B bir model 24 GB'ta rahat eder; 70B için 80 GB'lık sınıfa ya da niceleme kararına ihtiyacın olur.
Model dosyaları volume'de durursa pod'u yeniden kurduğunda tekrar indirmezsin. Aynı volume birden çok denemede yeniden kullanılır.
Kendi imajın ya da hazır bir PyTorch imajı; portu pod bağlantısı üzerinden dışa verirsin. İstemci tarafında değişen tek şey base_url olur.
Sürekli açık bir endpoint aylık faturanın en öngörülebilir kalemidir — ama yine de tavanla korunur. %80 ve %95'te bildirim, %100'de duraklatma.
Sağlık probundan geçemeyen saniyeler faturaya girmez ve metrik grafiğinde işaretli kalır. Endpoint'in düştüğü zamanın parasını ödemezsin.
Serverless gelene kadar en dürüst tasarruf yöntemi budur: gece kapat, sabah aç. Açılış iki dakikanın altında hedeflenir ve yalnızca açık kaldığın saniyeyi ödersin.
Kurgu senaryo
Gerçek bir müşteri değil: ürünü göstermek için kurgulanmış temsilî bir örnek. Rakamlar örnektir.
Maliyet
Aşağıdaki iki hesap örnektir ve temsilîdir: aynı endpoint, aynı kart, iki farklı faturalama biçimi. Sağ sütundaki serverless satırı bugün mevcut değil; Faz 2 hedefine göre kurulmuş bir projeksiyondur.
| Örnek senaryo (30 günlük ay) | Hesap | Örnek tutar |
|---|---|---|
| Sürekli açık pod — bugün | 1× L40S · 730 sa · $0.79/sa | $576.70None |
| Ağırlık volume'ü (200 GB) | 200 GB · 1 ay · $0.10/GB-ay (örnek tarife) | $20.00None |
| Çıkış trafiği | 300 GB · $0.01/GB (örnek tarife) | $3.00None |
| Bugünkü toplam (örnek) | compute + depolama + trafik | $599.70None |
| Serverless projeksiyonu — Faz 2 | ayda 60 GPU-saatlik gerçek işlem · $0.79/sa | $47.40None |
| Serverless — boş saatler | 670 sa boş · sıfıra ölçek hedefi | $0.00None |
Örnek ve temsilî rakamlardır. Serverless satırları bugünkü saatlik fiyat üzerinden kurulmuş bir projeksiyondur; Faz 2 tarifesi belirlenmedi. Gerçek kazanç trafiğinin ne kadar dalgalı olduğuna bağlıdır: 7/24 dolu bir endpoint'te iki model arasındaki fark küçülür.
GPU seçimi
Inference'ta VRAM iki şeyi birden taşır: ağırlıklar ve eşzamanlı isteklerin KV cache'i. Aşağısı kaba bir yön tarifidir; niceleme ve bağlam uzunluğu tabloyu değiştirir.
| GPU | VRAM | Rahat ettiği iş (örnek) | Örnek başlangıç fiyatı |
|---|---|---|---|
| RTX 3090 | 24 GB | 7B nicelenmiş, düşük eşzamanlılık, iç araçlar | $0.21/sa |
| RTX 4090 | 24 GB | 7B–8B bf16, orta eşzamanlılık, hızlı yanıt | $0.42/sa |
| L40S | 48 GB | 13B bf16, uzun bağlam, yüksek eşzamanlılık | $0.79/sa |
| A100 PCIe | 80 GB | 70B nicelenmiş, çok kullanıcılı üretim | $1.32/sa |
| H100 SXM | 80 GB | 70B üretim yükü, düşük gecikme hedefi | $2.19/sa |
Örnek fiyatlardır ve temsilîdir; pazar yerinde arz-talebe göre değişir. Tam liste ve depolama/trafik kalemleri Fiyatlar sayfasında.
Teklif arama, karne skoru, bölge sabitleme: GPU Pod'lar.
Faz 2'de ne hedefliyoruz, bugün ne yok: Serverless Inference.
Sık Sorulanlar
Teknik planımızda Faz 2 olarak duruyor ve bugün yok. Tarih vermek yerine bitti kriterini yazıyoruz: bir kullanıcı model adını yapıştırıp 10 dakikada üretim endpoint'i aldığında yayındadır. O güne kadar nav'da ve bu sayfada "yakında" rozetiyle görünür.
Altyapı kaynaklı düşüşte hayır: sağlık probundan geçemeyen saniyeler faturaya hiç girmez ve metrik grafiğinde işaretlenir. Kendi sunucun kendi hatasından çökerse GPU çalışır durumdadır ve ücret işler — bu ayrımı gizlemiyoruz.
Evet, vLLM'in OpenAI-uyumlu sunucusunu kendi pod'unda çalıştırdığında değişen tek şey base_url olur. Serverless geldiğinde de aynı uyumluluk hedefleniyor: taşınma maliyetini kilitlenme aracına çevirmiyoruz.
Pod'unu bir ülkeye sabitleyebilirsin; ihlal eden bir yerleştirme isteği API tarafından reddedilir. AB tüzel kişiliği, denetimli Verified katman ve SOC 2 Type I süreci Faz 3'ün konusudur — SOC 2 alınmış değil, süreçtedir. Ayrıntı: Egemenlik.
Bugün hayır. Pod sayısını sen belirlersin; API üzerinden kendi ölçekleme mantığını yazabilirsin. İstek yüküne göre otomatik ölçekleme Faz 2'nin serverless ürününe ait bir hedeftir.
Başla
Çalışmayan saniyeye para yok, sert bütçe tavanı, saniye bazlı fatura. Altta hangi sağlayıcının kartı döndüğünü de sana söyleriz — failover sessizlik değil, olay kaydıdır.
Konsol yerel geliştirme adresinde çalışır: localhost:3000