Ana sayfaÜrünlerKümeler

Kümeler

Birden çok düğümü tek eğitim işinde birleştirmek. Bugün bunu yapamıyoruz ve yapabiliyormuş gibi de davranmayacağız — bu sayfa, neden zor olduğunu ve hangi sırayla geleceğini anlatır.

Faz 2 sonrası · yakında Bugün tek düğüm var Verified katmana bağlı

E-posta adresi yer tutucudur; posta kutusu yakında açılıyor.

Bugünün sınırı

Tek makinede çok GPU var; çok makinede tek iş yok.

Aradaki fark teknik olarak büyüktür ve pazarlamada kolayca bulanır. Bu yüzden ayrı ayrı yazıyoruz.

Bugün var: tek düğüm, çok GPU

Aynı makinedeki 2, 4 ya da 8 GPU'yu tek pod olarak kiralayabilirsin. Kart arası iletişim makinenin kendi veri yolundan geçer; PyTorch'un tek düğümlü dağıtık eğitimi (DDP, FSDP) burada sorunsuz çalışır. Çoğu fine-tuning işi için gereken budur.

Bugün yok: çok düğümlü tek iş

Sekiz makinenin altmış dört GPU'sunu tek eğitim koşusunda birleştirmek başka bir üründür: düğümler arası özel ağ, eşzamanlı yerleştirme ve ortak arıza yönetimi ister. Havuzumuzda böyle bir şey yok; olduğunda burada yazacak.

Bugün yapabileceğin

Tek makinede sekiz karta kadar.

Filtreyi GPU sayısına göre daralt, tek pod olarak kirala, tek düğümlü dağıtık eğitimi başlat. Saniye bazlı fatura ve sert bütçe tavanı burada da aynen geçerli.

Checkpoint yaz. Uzun koşularda tek gerçek sigortan budur; sağlık düşerse iş başka host'a taşınabilir.
Diski ayrı düşün. Ağırlıklar ve ara çıktılar için kalıcı depolama; pod gitse de veri kalsın.
Bölgeyi sabitle. Uzun eğitimde veri nerede duracaksa orada dursun; sabit sunucu tarafında zorlanır.
CLI
# Tek makinede çok GPU ara — çıktı temsilîdir $ kaldera offers --min-gpu-count 4 --region eu_tr GPU ADET BÖLGE $/SA KARNE PUAN RTX 4090 4 Frankfurt 1.58 4.8 0.61 A100 8 Helsinki 9.90 5.0 0.54 # Tek pod olarak kirala $ kaldera pod create --offer td-4412 \ --image pytorch/2.4-cuda12.4 --volume-gb 500 # Çok DÜĞÜMLÜ küme komutu henüz yok. # Geldiğinde: kaldera cluster create ...

Mühendislik gerçeği

Neden marketplace arzında zor?

Kümenin zorluğu GPU bulmak değil; GPU'ların arasındaki boşluk. Dört ayrı problem var, dördü de arzın niteliğine bağlı.

Düğümler arası ağ, kartın kendisinden önemli

Çok düğümlü eğitimde her adımda gradyanlar tüm düğümler arasında toplanır. Bu trafik, sıradan bir internet bağlantısıyla değil InfiniBand ya da yüksek hızlı RDMA dokusuyla taşınır; makine içinde ise NVLink kartları birbirine bağlar. Bu doku bir makinenin özelliği değil, veri merkezinin özelliğidir — ayrı şehirlerdeki iki güzel kart bir küme yapmaz.

Hepsi aynı anda hazır olmalı

Tek pod kiralarken tek teklifin uygun olması yeter. Kümede sekiz düğümün sekizi de aynı anda, aynı veri merkezinde, aynı dokuya bağlı ve aynı sürede ayakta olmalı. Dağınık arzda bu, tek tek kiralamanın toplamı değil, hepsi ya da hiçbiri olan bir yerleştirme problemidir.

Arıza yarıçapı büyür

Tek düğüm düşerse bir pod düşer. Kümede bir düğüm düşerse koşunun tamamı durur. "Çalışmayan saniyeye para yok" garantisi burada çok daha ağır bir söz demektir: yalnız düşen düğümün değil, onu bekleyen bütün düğümlerin saniyeleri konuşulur. Bunu ölçemeden satmayız.

Topoloji gizlenemez

Broker katmanı tek pod için "altta kimin GPU'su döndüğü bizim işimiz" diyebilir. Kümede diyemez: hangi düğümün hangi anahtara bağlı olduğu doğrudan eğitim hızını belirler. Yani soyutlama, ürünün kendisiyle çelişir.

Verified katman

Küme, denetlenmiş arz olmadan olmaz.

Pazar yerinin geri kalanında güvenilmeyen host varsayımıyla çalışabiliyoruz: konteyner izole eder, sırlar host diskine düşmez, karne kötü makineyi eler. Kümede bu yetmez.

Dokunun kendisi denetlenmeli

Bir host "InfiniBand'im var" diyebilir; kümede bunun ölçülmüş, doğrulanmış ve sürekli izlenmiş olması gerekir. Verified katman tam olarak bu denetimi taşır: yerinde doğrulanmış veri merkezleri.

Kapasite rezerve edilebilmeli

Sekiz düğümü aynı anda tutabilmek, arz tarafında bir taahhüt gerektirir. Anlık pazar yerinde bu taahhüt yoktur; SLA'lı katmanda vardır. Küme fiyatlaması da bu yüzden anlık teklif fiyatından farklı çalışacak.

Karne düğüm değil, küme ölçmeli

Bugünkü karne tek makinenin çalışma süresini, benchmark tutarlılığını ve ağını ölçüyor. Küme için ölçülmesi gereken şey düğümler arası bant genişliği ve gecikme dağılımı — yeni bir ölçüm ailesi, yeni bir karne.

Verified katman ve denetimli veri merkezleri teknik planımızda Faz 3 kapsamındadır; kümeler ona bağlı olduğu için ondan önce gelemez. Egemenlik sayfasında hangi taahhüdün bugün geçerli, hangisinin planlı olduğu ayrı ayrı yazılıdır.

Sıra

Hangi fazda ne geliyor?

Faz 0 — Tek düğüm, çok GPUBugün çalışıyor
Faz 1 — Kendi arzımız ve host karnesiAğ ölçümü burada birikmeye başlıyor
Faz 3 — Verified katmanDenetimli veri merkezleri, SLA
Sonrası — Çok düğümlü kümelerVerified katman kurulduktan sonra

Faz sırası teknik planımızdan gelir ve bir taahhüt değil, plandır. Tarih vermiyoruz çünkü elimizde tutulacak bir tarih yok; sıralama kayarsa değişiklik günlüğünde yazacağız.

Konuşalım

Çok düğümlü bir işin mi var?

Kaç düğüm, hangi model, ne kadar süre — yaz. Kümeyi kimin için, hangi ölçekte kuracağımızı bu yanıtlar belirleyecek. Bu arada tek düğümde ne kadar yol alabildiğine bakalım.

Posta kutusu yakında açılıyor.