हम प्रस्तुत करते हैं
हमारे किफायती मूल्य
केवल ब्रांडेड हार्डवेयर, पूर्ण नियंत्रण, कोई ट्रैफ़िक सीमा नहीं, कोई आश्चर्य नहीं!
Tier III यूरोपीय संघ डेटा सेंटरों में AI, मशीन लर्निंग और रेंडरिंग के लिए NVIDIA GPU सर्वर
केवल ब्रांडेड हार्डवेयर, पूर्ण नियंत्रण, कोई ट्रैफ़िक सीमा नहीं, कोई आश्चर्य नहीं!
यूरोपीय संघ के स्थानों में 99.9% अपटाइम गारंटी के साथ एंटरप्राइज़-ग्रेड इन्फ्रास्ट्रक्चर
अपने सर्वर और संसाधनों को दिनों में नहीं, बल्कि घंटों में ऑनलाइन करें. कोई इंस्टॉलेशन शुल्क नहीं
यूरोपीय डेटा सेंटरों में संग्रहीत सभी डेटा के साथ GDPR-अनुरूप संचालन
GPU सर्वर हमारे अपने यूरोपीय रैक में एक या अधिक एक्सेलेरेटर वाली समर्पित मशीन है। आपको पूरा कार्ड मिलता है - समय में बँटा हुआ अंश नहीं - साथ में उसे चलाते रहने के लिए CPU, RAM और NVMe, और असली थ्रूपुट आमतौर पर यही तय करता है।
उपलब्ध कार्ड आपूर्ति के साथ बदलते हैं, इसलिए ईमानदार सूची कॉन्फ़िगरेशन पृष्ठ है, यहाँ की कोई स्थिर तालिका नहीं। जो नहीं बदलता वह आकार है: मॉडल के लोड होते समय उसे थामे रखने भर की सिस्टम RAM, इतना तेज़ NVMe कि डेटा लोडिंग अड़चन न बने, और ऐसा नेटवर्क पोर्ट जिससे डेटासेट अंदर आ सके।
व्यावहारिक बाधा VRAM है। 4-बिट पर क्वांटाइज़ किया गया 7B पैरामीटर वाला मॉडल 16 GB कार्ड पर आराम से आता है और उपयोगी संदर्भ विंडो के लिए जगह छोड़ता है; 13B को 24 GB चाहिए; उसी क्वांटाइज़ेशन पर 70B मॉडल को लगभग 40-48 GB या दो कार्ड चाहिए। पूरी 16-बिट परिशुद्धता पर सेवा देने से ये सभी आँकड़े लगभग दोगुने हो जाते हैं।
अगर मॉडल नहीं आता, तो उत्तर क्वांटाइज़ेशन, छोटा मॉडल या एक और कार्ड है - सिस्टम RAM पर स्वैप करना नहीं, जो इंटरैक्टिव सहायक को बैच जॉब बना देता है।
उच्च थ्रूपुट सेवा और OpenAI-संगत एंडपॉइंट के लिए vLLM, जब सुविधा प्रति सेकंड शीर्ष टोकन से अधिक मायने रखे तब Ollama, सबसे छोटे फ़ुटप्रिंट के लिए llama.cpp, और किसी भी कस्टम काम के लिए सीधे PyTorch। ये सब वैसे ही इंस्टॉल होते हैं जैसे किसी भी Ubuntu मशीन पर, क्योंकि यह वही है।
अनुमान लेटेंसी-संवेदनशील है और मुख्यतः VRAM तथा मेमोरी बैंडविड्थ से बँधा है: एक कार्ड, पर्याप्त बड़ा, और क्लाइंट तक छोटा रास्ता। यह लगातार चलता है, इसलिए मासिक मशीन सस्ता प्रबंध है।
प्रशिक्षण और फ़ाइन-ट्यूनिंग थ्रूपुट से बँधे हैं और झोंकों में आते हैं। उन्हें अधिक कार्ड, कहीं अधिक सिस्टम RAM और डेटासेट भर का NVMe चाहिए। अगर काम कभी-कभार का है, तो शिखर के हिसाब से आकार लें और बेकार पड़े सिलिकॉन का भुगतान करने के बजाय मशीन लौटा दें।
हमारे अधिकांश GPU ग्राहक यहाँ कीमत की वजह से नहीं हैं। वजह यह है कि प्राग या कोविल्हा में किराए पर ली गई मशीन पर चलने वाला मॉडल प्रॉम्प्ट किसी तीसरे पक्ष को नहीं भेजता, आपके दस्तावेज़ों से किसी और का मॉडल प्रशिक्षित नहीं करता, और ऐसे अधिकार-क्षेत्र में रहता है जिसका नाम आप डेटा प्रोसेसिंग अनुबंध में लिख सकते हैं।
यह हर उस चीज़ के लिए मायने रखता है जो ग्राहक रिकॉर्ड, अनुबंध, चिकित्सा या वित्तीय डेटा को छूती है - उन वर्कलोड के लिए जहाँ सार्वजनिक इनफ़रेंस API तकनीकी समस्या बनने से पहले अनुपालन की समस्या है।
GPU मशीनें भौतिक हैं और ऑर्डर पर बनती हैं, इसलिए समय क्लाउड सर्वर से अधिक लगता है - सपोर्ट को बताएँ कि आप कौन-सा मॉडल चलाना चाहते हैं और कितनी समवर्तीता की अपेक्षा है, वे स्टॉक का सबसे बड़ा नहीं बल्कि वह सबसे छोटा कार्ड बताएँगे जो यह कर सके।
दोनों Tier III साइटें इन्हें रख सकती हैं, और चुनाव किसी भी अन्य सर्वर की तरह आपके उपयोगकर्ताओं के पीछे चलता है।
अकसर पूछे जाने वाले सवाल
पूरा कार्ड। GPU सर्वर एक समर्पित मशीन है जिससे एक्सेलेरेटर जुड़ा होता है, साथ में उसे चलाते रहने के लिए ज़रूरी CPU, RAM और NVMe - और असली थ्रूपुट आमतौर पर यही तय करता है, अकेला कार्ड नहीं
बाधा VRAM है। 4-बिट पर क्वांटाइज़ किया गया 7B पैरामीटर मॉडल 16 GB में आराम से आता है और उपयोगी संदर्भ विंडो के लिए जगह छोड़ता है, 13B को 24 GB चाहिए, और उसी क्वांटाइज़ेशन पर 70B मॉडल को लगभग 40-48 GB या दो कार्ड चाहिए। पूरी 16-बिट परिशुद्धता पर सेवा देने से हर आँकड़ा लगभग दोगुना हो जाता है
वह सब जो NVIDIA ड्राइवरों के साथ Ubuntu पर चले: उच्च थ्रूपुट सेवा और OpenAI-संगत एंडपॉइंट के लिए vLLM, जब सुविधा शीर्ष थ्रूपुट से अधिक मायने रखे तब Ollama, सबसे छोटे फ़ुटप्रिंट के लिए llama.cpp, या कस्टम काम के लिए सीधे PyTorch
दोनों को अलग मशीनें चाहिए। अनुमान लेटेंसी से बँधा है और मुख्यतः VRAM से सीमित, इसलिए लगातार चलता पर्याप्त बड़ा एक कार्ड सस्ता प्रबंध है। प्रशिक्षण और फ़ाइन-ट्यूनिंग थ्रूपुट से बँधे हैं और झोंकों में आते हैं: अधिक कार्ड, कहीं अधिक सिस्टम RAM और डेटासेट भर का NVMe
कहीं नहीं। मॉडल उस मशीन पर चलता है जो आप प्राग या कोविल्हा में किराए पर लेते हैं: प्रॉम्प्ट किसी तीसरे पक्ष को नहीं भेजे जाते, कुछ भी किसी और का मॉडल प्रशिक्षित करने में नहीं लगता, और अधिकार-क्षेत्र वह है जिसका नाम आप डेटा प्रोसेसिंग अनुबंध में लिख सकते हैं
क्लाउड सर्वर से अधिक, क्योंकि मशीन भौतिक है और ऑर्डर पर बनती है। सपोर्ट को बताएँ कि आप कौन-सा मॉडल चलाना चाहते हैं और कितनी समवर्तीता की अपेक्षा है, वे स्टॉक का सबसे बड़ा नहीं बल्कि वह सबसे छोटा कार्ड तय करेंगे जो यह कर सके
यदि आपको सहायता चाहिए या अतिरिक्त प्रश्न हैं, तो कृपया मैनेजरों से संपर्क करें या सहायता टीम को इस पते पर लिखें support@dcxv.com