हम प्रस्तुत करते हैं
हमारे किफायती मूल्य
केवल ब्रांडेड हार्डवेयर, पूर्ण नियंत्रण, कोई ट्रैफ़िक सीमा नहीं, कोई आश्चर्य नहीं!
Tier III यूरोपीय संघ डेटा सेंटरों में AI, मशीन लर्निंग और रेंडरिंग के लिए NVIDIA GPU सर्वर
केवल ब्रांडेड हार्डवेयर, पूर्ण नियंत्रण, कोई ट्रैफ़िक सीमा नहीं, कोई आश्चर्य नहीं!
यूरोपीय संघ के स्थानों में 99.9% अपटाइम गारंटी के साथ एंटरप्राइज़-ग्रेड इन्फ्रास्ट्रक्चर
अपने सर्वर और संसाधनों को दिनों में नहीं, बल्कि घंटों में ऑनलाइन करें. कोई इंस्टॉलेशन शुल्क नहीं
यूरोपीय डेटा सेंटरों में संग्रहीत सभी डेटा के साथ GDPR-अनुरूप संचालन
GPU सर्वर हमारे अपने यूरोपीय रैक में एक या अधिक एक्सेलेरेटर वाली समर्पित मशीन है। आपको पूरा कार्ड मिलता है - समय में बँटा हुआ अंश नहीं - साथ में उसे चलाते रहने के लिए CPU, RAM और NVMe, और असली थ्रूपुट आमतौर पर यही तय करता है।
उपलब्ध कार्ड आपूर्ति के साथ बदलते हैं, इसलिए ईमानदार सूची कॉन्फ़िगरेशन पृष्ठ है, यहाँ की कोई स्थिर तालिका नहीं। जो नहीं बदलता वह आकार है: मॉडल के लोड होते समय उसे थामे रखने भर की सिस्टम RAM, इतना तेज़ NVMe कि डेटा लोडिंग अड़चन न बने, और ऐसा नेटवर्क पोर्ट जिससे डेटासेट अंदर आ सके।
व्यावहारिक बाधा VRAM है। 4-बिट पर क्वांटाइज़ किया गया 7B पैरामीटर वाला मॉडल 16 GB कार्ड पर आराम से आता है और उपयोगी संदर्भ विंडो के लिए जगह छोड़ता है; 13B को 24 GB चाहिए; उसी क्वांटाइज़ेशन पर 70B मॉडल को लगभग 40-48 GB या दो कार्ड चाहिए। पूरी 16-बिट परिशुद्धता पर सेवा देने से ये सभी आँकड़े लगभग दोगुने हो जाते हैं।
अगर मॉडल नहीं आता, तो उत्तर क्वांटाइज़ेशन, छोटा मॉडल या एक और कार्ड है - सिस्टम RAM पर स्वैप करना नहीं, जो इंटरैक्टिव सहायक को बैच जॉब बना देता है।
उच्च थ्रूपुट सेवा और OpenAI-संगत एंडपॉइंट के लिए vLLM, जब सुविधा प्रति सेकंड शीर्ष टोकन से अधिक मायने रखे तब Ollama, सबसे छोटे फ़ुटप्रिंट के लिए llama.cpp, और किसी भी कस्टम काम के लिए सीधे PyTorch। ये सब वैसे ही इंस्टॉल होते हैं जैसे किसी भी Ubuntu मशीन पर, क्योंकि यह वही है।
अनुमान लेटेंसी-संवेदनशील है और मुख्यतः VRAM तथा मेमोरी बैंडविड्थ से बँधा है: एक कार्ड, पर्याप्त बड़ा, और क्लाइंट तक छोटा रास्ता। यह लगातार चलता है, इसलिए मासिक मशीन सस्ता प्रबंध है।
प्रशिक्षण और फ़ाइन-ट्यूनिंग थ्रूपुट से बँधे हैं और झोंकों में आते हैं। उन्हें अधिक कार्ड, कहीं अधिक सिस्टम RAM और डेटासेट भर का NVMe चाहिए। अगर काम कभी-कभार का है, तो शिखर के हिसाब से आकार लें और बेकार पड़े सिलिकॉन का भुगतान करने के बजाय मशीन लौटा दें।
हमारे अधिकांश GPU ग्राहक यहाँ कीमत की वजह से नहीं हैं। वजह यह है कि प्राग या कोविल्हा में किराए पर ली गई मशीन पर चलने वाला मॉडल प्रॉम्प्ट किसी तीसरे पक्ष को नहीं भेजता, आपके दस्तावेज़ों से किसी और का मॉडल प्रशिक्षित नहीं करता, और ऐसे अधिकार-क्षेत्र में रहता है जिसका नाम आप डेटा प्रोसेसिंग अनुबंध में लिख सकते हैं।
यह हर उस चीज़ के लिए मायने रखता है जो ग्राहक रिकॉर्ड, अनुबंध, चिकित्सा या वित्तीय डेटा को छूती है - उन वर्कलोड के लिए जहाँ सार्वजनिक इनफ़रेंस API तकनीकी समस्या बनने से पहले अनुपालन की समस्या है।
GPU मशीनें भौतिक हैं और ऑर्डर पर बनती हैं, इसलिए समय क्लाउड सर्वर से अधिक लगता है - सपोर्ट को बताएँ कि आप कौन-सा मॉडल चलाना चाहते हैं और कितनी समवर्तीता की अपेक्षा है, वे स्टॉक का सबसे बड़ा नहीं बल्कि वह सबसे छोटा कार्ड बताएँगे जो यह कर सके।
दोनों Tier III साइटें इन्हें रख सकती हैं, और चुनाव किसी भी अन्य सर्वर की तरह आपके उपयोगकर्ताओं के पीछे चलता है।
- क्या मुझे पूरा GPU मिलता है या उसका हिस्सा?
पूरा कार्ड। GPU सर्वर एक समर्पित मशीन है जिससे एक्सेलेरेटर जुड़ा होता है, साथ में उसे चलाते रहने के लिए ज़रूरी CPU, RAM और NVMe - और असली थ्रूपुट आमतौर पर यही तय करता है, अकेला कार्ड नहीं
- किस कार्ड पर कौन-से आकार के मॉडल आते हैं?
बाधा VRAM है। 4-बिट पर क्वांटाइज़ किया गया 7B पैरामीटर मॉडल 16 GB में आराम से आता है और उपयोगी संदर्भ विंडो के लिए जगह छोड़ता है, 13B को 24 GB चाहिए, और उसी क्वांटाइज़ेशन पर 70B मॉडल को लगभग 40-48 GB या दो कार्ड चाहिए। पूरी 16-बिट परिशुद्धता पर सेवा देने से हर आँकड़ा लगभग दोगुना हो जाता है
- कौन-से सर्विंग स्टैक समर्थित हैं?
वह सब जो NVIDIA ड्राइवरों के साथ Ubuntu पर चले: उच्च थ्रूपुट सेवा और OpenAI-संगत एंडपॉइंट के लिए vLLM, जब सुविधा शीर्ष थ्रूपुट से अधिक मायने रखे तब Ollama, सबसे छोटे फ़ुटप्रिंट के लिए llama.cpp, या कस्टम काम के लिए सीधे PyTorch
- GPU सर्वर अनुमान के लिए बेहतर है या प्रशिक्षण के लिए?
दोनों को अलग मशीनें चाहिए। अनुमान लेटेंसी से बँधा है और मुख्यतः VRAM से सीमित, इसलिए लगातार चलता पर्याप्त बड़ा एक कार्ड सस्ता प्रबंध है। प्रशिक्षण और फ़ाइन-ट्यूनिंग थ्रूपुट से बँधे हैं और झोंकों में आते हैं: अधिक कार्ड, कहीं अधिक सिस्टम RAM और डेटासेट भर का NVMe
- यहाँ मॉडल चलाने पर मेरा डेटा कहाँ जाता है?
कहीं नहीं। मॉडल उस मशीन पर चलता है जो आप प्राग या कोविल्हा में किराए पर लेते हैं: प्रॉम्प्ट किसी तीसरे पक्ष को नहीं भेजे जाते, कुछ भी किसी और का मॉडल प्रशिक्षित करने में नहीं लगता, और अधिकार-क्षेत्र वह है जिसका नाम आप डेटा प्रोसेसिंग अनुबंध में लिख सकते हैं
- एक सर्वर मिलने में कितना समय लगता है?
क्लाउड सर्वर से अधिक, क्योंकि मशीन भौतिक है और ऑर्डर पर बनती है। सपोर्ट को बताएँ कि आप कौन-सा मॉडल चलाना चाहते हैं और कितनी समवर्तीता की अपेक्षा है, वे स्टॉक का सबसे बड़ा नहीं बल्कि वह सबसे छोटा कार्ड तय करेंगे जो यह कर सके
यदि आपको सहायता चाहिए या अतिरिक्त प्रश्न हैं, तो कृपया मैनेजरों से संपर्क करें या सहायता टीम को इस पते पर लिखें support@dcxv.com