माउंटेन व्यू (कैलिफोर्निया)। GeminiGoogle ने अपने अब तक के सबसे ताकतवर AI मॉडल Gemini 4 Argon को पेश कर दिया है। यह Gemini 4 सीरीज का पहला मॉडल है। कंपनी ने इसे खासतौर पर सॉफ्टवेयर इंजीनियरिंग, कानून, फाइनेंस और साइबर सिक्योरिटी जैसे लंबे और कई स्टेप वाले टास्क के लिए डिजाइन किया है। इसी के साथ एक लंबे इंतजार पर भी विराम लगा है, क्योंकि Google ने चुपचाप जून में आने वाले Gemini 3.5 Pro को कैंसिल कर दिया था।फिलहाल आम यूजर्स के लिए यह मॉडल उपलब्ध नहीं है। Gemini 4 Argon को सबसे पहले Google के Fairwind प्रोग्राम के तहत चुनिंदा और भरोसेमंद साइबर सिक्योरिटी एक्सपर्ट्स को दिया जाएगा। इसके बाद यह मॉडल अमेरिकी सरकार की voluntary pre-release access प्रक्रिया से गुजरेगा। फिर पेड API कस्टमर्स और Google AI Ultra सब्सक्राइबर्स को इसका एक्सेस मिलेगा, हालांकि अभी कोई ऑफिशियल डेट सामने नहीं आई है। CEO सुंदर पिचाई ने X पर लिखा है कि हम इसे जल्द से जल्द और सेफ तरीके से सभी के लिए लाने की कोशिश कर रहे हैं।
बेंचमार्क में OpenAI और Anthropic को पछाड़ा
Gemini 4 Argon ने कई बेंचमार्क में OpenAI और Anthropic के मॉडल्स को पीछे छोड़ दिया है। DeepSWE v1.1 बेंचमार्क पर, जो लंबे सॉफ्टवेयर इंजीनियरिंग टास्क को टेस्ट करता है, Argon ने 77.9% स्कोर किया है। यह Claude Opus 5.5 के 74.2% और GPT-6 Astra के 74.1% से ज्यादा है।सबसे बड़ा गैप Harvey के Legal Agent बेंचमार्क पर देखने को मिला, जहां Argon ने 19.6% स्कोर हासिल किया जबकि Astra का स्कोर सिर्फ 5.4% रहा। वहीं Vals Index में भी Argon 68.9% के साथ टॉप पर है। यह इंडेक्स US GDP में फाइनेंस, कोडिंग, लीगल और टैक्स से जुड़े कामों के योगदान के आधार पर स्कोर तय करता है।हालांकि कुछ मामलों में दूसरी कंपनियां अभी भी आगे हैं। GPT-6 Astra ने FrontierSWE v2 पर 65.5% बनाम 55% और OSWorld-2.0 पर बढ़त बनाई है, जबकि Claude Opus 5.5 ने Terminal-bench 4.0 और PostTrainBench में जीत दर्ज की है।
आउटपुट लिमिट को बढ़ाया
CWE-bench v1 पर, जो मॉडल की सिक्योरिटी खामियों को ठीक करने की क्षमता को मापता है, Argon और Astra दोनों 68% के स्कोर के साथ बराबर रहे। Google ने आउटपुट लिमिट को 64,000 से बढ़ाकर 1 मिलियन टोकन कर दिया है, ताकि Argon एक ही बार में बहुत बड़े और लंबे टास्क को पूरा कर सके। कीमत की बात करें तो शुरुआती API प्राइसिंग प्रति मिलियन इनपुट टोकन $2 और प्रति मिलियन आउटपुट टोकन $10 रखी गई है, जिसमें कैश्ड इनपुट 95% सस्ता पड़ेगा। यह Anthropic के Claude Opus 5.5 की कीमत का आधा और GPT-6 Astra की दर का पांचवां हिस्सा है।Google खुद भी इंटरनली Argon का इस्तेमाल कर रहा है, कोड को रीराइट करने और डेटा सेंटर की मेमोरी फ्री करने के लिए।
गूगल के कर्मचारी यूज कर रहे हैं इसे
हजारों Google एम्प्लॉई हफ्तों से इंटरनली Argon यूज कर रहे हैं। Argon एजेंट्स की एक टीम ने पूरे फ्लीट के प्रोफाइलिंग डेटा को एनालाइज किया और Google के डेटा सेंटर्स में 300 TiB से ज्यादा मेमोरी खाली की, जिससे कुल 500 TiB से 1 PiB (मेमोरी साइज) तक की बचत का अनुमान है। इसके अलावा एजेंट्स C/C++ कोडबेस को Rust में कन्वर्ट कर रहे हैं, जिसमें Fuchsia Zircon कर्नल की 8 लाख से ज्यादा लाइनें शामिल हैं। libgav1 वीडियो डिकोडर में Argon ने SIMD कोड की 32,000 लाइनों को रिप्लेस किया, और इसका रिजल्ट पिछले Rust पोर्ट की तुलना में 2.7 गुना तेज परफॉर्म करता है।
खामी का भी पता चला
सिक्योरिटी फर्म Wiz ने Argon की मदद से एक बड़ी खामी का पता लगाया, जिससे दुनियाभर के हॉस्पिटल्स में यूज होने वाले हेल्थकेयर सॉफ्टवेयर में पर्सनल डेटा लीक होने का खतरा था। यह खामी पिछले किसी भी फ्रंटियर मॉडल ने नहीं पकड़ी थी। Argon के सेफ्टी गार्डरेल्स उसके सोचने के पूरे प्रोसेस पर नजर रखते हैं ताकि साइबर अटैक या हथियारों के गलत इस्तेमाल को रोका जा सके।व्हाइट हाउस में AI सेफ्टी से जुड़े वॉलंटरी एग्रीमेंट पर सुंदर पिचाई के साइन करने के एक दिन बाद Google ने उन चार एरिया के बारे में जानकारी दी, जहां कंपनी Argon को बड़े पैमाने पर रिलीज करने से पहले उसके सेफ्टी फीचर्स को और मजबूत कर रही है।
इन एरिया की सिक्योरिटी पर फोकस
पहला एरिया गलत इस्तेमाल से जुड़ा है। मॉडल को इस तरह ट्रेन किया गया है कि वह ऐसी हर रिक्वेस्ट को रिजेक्ट कर दे जिससे साइबर अटैक या केमिकल, बायोलॉजिकल, रेडियोलॉजिकल और न्यूक्लियर (CBRN) हथियारों को बढ़ावा मिलता हो। Google अब Argon के इंटरनल एक्टिवेशन को भी मॉनिटर कर रहा है ताकि उन कोशिशों को पकड़ा जा सके जो इन पाबंदियों को बायपास करने के लिए की जाती हैं। इसके साथ ही इंटरनल और एक्सटर्नल रेड टीमों ने इन सेफ्टी उपायों की टेस्टिंग भी की है।