Google's Gemini 2.5 Computer Use AI Model: Automating Digital Tasks
Google has introduced the Gemini 2.5 Computer Use AI model, a sophisticated tool designed to interact directly with web and mobile interfaces to perform tasks on a computer.
Building upon the strong visual understanding and reasoning capabilities of the foundational Gemini 2.5 Pro model, this new development allows AI agents to act much like a human user.
These agents can execute actions such as clicking buttons, typing text, scrolling, and navigating complex websites, effectively bridging the gap between AI and practical digital execution.
The Gemini 2.5 Computer Use model is made available to developers through the Gemini API, specifically within Google AI Studio and Vertex AI.
Its core functionality is exposed via the new computer_use tool, which is designed to operate within an iterative loop.
This loop is central to how the AI processes and completes a given task.
The system is designed to be highly interactive, taking in real-time information to inform its next move.
The operational mechanism of the model involves a continuous feedback loop. Inputs to the computer_use tool include the user’s initial request, a screenshot of the current digital environment, and a history of the AI's most recent actions.
The model analyzes these inputs and then determines the most appropriate next step, responding with a function call (e.g., to click or type).
Some sensitive actions, such as making a purchase, are designed to require an extra layer of user confirmation for safety.
Once the model's function call is determined, the client-side code executes the action in the real-world interface.
This action triggers the next phase of the loop: a new screenshot of the updated environment and the current URL are captured and fed back to the model.
This process repeats—analyze, act, and receive feedback—until the AI successfully finishes the task, encounters an error, or is stopped by a safety protocol or the user.
While the Gemini 2.5 Computer Use model demonstrates "strong promise for mobile UI control tasks," Google has optimized it primarily for web browsers.
The company notes that it is not yet fully optimized for desktop operating system-level control.
Nevertheless, Google highlights that the model offers leading quality for browser control at the lowest latency, a claim supported by performance metrics on the Browserbase harness for Online-Mind2Web, positioning it as a significant step forward in automated digital task execution.
Google का Gemini 2.5 कंप्यूटर उपयोग AI मॉडल: डिजिटल कार्यों का स्वचालन
Google ने Gemini 2.5 कंप्यूटर उपयोग AI मॉडल पेश किया है, जो एक परिष्कृत उपकरण है जिसे कंप्यूटर पर कार्य करने के लिए वेब और मोबाइल इंटरफ़ेस के साथ सीधे इंटरैक्ट करने के लिए डिज़ाइन किया गया है।
मूल Gemini 2.5 Pro मॉडल की मज़बूत दृश्य समझ और तर्क क्षमताओं पर आधारित, यह नया विकास AI एजेंटों को मानव उपयोगकर्ता की तरह कार्य करने की अनुमति देता है।
ये एजेंट बटन क्लिक करने, टेक्स्ट टाइप करने, स्क्रॉल करने और जटिल वेबसाइटों पर नेविगेट करने जैसी क्रियाएँ कर सकते हैं, जिससे AI और व्यावहारिक डिजिटल निष्पादन के बीच की खाई को प्रभावी ढंग से पाटा जा सकता है।
Gemini 2.5 कंप्यूटर उपयोग मॉडल, विशेष रूप से Google AI स्टूडियो और Vertex AI के अंतर्गत, Gemini API के माध्यम से डेवलपर्स के लिए उपलब्ध कराया गया है।
इसकी मुख्य कार्यक्षमता नए computer_use टूल के माध्यम से प्रदर्शित होती है, जिसे एक पुनरावृत्त लूप के भीतर संचालित करने के लिए डिज़ाइन किया गया है।
यह लूप AI द्वारा किसी दिए गए कार्य को संसाधित करने और पूरा करने के तरीके का केंद्रबिंदु है।
यह सिस्टम अत्यधिक इंटरैक्टिव होने के लिए डिज़ाइन किया गया है, जो अपने अगले कदम के बारे में जानकारी देने के लिए रीयल-टाइम जानकारी लेता है।
मॉडल की परिचालन प्रक्रिया में एक सतत फ़ीडबैक लूप शामिल है। कंप्यूटर_उपयोग टूल के इनपुट में उपयोगकर्ता का प्रारंभिक अनुरोध, वर्तमान डिजिटल परिवेश का एक स्क्रीनशॉट और AI की नवीनतम क्रियाओं का इतिहास शामिल होता है।
मॉडल इन इनपुट का विश्लेषण करता है और फिर सबसे उपयुक्त अगला चरण निर्धारित करता है, एक फ़ंक्शन कॉल (जैसे, क्लिक करना या टाइप करना) के साथ प्रतिक्रिया करता है।
कुछ संवेदनशील क्रियाएँ, जैसे खरीदारी करना, सुरक्षा के लिए उपयोगकर्ता की पुष्टि की एक अतिरिक्त परत की आवश्यकता के लिए डिज़ाइन की गई हैं।
एक बार मॉडल की फ़ंक्शन कॉल निर्धारित हो जाने पर, क्लाइंट-साइड कोड वास्तविक इंटरफ़ेस में क्रिया को निष्पादित करता है।
यह क्रिया लूप के अगले चरण को ट्रिगर करती है: अपडेट किए गए परिवेश का एक नया स्क्रीनशॉट और वर्तमान URL कैप्चर किया जाता है और मॉडल को वापस भेजा जाता है।
यह प्रक्रिया दोहराई जाती है—विश्लेषण, कार्य और फ़ीडबैक प्राप्त करना—जब तक कि AI सफलतापूर्वक कार्य पूरा नहीं कर लेता, कोई त्रुटि नहीं आती, या किसी सुरक्षा प्रोटोकॉल या उपयोगकर्ता द्वारा उसे रोक नहीं दिया जाता।
हालाँकि जेमिनी 2.5 कंप्यूटर यूज़ मॉडल "मोबाइल यूआई नियंत्रण कार्यों के लिए मज़बूत संभावनाएँ" प्रदर्शित करता है, लेकिन Google ने इसे मुख्य रूप से वेब ब्राउज़रों के लिए अनुकूलित किया है।
कंपनी का कहना है कि यह अभी डेस्कटॉप ऑपरेटिंग सिस्टम-स्तरीय नियंत्रण के लिए पूरी तरह से अनुकूलित नहीं है।
फिर भी, Google इस बात पर ज़ोर देता है कि यह मॉडल सबसे कम विलंबता पर ब्राउज़र नियंत्रण के लिए अग्रणी गुणवत्ता प्रदान करता है, यह दावा ऑनलाइन-माइंड2वेब के लिए ब्राउज़रबेस हार्नेस पर प्रदर्शन मेट्रिक्स द्वारा समर्थित है, जो इसे स्वचालित डिजिटल कार्य निष्पादन में एक महत्वपूर्ण कदम के रूप में स्थापित करता है।
గూగుల్ యొక్క జెమిని 2.5 కంప్యూటర్ యూజ్ AI మోడల్: డిజిటల్ టాస్క్లను ఆటోమేట్ చేయడం
కంప్యూటర్లో పనులు నిర్వహించడానికి వెబ్ మరియు మొబైల్ ఇంటర్ఫేస్లతో నేరుగా ఇంటరాక్ట్ అవ్వడానికి రూపొందించబడిన అధునాతన సాధనం జెమిని 2.5 కంప్యూటర్ యూజ్ AI మోడల్ను గూగుల్ ప్రవేశపెట్టింది.
ఫౌండేషన్ జెమిని 2.5 ప్రో మోడల్ యొక్క బలమైన దృశ్య అవగాహన మరియు తార్కిక సామర్థ్యాలపై ఆధారపడి, ఈ కొత్త అభివృద్ధి AI ఏజెంట్లు మానవ వినియోగదారుడిలా వ్యవహరించడానికి అనుమతిస్తుంది.
ఈ ఏజెంట్లు బటన్లను క్లిక్ చేయడం, టెక్స్ట్ టైప్ చేయడం, స్క్రోలింగ్ చేయడం మరియు సంక్లిష్ట వెబ్సైట్లను నావిగేట్ చేయడం వంటి చర్యలను అమలు చేయగలరు, AI మరియు ఆచరణాత్మక డిజిటల్ అమలు మధ్య అంతరాన్ని సమర్థవంతంగా తగ్గిస్తారు.
జెమిని 2.5 కంప్యూటర్ యూజ్ మోడల్ డెవలపర్లకు జెమిని API ద్వారా, ప్రత్యేకంగా గూగుల్ AI స్టూడియో మరియు వెర్టెక్స్ AIలో అందుబాటులో ఉంచబడింది.
దీని ప్రధాన కార్యాచరణ కొత్త కంప్యూటర్_యూజ్ సాధనం ద్వారా బహిర్గతమవుతుంది, ఇది పునరావృత లూప్లో పనిచేయడానికి రూపొందించబడింది.
ఈ లూప్ AI ఇచ్చిన పనిని ఎలా ప్రాసెస్ చేస్తుంది మరియు పూర్తి చేస్తుంది అనేదానికి కేంద్రంగా ఉంటుంది.
సిస్టమ్ అత్యంత ఇంటరాక్టివ్గా ఉండేలా రూపొందించబడింది, దాని తదుపరి కదలికను తెలియజేయడానికి నిజ-సమయ సమాచారాన్ని తీసుకుంటుంది.
మోడల్ యొక్క కార్యాచరణ యంత్రాంగం నిరంతర ఫీడ్బ్యాక్ లూప్ను కలిగి ఉంటుంది. కంప్యూటర్_యూజ్ సాధనానికి ఇన్పుట్లలో వినియోగదారు ప్రారంభ అభ్యర్థన, ప్రస్తుత డిజిటల్ వాతావరణం యొక్క స్క్రీన్షాట్ మరియు AI యొక్క ఇటీవలి చర్యల చరిత్ర ఉంటాయి.
మోడల్ ఈ ఇన్పుట్లను విశ్లేషించి, ఆపై అత్యంత సముచితమైన తదుపరి దశను నిర్ణయిస్తుంది, ఫంక్షన్ కాల్తో ప్రతిస్పందిస్తుంది (ఉదా., క్లిక్ చేయడం లేదా టైప్ చేయడం).
కొనుగోలు చేయడం వంటి కొన్ని సున్నితమైన చర్యలు భద్రత కోసం అదనపు వినియోగదారు నిర్ధారణ పొర అవసరమయ్యేలా రూపొందించబడ్డాయి.
మోడల్ యొక్క ఫంక్షన్ కాల్ నిర్ణయించబడిన తర్వాత, క్లయింట్-సైడ్ కోడ్ వాస్తవ-ప్రపంచ ఇంటర్ఫేస్లో చర్యను అమలు చేస్తుంది.
ఈ చర్య లూప్ యొక్క తదుపరి దశను ప్రేరేపిస్తుంది: నవీకరించబడిన వాతావరణం యొక్క కొత్త స్క్రీన్షాట్ మరియు ప్రస్తుత URL సంగ్రహించబడి మోడల్కు తిరిగి ఇవ్వబడుతుంది.
AI పనిని విజయవంతంగా పూర్తి చేసే వరకు, లోపాన్ని ఎదుర్కొనే వరకు లేదా భద్రతా ప్రోటోకాల్ లేదా వినియోగదారు ద్వారా ఆపివేయబడే వరకు ఈ ప్రక్రియ పునరావృతమవుతుంది - విశ్లేషించడం, చర్య తీసుకోవడం మరియు అభిప్రాయాన్ని స్వీకరించడం.
జెమిని 2.5 కంప్యూటర్ యూజ్ మోడల్ "మొబైల్ UI నియంత్రణ పనులకు బలమైన వాగ్దానాన్ని" ప్రదర్శిస్తుండగా, గూగుల్ దీనిని ప్రధానంగా వెబ్ బ్రౌజర్ల కోసం ఆప్టిమైజ్ చేసింది.
డెస్క్టాప్ ఆపరేటింగ్ సిస్టమ్-స్థాయి నియంత్రణ కోసం ఇది ఇంకా పూర్తిగా ఆప్టిమైజ్ కాలేదని కంపెనీ పేర్కొంది.
అయినప్పటికీ, ఈ మోడల్ అత్యల్ప జాప్యం వద్ద బ్రౌజర్ నియంత్రణ కోసం ప్రముఖ నాణ్యతను అందిస్తుందని గూగుల్ హైలైట్ చేస్తుంది, ఇది ఆన్లైన్-మైండ్2వెబ్ కోసం బ్రౌజర్బేస్ హార్నెస్పై పనితీరు మెట్రిక్ల ద్వారా మద్దతు ఇవ్వబడిన వాదన, ఇది ఆటోమేటెడ్ డిజిటల్ టాస్క్ అమలులో ఒక ముఖ్యమైన ముందడుగుగా ఉంచుతుంది.
No comments:
Post a Comment
Please Dont Leave Me