ChatGPT बनाम क्लाउड बनाम मिथुन: अनुसंधान के लिए सर्वश्रेष्ठ एआई (हॉलुसिनेशन टेस्ट परिणाम) [HI]

ChatGPT बनाम क्लाउड बनाम मिथुन: अनुसंधान के लिए सर्वश्रेष्ठ एआई (हॉलुसिनेशन टेस्ट परिणाम)

कौन से मॉडल वास्तव में आपको सच बताते हैं और कौन आपके लिए झूठ बोल रहे हैं। मेरी टीम ने अकादमिक अनुसंधान के लिए सबसे लोकप्रिय बड़े भाषा मॉडलों का परीक्षण किया है और यहां परिणाम हैं। इसलिए पहली बात यह है कि हम वास्तव में क्या करते हैं। इसलिए दो चीजें हम परीक्षण करना चाहते थे। पहली बात यह है कि यह वास्तविक संदर्भ प्रदान करता है? मैं इन पहले कॉल करता हूँ

यदि वे केवल एक सरल संदर्भ प्रदान नहीं करते हैं तो आदेश मतिभ्रमण। इसलिए एआई उपकरण वास्तव में उन संदर्भों के लिए वास्तविक संदर्भ और वास्तविक प्रकार के लिंक खोजने में बेहतर हो रहे हैं। लेकिन सबसे महत्वपूर्ण बात यह नहीं है कि पहला ऑर्डर मतिभ्रमण। नहीं, क्योंकि हम इसे वास्तव में आसानी से देख सकते हैं। एक ऐसी चीज जो बहुत प्रयास करती है, वह दूसरे ऑर्डर की गणना करने के लिए है। यही है

दावा उद्धृत करना। क्या यह वास्तव में उचित कारणों के लिए सही कागज पर है या यह वास्तव में कागज में दावा करता है? और मैं इन दूसरे आदेशों की व्याख्या करता हूँ। तो कागज की सामग्री द्वारा समर्थित प्रतिक्रियाएं हैं? मैं क्या करना चाहता हूँ? ये

मेरी तरह की सफलता और असफलता मानदंड हैं। तो क्या यह सटीक संदर्भ प्रदान करता है? और क्या उद्धरण वास्तव में इस दावे का समर्थन करता है कि यह उद्धृत किया जा रहा है? इसलिए ये मॉडल हैं जिन्हें मैंने परीक्षण किया है और टीम ऊपर और आगे बढ़ गई है। उन्होंने घंटों और घंटों के दौरान अपने लिए इन सभी का परीक्षण किया। हम ढूंढ रहे हैं

कौन सा वास्तविक मॉडल आपके लिए उपयोग करने के लिए सबसे उपयोगी है और आपको पूरी तरह से बचना चाहिए। तो यहाँ हम मॉडल का परीक्षण किया है। आप चैट GPT में देख सकते हैं हमने इन सभी मॉडलों का परीक्षण किया और फिर उह क्लाउड में हमने इन सभी मॉडलों का परीक्षण किया और फिर उह मिथुन में हमने इन सभी मॉडलों का परीक्षण किया। अब यह ध्यान रखना बहुत महत्वपूर्ण है कि इनमें से कुछ मॉडलों के लिए आपको भुगतान करने की आवश्यकता है और खराब अलर्ट भुगतान वास्तव में इसे बेहतर नहीं बनाता है। मैं एक मिनट में क्या मतलब हूँ? इसलिए मैं क्या हूँ

करना चाहता था। तो पहली बात यह है कि हम किस तरह के प्रॉम्प्ट का उपयोग कर रहे हैं? ठीक है, इसलिए यहां एक प्रकार का संकेत है कि मैं अंततः प्रत्येक अलग मॉडल पर उपयोग कर रहा हूं। मैं जानना चाहता हूं कि यह कुछ समर्थन करने के लिए एक वास्तविक जवाब प्रदान कर सकता है। क्या यह मुझे एक वास्तविक उद्धरण प्रदान करता है जो वास्तविक है? और यह भी इसे बाहर रख सकते हैं

aPA ग्रंथसूची शैली में? तो यह एक बड़ी भाषा मॉडल से पूछने के लिए बहुत कुछ है। तो यह एक तनाव परीक्षण का एक सा है। लेकिन ये परिणाम हैं कि मुझे लगता है कि आपके लिए सबसे महत्वपूर्ण है। तो, पहले आदेश मतिभ्रमण, वास्तव में संदर्भ मौजूद है? अब, मोटे तौर पर, जब हम कर रहे हैं

जब हम क्लाउड के बारे में बात कर रहे हैं, तो हम जेमिनी के बारे में बात कर रहे हैं, ये परिणाम हैं। चैट GPT समय के 60% पर एक सही प्रतिक्रिया देता है। उम, क्लाउड के लिए, यह समय का लगभग 56% था। और फिर मिथुन के लिए, केवल 20% समय यह वास्तव में एक संदर्भ है कि वास्तव में अस्तित्व में प्रदान किया गया था। और निश्चित रूप से, यह केवल सतह को खरोंच कर रहा है। तो क्या

क्या हम अलग-अलग मॉडलों को बदलते हैं? ठीक है, यहाँ यह है। तो यहाँ सभी विभिन्न मॉडल यहाँ हैं। अब, चैट GPT समग्र रूप से, सबसे अच्छा जो आप उपयोग कर सकते थे वे GPT5 सोच रहे थे, और आपको वेब खोज को सक्षम करना पड़ा और अब तक सबसे अच्छा था। फिर, अगले जीपीटी 5 ऑटो प्लस गहरे शोध चैट किया गया था। जब तक आप थे

गहरी शोध या वेब खोज चालू हो गई, फिर यह वास्तव में वास्तविक संदर्भ प्रदान करता है। महान। और याद रखें, इस बारे में नहीं है कि उन संदर्भों में दावा क्या यह उद्धृत किया जा रहा है का समर्थन करते हैं या नहीं। यह सिर्फ, हाँ, संदर्भ मौजूद है, लेकिन फिर हम क्लाउड को देखते हैं, और आप देख सकते हैं कि यह क्लाउड के साथ मिश्रित बैग की तरह है। उनमें से कुछ वास्तव में अच्छा काम करते हैं। तो, Sonnet 4 प्लस शोध किया

वास्तव में अच्छी तरह से वास्तविक संदर्भ प्रदान करने में 100% सफलता दर मौजूद है। फिर, ओपस 4.1 को बकवास था। यह किसी भी रेफरी को प्रदान नहीं करता था। खैर, यह

लेकिन वास्तव में उनमें से कोई भी अस्तित्व में नहीं है। और आश्चर्यजनक रूप से, मेरे पिछले प्रयोगों के बावजूद, जब दबाव में डाल दिया जाता है, तो मिथुन ने सबसे बुरा काम किया। देखो, आप देख सकते हैं कि फ्लैश 2.5 प्रो, जो आपके लिए भुगतान करता है, साथ ही गहरे शोध, कोई भी संदर्भ वास्तव में मौजूद नहीं है। और फिर हमें यहां मिला है फ्लैश 2.5, कोई भी संदर्भ नहीं

वास्तव में अस्तित्व में है। और फिर केवल 40% वास्तव में उनमें से बाकी के लिए अस्तित्व में है। इसलिए आप देख सकते हैं कि यह एक मिश्रित बैग है जिसके रूप में आपको बड़ी भाषा मॉडल का उपयोग करना चाहिए। और यह केवल वही है कि यह वास्तव में मौजूद है या नहीं। और हम शीर्षक, लेखकों, वर्ष, उस सभी सामान सहित एक पूर्ण संदर्भ की तलाश कर रहे हैं। आप जानते हैं कि जेमिनी

एक बिट बकवास दोस्त। तुम क्यों? इसलिए GPT 5 को विशेष रूप से चैट करें, यदि आप वास्तविक संदर्भ चाहते हैं और ऐसा इसलिए है क्योंकि यह वेब सर्च और डीप रिसर्च कर रहा है। ठीक है, इसलिए हम जानते हैं कि चैट GPT बेहतर है या यदि हम सिर्फ संदर्भ ढूंढना चाहते हैं तो सबसे अच्छा है। क्या है?

यही कारण है कि संदर्भ में सही सामग्री होती है कि यह वास्तव में संदर्भित क्यों है। और मैं आपको समग्र चीज़ देने जा रहा हूँ। यहीं है। चैट GPT केवल तरह की तरह बस के बारे में मिल गया है और यह रास्ते से सभी मॉडलों के पार था। उह उद्धरण के 50% के तहत वास्तव में उन जानकारी को शामिल किया गया है जो उन्हें उद्धृत किया जा रहा था।.

इसलिए यह थोड़ा बकवास है, यह नहीं है? आप आधे से अधिक चीजों पर भरोसा नहीं कर सकते हैं जो जीपीटी प्रदान करते हैं। क्लाउड भी बदतर था। इसलिए केवल 40% से अधिक प्रशस्तिओं में वास्तव में जानकारी होती है कि उन्हें उद्धृत किया जा रहा है। और मिथुन इसे देखते हैं। यह

गलती नहीं है। मिथुन किसी भी संदर्भ प्रदान करने में सक्षम नहीं थे। अब इसे प्राप्त करें। अब कोई वापस बैठता है। इसे देखिए। मिथुन ने कोई नहीं दिया

जहां सामग्री कागज में थी, जिसके लिए यह उद्धृत किया जा रहा था। ऐसा इसलिए है कि आपको इस तरह के शैक्षिक अनुसंधान के लिए उपयोग नहीं करना चाहिए। और एक बार फिर, यह सिर्फ सतही स्तर है। यह सभी मॉडलों में है। चलो थोड़ा गहरा खरोंच करते हैं और हम देख सकते हैं कि यह परिणाम है।.

तो क्या उद्धरण दावे से मेल खाता है? uh चैट GPT5 एक बार फिर सोच रहा है। इसलिए गहन शोध के साथ सोचना, वेब खोज के साथ सोचना, वे यहां सबसे अच्छे थे। आप देख सकते हैं कि गहन शोध के साथ ऑटो ठीक हो गया था। और उसके बाद चैट GPT5 एजेंट सब पर काम नहीं किया। ओके

0% सफलता दर। और फिर क्लाउड अगले थे। आप देख सकते हैं कि वास्तव में यह संदर्भों का हवाला देते हुए 40 से 50% तक की सफलता दर थी जहां दावा संदर्भ के भीतर समर्थित था। फिर भी, ओह, गरीब मिथुन। मुझे लगता है कि अब मैं इसके लिए खेद है। गरीब मिथुन। इसमें 0% सफलता थी

दर। तो, इसका क्या मतलब है? कुल मिलाकर, पहले और दूसरे ऑर्डर की गणना का मतलब है कि थोक, यह उन्हें सबसे सफल होने के लिए कम से कम सफल होने के क्रम में है। इसका वास्तव में मतलब है कि आपको चैट GPT5 सोच और वेब खोज का उपयोग करना चाहिए यदि आप वास्तव में संदर्भ प्राप्त करने का कोई मौका चाहते हैं। और उन संदर्भों के लिए उपयुक्त जानकारी है कि यह क्यों संदर्भित किया जा रहा है। आप चैट GPT नीचे देख सकते हैं

यहाँ पांच ऑटो सोच और गहरी अनुसंधान या वेब खोज के साथ हावी है। क्या मैं अभी उपयोग कर रहा हूँ? लेकिन इस चैनल को सब्सक्राइब करें क्योंकि मैं भविष्य में अकादमिक अनुसंधान के लिए इन परीक्षण और तनाव परीक्षण करूंगा। मैं तुम्हें वादा करता हूँ। सब ठीक है। फिर

यहाँ सभी तरह से नीचे, आप देख सकते हैं कि ये सबसे खराब थे। जैसा कि उन्हें 0% वास्तविक संदर्भ मिला और 0% स्पष्ट रूप से क्यों वे उद्धृत किए जा रहे थे क्योंकि वे बिल्कुल मौजूद नहीं थे। उम और फिर उह यहाँ बीच में एक मिश्रित बैच है। क्या आप ऐसा करना चाहिए? यहां आपके लिए कुछ टेक-होम संदेश दिए गए हैं। हम कुछ टेक-होम प्यार करते हैं

संदेश क्योंकि आपने कुछ के लिए भुगतान किया है, यह इसे सटीक नहीं बनाती है। यह बहुत महत्वपूर्ण है। इसलिए अगर आप पैसे भुगतान करते हैं तो GPT5 को चैट करें। जबकि इस परीक्षा में मिथुन के साथ, और मुझे पता है कि यह परीक्षण बहुत गहरा हो सकता है, लेकिन इसमें असफल रहा। Um, सबसे अच्छा

गुच्छा। हाँ, हमने इसके बारे में बात की है। मिथुन संघर्ष, निश्चित रूप से। सब ठीक है, फिर। सामान्य विफलता मोड। तो,

इन सभी संदर्भों के बारे में बात यह है कि कभी-कभी कुछ संदर्भित किया जा रहा था और यह कागज में था, लेकिन इसे प्राप्त करें, यह महत्वपूर्ण बात है। यह वास्तव में उस कागज के परिचय भाग में था कि यह क्यों उद्धृत किया जा रहा था। तो यह वास्तव में पहली उह सिद्धांत पहले आदेश का हवाला देते हुए नहीं की तरह था जो आप इसे प्राथमिक स्रोतों कहते हैं, यह वास्तव में कुछ ऐसा करने के लिए एक कागज का हवाला देते थे जो कागज का हवाला देते थे, इसलिए यह सूचना चैट GPT से निकाला गया था और अन्य बड़ी भाषा मॉडल उस पर बहुत अच्छा नहीं हैं और सबसे महत्वपूर्ण बात यह है कि ये plausibility मशीनें हैं, इसलिए जब आप उन आउटपुटों को देखते हैं जिन्हें आप ओह हाँ मानते हैं, तो यह सही होना चाहिए क्योंकि ऐसा लगता है कि यह इतना वास्तविक है, यह वास्तव में मौजूद है। इन बातों में प्लेसबिलिटी इंजन सिर्फ अद्भुत है। यह वास्तव में convincing बनाता है और यदि आप एक बड़ी भाषा मॉडल का उपयोग करने जा रहे हैं तो आपको प्रत्येक व्यक्तिगत संदर्भ को दूर करने और जांचने की आवश्यकता है। उम, और फिर

स्पष्ट रूप से एक सुरक्षित वर्कफ़्लो कुछ उत्पन्न करना है, लेकिन फिर आपको पीडीएफ और पृष्ठ पर हर दावे का पता लगाना होगा कि यह क्यों संदर्भित किया जा रहा है। इन बातों को मैन्युअल रूप से जांचने का एकमात्र तरीका है। अब, अगर मैं एक बड़ी भाषा मॉडल का उपयोग नहीं कर रहा हूं, और मैं अनुशंसा करता हूं कि आप संदर्भ खोजने के लिए एक बड़ी भाषा मॉडल का उपयोग न करें, मैं क्या कर सकता हूं? यहाँ तीन सिफारिशें हैं जिसका मतलब है कि आप इस सामान के बारे में अधिक जानकारी प्राप्त करेंगे क्योंकि वे विशेष रूप से अकादमिक और अनुसंधान के लिए डिज़ाइन किए गए हैं। ओके, आपके बारे में पहला उपकरण स्पष्ट है। Elicit वास्तव में असली कागज़ का उपयोग करता है

और यह आपको उस जानकारी देने से पहले पृष्ठभूमि में जांच की जाती है। इसलिए आप यह सुनिश्चित कर सकते हैं कि यह आपको वास्तविक संदर्भ दे रहा है जो वास्तव में मौजूद है और उस संदर्भ में यह जानकारी क्यों दी जा रही है। प्यार करना दूसरा आकार है। सिस्पेस इस अंतरिक्ष में एक पूर्ण पावरहाउस बन रहा है। बस

अपने एजेंट को जारी किया। मुझे पता है कि मैं इसके बारे में बात करता हूँ, जहां मेरी दूसरी वीडियो देखें। लेकिन यहाँ आप चीजों के भार कर सकते हैं। आप कागजात की खोज कर सकते हैं। आप एक साहित्य समीक्षा बना सकते हैं और यह दुनिया में वास्तविक संदर्भों पर आधारित है।.

वास्तव में महान है कि एक अन्य आम सहमति है। यह वास्तव में एक महान उपकरण है। यदि आपको किसी विशेष शोध क्षेत्र से हाँ या नहीं जानने की आवश्यकता है, तो मेरे अन्य सर्वसम्मति वीडियो को चेक करें जहां मैं सभी भयानक चीजों के बारे में बात कर सकता हूं। इन तीन उपकरणों का उपयोग करें। यदि आप संदर्भों की खोज करना चाहते हैं, तो बड़ी भाषा मॉडल भाषा के साथ काम करने में बहुत अच्छे हैं, लेकिन सूचना एकत्र करने के लिए स्रोत के रूप में नहीं।.

यही कारण है कि आपको विशेष उपकरणों का उपयोग करने की आवश्यकता है और इस चैनल पर मेरे अन्य वीडियो को चेक करने की आवश्यकता है क्योंकि यही वह चैनल है जिसके बारे में यह सब है। मैं जल्द ही इन उपकरणों का परीक्षण कर रहा हूँ। इसलिए, सदस्यता लें और मैं आपको अगले वीडियो में देखेंगे। यदि आप इस वीडियो को पसंद करते हैं और आप उन सभी एआई उपकरणों को जानना चाहते हैं जिन्हें आपको पता होना चाहिए, तो इस बात की जांच करें क्योंकि मैं अकादमिक और अनुसंधान के लिए सभी एआई उपकरणों को सूचीबद्ध करता हूं, जिसके बारे में आपको पता होना चाहिए। इसे बाहर देखें।.


:video_camera: Watch on YouTube
:magnifying_glass_tilted_left: Keyword: best AI writing tools comparison