Çinli yapay zeka laboratuvarı DeepSeek, yakın zamanda OpenAI'nin ChatGPT o1'iyle aynı seviyede, hatta daha iyi olduğunu iddia ettiği amiral gemisi modeli R1'i piyasaya sürdü. DeepSeek, ChatGPT'yi geride bırakarak Apple App Store'da zirveye yerleşti. ABD'li teknoloji borsası, DeepSeek'in maliyet etkin modelinden etkilendi. Bu nedenle, her iki yapay zeka modelini de değerlendirmek ve hangisinin daha yetenekli olduğunu görmek için, aşağıda çeşitli karmaşık muhakeme testlerinde ChatGPT o1 ve DeepSeek R1'i karşılaştırdık.

Hızlı Linkler
ChatGPT o1 vs DeepSeek R1: Yanlış Odaklanma
Büyük dil modelleri genellikle "Rastgele papağanlar"Gerçek bir genelleme eksikliği ve bir sonraki kelimeyi veya sembolü tahmin etmek için istatistiksel desen eşleştirmeye ve ezberlemeye yoğun bir şekilde güvenmesi nedeniyle. Ancak yapay zeka alanındaki son gelişmeler (örneğin; OpenAI o3), bu anlatı, gelişmiş modellerin belirli bir genelleme düzeyine ulaşması ve kendilerine programlanmamış olan ortaya çıkan davranışları sergilemesiyle oldukça hızlı bir şekilde değişir.
Yapay zeka modellerinin eğitildiği pek çok ortak bulmaca, bilmece ve düşünce deneyi vardır. Dolayısıyla, eğitim verilerinde bulunan yaygın bulmacalardan biri sorulduğunda, büyük dil modelleri bilgiyi büyük ölçüde eğitim kümelerinden alır.
Ancak, modeli yanıltmak için bulmacayı biraz değiştirdiğinizde, çoğu Büyük dil modelleri başarısız oluyor Öğrenilen kalıplar tekrarlanır. Burada yapay zeka modelinin gerçekten akıl yürütmeyi uygulayıp uygulamadığını, yoksa sadece basit bir ezber mi olduğunu yargılayabilirsiniz.

Yukarıdaki soruda cerrahın çocuğun babası olduğu açıkça belirtilmiş olmasına rağmen hem ChatGPT o1 hem de DeepSeek R1 yanlış cevap veriyor. Her iki modelde de cerrahın çocuğun annesi olduğu söylenerek, cerrahların erkek olduğu varsayımı sorgulanıyor. Soru, başka bir olasılığı arayıp yanlış cevaba yönlendirmek için tasarlanmıştır. Bu arada ilginç olan şu ki İkizler 2.0 Flaş (Düşünme modeli değil) doğru cevaplıyor.
Kazanan: Yok
ChatGPT o1 vs DeepSeek R1: Matematik vs. Mantıksal Muhakeme
Google, Yemek Kitabı sayfasına mantıksal akıl yürütme modellerini test etmek için bazı harika sorular ekledi. Yemek kitabı. Çok Modlu Düşünme (+ Matematik) sorularından birini aldım ve metne dönüştürdüm çünkü DeepSeek R1 henüz multimedya girişini desteklemiyor..
Testlerimde hem ChatGPT o1 hem de DeepSeek R1 sorunu doğru şekilde çözdü. Her iki model de '9' numaralı topu çevirerek '6' yaptı ve 6 + 11 + 13'ü ekleyerek 30 sonucunu elde etti. Her iki model de harika iş çıkardı!

Kazanan: ChatGPT o1 ve DeepSeek R1
ChatGPT o1 vs DeepSeek R1: İnsanlığın Final Sınavından Bir Soru
Yapay Zeka Bütünlüğü Merkezi (CAIS) yakın zamanda çeşitli akademik konularda yapay zekanın hızlı ilerlemesini izlemek için “İnsanlığın Son Sınavı” (HLE) adı verilen bir ölçüt duyurdu. Bu standartta dünyanın dört bir yanından önde gelen bilim insanları, profesörler ve araştırmacıların soruları yer almaktadır. CAIS bu sorulardan bazılarını örnek olarak web sitesinde yayınladı. Yunan mitolojisinden bir soru seçip ChatGPT o1 ve DeepSeek R1'de test ettim.

ChatGPT o1 modeli yaklaşık 30 saniyede düşünüp, tanrı Hermes'in Jason'ın anne tarafından büyük büyükbabası olduğunu yanıtladı ve bu da doğruydu. DeepSeek R1'in soyağacını yeniden oluşturması yaklaşık 28 saniye sürerken, "Aeolus" yanıtını verdi ki bu yanlıştır. Bu test büyük ölçüde ezberleme yeteneğini ölçse de, yapay zeka modellerinin mantığı ve ilişkileri anlayıp anlamadığını kontrol etmenin önemli bir yoludur.
Kazanan: SohbetGPT o1
ChatGPT o1 ve DeepSeek R1: Tramvay İkilemi
Ünlü tramvay problemini duymuş olmalısınız, ancak yanlış yönlendirilmiş dikkatin değerlendirilmesinin bir parçası olarak, modelin karıştırılması için soru biraz değiştirildi (GitHub). Şimdi bu modellerin doğru cevabı bulup bulmadığına bakalım.
İlk olarak, ChatGPT o1 29 saniye düşündü ve numarayı buldu – Zaten beş kişi öldü. Bir rayda yaşayan bir insan, diğer rayda ise yaşayan bir insan. ChatGPT o1 vakit kaybetmeden kolu çevirmenin doğru olmadığını, çünkü ölmüş olanlara zarar verilemeyeceğini söyledi.

Öte yandan DeepSeek R1 "ölü insanlar" kısmını görmezden geldi çünkü Eğitim kalıplarına aşırı güvenmesi Ve etik bir tartışmaya girişildi. Evrensel olarak doğru bir cevabın olmadığını söyledi. ChatGPT o1 bu turda konuyu açıkça anlıyor.
Kazanan: SohbetGPT o1
ChatGPT o1 vs DeepSeek R1: Matematiksel Muhakeme
Matematiksel muhakemeyle ilgili bir diğer soruda, ChatGPT o1 ve DeepSeek R1'den biri 4 litrelik diğeri 6 litrelik iki kova kullanarak tam olarak 12 litre ölçmelerini istedim. ChatGPT o1 47 dakika XNUMX saniye düşündü ve bunun matematiksel olarak imkansız olduğunu söyledi, ki bu doğru cevaptır. Yapay zeka modelleri genellikle kendilerine bir problem sunulduğunda bir cevap bulmaya çalışırlar.

Ancak ChatGPT o1 fazladan bir adım attı ve en büyük ortak böleni (EBOB) hesapladı ve 4'ün 6'nın katı olmadığını söyledi. Bu yüzden tam olarak 4 litreyi ölçmek için "doldur, boşalt, dök" kuralını kullanamayız.
Şaşırtıcı bir şekilde, DeepSeek R1 sadece 47 saniye düşündü, aynı yaklaşımı izledi ve şu yanıtı verdi: "Bu özel kova boyutlarıyla matematiksel olarak imkansızdır.başlıklı bir kılavuz yayınladı
Kazanan: ChatGPT o1 ve DeepSeek R1
ChatGPT o1 vs DeepSeek R1: Politik Sansür ve Önyargı
DeepSeek'in Çin'e ait bir yapay zeka laboratuvarı olduğu göz önüne alındığında, Çin Halk Cumhuriyeti'yle ilgili birçok tartışmalı konuda kendini sansürlemesini bekliyordum. Ancak DeepSeek R1 bundan çok daha ileri gidiyor ve isteminizde Çin Devlet Başkanı Xi Jinping'in adını andığınızda bile istemleri tetiklemenize izin vermiyor. Bu işe yaramıyor.

Bu yüzden DeepSeek R1'e "Çin'in başkanı kimdir?" diye sorarak bu sorunu aşmaya çalıştım. Düşünmeye başladığı anda model birden durur ve şöyle der:Üzgünüm, bu tür sorularla nasıl başa çıkacağımı henüz bilmiyorum. Hadi gelin matematik, programlama ve mantık konuşalım!"
Benzer şekilde, Jack Ma, Uygurlar, diktatörlük, hükümet veya demokrasi gibi kavramların geçtiği istemleri çalıştıramazsınız, bu da kafa karıştırıcıdır.

Öte yandan ChatGPT o1'den ABD'nin şu anki Başkanı Donald Trump hakkında bir şaka yazmasını istedim ve hiçbir sorun yaşamadan geri dönüş sağladı. Hatta ChatGPT o1'den espriyi biraz kötü yapmasını istedim ve harika bir iş çıkardı. ChatGPT o1 cevapladı: “Donald Trump'ın saçları, iş dünyasındaki başarısından daha fazla taranmaya maruz kaldı ve ikisi de bozulmaya devam ediyor."
Basitçe söylemek gerekirse, politik konularda yoğun sansür uygulanmayan bir yapay zeka modeli arıyorsanız, ChatGPT o1'i seçmelisiniz.
Kazanan: SohbetGPT o1
ChatGPT o1 ve DeepSeek R1 Karşılaştırması: Hangisini Kullanmalısınız?
Siyasi konular hariç, DeepSeek R1, ChatGPT'ye ücretsiz ve etkili bir alternatiftir. ChatGPT'ye en iyi alternatiflerden biriVe bu O1 modelinin performans seviyesine oldukça yakın.. DeepSeek R1'in ChatGPT o1'den daha iyi performans gösterdiğini kesin olarak söyleyemem, zira bu testler OpenAI modelinin DeepSeek'ten sürekli olarak daha iyi performans gösterdiğini kanıtlıyor.
Ancak, var DeepSeek R1'in çekici yanı düşük maliyetidir.. DeepSeek R1'i ücretsiz kullanabilirsiniz, ancak OpenAI ChatGPT o20'e erişmek için 1$ talep ediyor.
Ve geliştiriciler için şunu unutmayalım, DeepSeek R1 API, ChatGPT o27'den 1 kat daha ucuzdurBu, model fiyatlandırmasında büyük bir değişiklik anlamına geliyor. Araştırma topluluğuna gelince, DeepSeek ekibi ağırlıkları yayınladı ve OpenAI'nin o1 modelleriyle yaptığı yeni modele benzer şekilde test süresi hesaplamasının nasıl gerçekleştirileceğine ilişkin takviyeli öğrenme (RL) yöntemini açık kaynaklı hale getirdi.
Ayrıca DeepSeek'in eski GPU'larda R1 modelini eğitmek için sadece 5.8 milyon dolara geliştirdiği yeni model mimarisi, diğer yapay zeka laboratuvarlarının çok daha düşük maliyetle gelişmiş modeller oluşturmasına yardımcı olacak. Önümüzdeki aylarda diğer yapay zeka şirketlerinin de DeepSeek AI'nın çalışmalarını tekrarlaması bekleniyor.
Genel olarak DeepSeek R1, basit bir yapay zeka modelinden çok daha fazlasıdır; pahalı donanım kümelerine ihtiyaç duymadan, bütçenize uygun şekilde gelişmiş yapay zeka modellerini eğitmenin yeni bir yolunu sunar.










