Özgür Orhangazi
11 Ekim 2026
OpenAI geçtiğimiz ay henüz kullanıma sunulmamış bir modelinin matematiğin en ünlü açık problemlerinden biri olan Navier-Stokes problemini çözdüğünü duyurdu ve bu duyuruyla birlikte bir tartışma da başladı. Bu problemle yakından ilişkili problemlerde benzer bir araştırma hattı izleyen matematikçiler Tristan Buckmaster ve Levent Alpöge, çalışmalarında Claude ve OpenAI’ın Codex’i dahil farklı yapay zekâ araçlarından yararlanmışlardı. Buckmaster, OpenAI’ın modelinin kendi çalışmalarından beslenmiş olup olmadığını sorguladı. OpenAI ise ilk açıklamasında kullanıcı verilerine doğrudan erişilmese de kullanıcıların anonimleştirilmiş verilerinin modellerin geliştirilmesine katkıda bulunmuş olabileceğini dışlayamayacağını söyledi. Şirket birkaç gün sonra bu ihtimali kesin bir dille reddetse de ilk açıklama meselenin özünü ortaya koyuyordu: Yapay zekâ çağında kullanıcıların ürettikleri bilgi dahil her şey veridir ve alınıp kullanılabilir.
Sene başında Washington Post’ta yayımlanan bir haber ise insanlığın bilgi birikiminin yapay zekâ şirketlerince nasıl hammaddeye çevrildiğinin çarpıcı bir örneğini sunuyordu. Gazetenin bir telif davasının dosyalarında açığa çıkan şirket içi belgelere dayanarak aktardığına göre Anthropic, önemli bir kısmı ikinci el olan milyonlarca kitabı toplu bir biçimde satın alıp taratarak model eğitiminde kullanılabilecek bir veri havuzuna dönüştürdükten sonra bu kitapları geri dönüşüme gönderip ortadan kaldırmıştı.[1] Bu olay, Anthropic’in daha önce korsan kitap koleksiyonlarından yararlanması üzerine başlayan bir telif hakkı davasında ortaya çıkmıştı. Mahkeme, satın alınıp taranan kitaplarla model eğitmeyi “adil kullanım” sayarken korsan kopyalar için ise şirket eser başına yaklaşık 3 bin dolar, toplamda 1,5 milyar dolar ödeyerek uzlaşmaya gitti.[2]
Kitaplar, internet siteleri, bilgisayar kodları, fotoğraflar, videolar, ses kayıtları, kullanıcı sohbetleri ve geri bildirimleri, kısacası dijitalleştirilebilen hemen her şey veri havuzunun bir parçası olarak görülüyor. Tabii bu devasa veri yığını kendiliğinden eğitim verisi haline gelmiyor. Toplanan verinin seçilmesi, temizlenmesi, bazı içeriklerin ayıklanması, sınıflandırılması ve modelin kullanabileceği biçime dönüştürülmesi gerekiyor. Her ne kadar şirketler artık bu işlemlerin bir bölümünde başka yapay zekâ sistemlerini kullanıyor olsa da hangi verinin kaliteli, hangisinin zararlı, hangisinin uygun, güvenilir sayılacağına ilişkin kıstasların belirlenmesi ve ortaya çıkan sonuçların kontrol edilmesi hâlâ insan kararlarına ve emeğine dayanıyor.
Burada özellikle iki tür görünmeyen emek dikkat çekiyor. Birincisi, doğrudan bu işleri yapmak üzere istihdam edilenlerin emeği. Etiketleme ve değerlendirme işleri genellikle küçük parçalara bölünerek dijital emek platformları veya taşeron şirketler üzerinden yaptırılıyor ve çoğunlukla parça başı ücretle Güney’deki ucuz emek kullanılıyor. Bu yapıda yapay zekâ şirketleri işi bir veri şirketine, o da bir platforma ya da taşerona devrediyor. Örneğin, Time’da yer alan bir habere göre Kenya’da bir taşeron şirket tarafından saatte iki dolardan az bir ücretle istihdam edilen işçiler, OpenAI şirketi için şiddet, istismar ve nefret söylemi içeren metinleri okuyup sınıflandırıyordu.[3]
İkinci tür emek ise karşılıksız, hatta çoğu zaman farkında olmadan gerçekleştirilen faaliyetlerden oluşuyor. Örneğin, insanlar sosyal medyaya fotoğraflar yüklüyor, bunları etiketliyor, yer bilgisi ekliyor. Sosyal medya kullanıcıları açısından basit bir gündelik faaliyet olan bu etkinlik, şirket için çok büyük ve ayrıntılı bir biçimde etiketlenmiş bir veri havuzu anlamına geliyor. İnsanlar içeriği ücretsiz olarak üretip sınıflandırdıkça makine öğrenmesi sistemlerinin kullanabileceği veri daha zengin hâle geliyor. Bu karşılıksız faaliyetin ilginç bir örneği de internette sıklıkla karşımıza çıkan ve CAPTCHA olarak bilinen insan doğrulama testlerinin en yaygını olan reCAPTCHA sistemi. İnsan olduğumuzu ispat etmemiz için örneğin “trafik ışıklarının bulunduğu kareleri” işaretlememizi ya da şekli bozuk kelimeleri okuyup yeniden yazmamızı isteyen bu sistem, aslında makinelerin çözmekte zorlandığı küçük bir sınıflandırma işlemini bize karşılıksız olarak yaptırıyordu. Taranmış eski kitaplardan ya da gazete arşivlerinden gelen ama bilgisayarların okuyamadığı şekli bozuk kelimeler, bizim yaptığımız düzeltmelerle dijitalleştirilmekteydi. Sistemi geliştirenlerin 2008’de yayımladığı makaleye göre sistemin sadece ilk yılında kullanıcılar 1,2 milyardan fazla CAPTCHA çözmüş, 440 milyondan fazla kelimeyi okumuştu.[4] Tek tek bakıldığında önemsiz görünen bu faaliyet, milyonlarca kullanıcı milyarlarca kez tekrarladığında ortaya muazzam miktarda insan emeği ve bundan beslenen bir veri birikimi çıkarıyor.
Bu karşılıksız faaliyetin bir başka biçimiyse yapay zekâ sistemlerinin kullanımında ortaya çıkıyor. Kullanıcılar aynı anda hem sistemden faydalanıyor hem de yeni veri üretiyor, sistemi test ediyor ve modelin gelişmesine katkı sunuyor. Yazının başında bahsettiğimiz tartışma da bu bağlamda değerlendirilebilir. Sorulan sorular, yapılan sohbetler, beğenilen ya da reddedilen yanıtlar ve geri bildirimler model geliştirmede kullanılabilecek yeni veri kaynaklarına dönüşüyor. Böylece yapay zekâ ürünlerinin kullanıcıları aynı zamanda karşılıksız faaliyetleriyle veri, değerlendirme ve iyileştirme bilgisi üreten üreticiler hâline geliyor. Nihayetinde yapay zekâ şirketleri, Silikon Vadisi’ndeki yüksek ücretli mühendis, fizikçi ve matematikçilerden dünyanın başka bir ucunda düşük ücretler karşılığında insanlığın en karanlık içeriklerini okuyup/izleyip sınıflandıranlara uzanan geniş bir işgücüne dayanmakla kalmıyor, interneti ve bu yapay zekâ modellerini kullananların karşılıksız faaliyetleri sırasında ürettikleri veri ve bilgiyi de kendi birikim sürecinin bedelsiz bir girdisine dönüştürüyor.
Marx, Grundrisse’de makineleri “bilginin nesneleşmiş gücü” olarak tarif edip sabit sermayenin gelişiminin, genel toplumsal bilginin ne ölçüde doğrudan bir üretici güce dönüştüğünü gösterdiğini söyler. Yapay zekâyı bir anlamda bunun bugüne kadarki en çarpıcı örneği olarak değerlendirebiliriz. Toplumun birikmiş bilgisi ve ortak güçleri, özel olarak kontrol edilen bir sermaye varlığına ve üretim aracına dönüşüyor. Ama bu nesneleşmiş bilgi kendi başına yaşamıyor, etiketleyenlerin, değerlendirenlerin ve kullananların canlı emeğiyle de sürekli beslenmek zorunda. Öte yandan, insanlığın tüm bilgi birikimine sahip olmak dahi bir yapay zekâ modeli yaratmak için yeterli değil. Bu devasa veri yığınını işleyebilmek için oldukça gelişmiş bilgisayar çipleri, veri merkezleri, yazılım altyapısı, kesintisiz enerji kaynakları gibi milyarlarca dolarlık sermaye yatırımları gerekiyor. Bu maddi altyapıyı ve bunu kontrol eden şirketleri de bir sonraki yazıya bırakalım.
Notlar:
[1] https://www.washingtonpost.com/technology/2026/01/27/anthropic-ai-scan-destroy-books/
[2] https://apnews.com/article/anthropic-copyright-authors-settlement-training-f294266bc79a16ec90d2ddccdf435164
[3] https://time.com/6247678/openai-chatgpt-kenya-workers/
[4] https://www.science.org/doi/10.1126/science.1160379