Yapay zeka kullanımını ölçmeye kalkışan herkesin karşılaştığı ama çok azının konuştuğu bir sorun var: istemlerin büyük bölümü tek başına hiçbir şey ifade etmez.
"devam." "evet." "tamam." "peki bunu da yap."
Bu istemler bir konu taşımaz. Ama arkalarında dakikalarca süren, binlerce token harcayan bir iş vardır. Ölçüm bunları görmezden gelirse faturanın büyük bölümü kaybolur.
Ölçtüğümüz oran
739 gerçek görev üzerinde yaptığımız analizde:
- Görevlerin %42'si bağlamsız devam istemiydi
- Bunlar tek başına sınıflandırıldığında maliyetin %35'i "belirsiz" kategorisine düştü
Yani bir yöneticiye sunacağımız raporda faturanın üçte biri için "ne olduğunu bilmiyoruz" yazacaktı. Böyle bir rapor işe yaramaz.
Ajan tarzı yapay zeka kullanımında bu oran doğaldır. Kullanıcı bir görevi başlatır, model çalışır, kullanıcı onaylar, model devam eder. Onay istemleri kısa ama arkalarındaki iş uzundur. Sohbet tarzı kullanımda oran daha düşük, ama sıfır değil.
Üç yanlış çözüm
Yanlış çözüm 1: görmezden gelmek
Bağlamsız istemleri hiç saymazsanız, arkalarındaki token maliyeti de ölçüme girmez. Rapordaki toplam tutar gerçek faturanın çok altında kalır. Yönetici rakamı faturayla karşılaştırdığı anda araca güveni biter.
Yanlış çözüm 2: "belirsiz" olarak raporlamak
Dürüst görünür ama işe yaramaz. Bir raporun üçte birinin "bilinmiyor" olması, o raporun karar için kullanılamayacağı anlamına gelir.
Yanlış çözüm 3: modele daha çok bağlam vermek
Her devam istemini önceki on istemle birlikte modele göndermek doğruluğu artırır ama maliyeti katlar ve sınıflandırmayı sıralı hale getirir — paralel çalışamazsınız. 739 görev için 0,41 dolar olan maliyet, bu yaklaşımla birkaç dolara çıkar ve süre uzar.
İşe yarayan çözüm: bağlam devralma
Bağlamsız bir istem, aynı oturumdaki bir önceki sınıflandırılmış görevin kategorisini miras alır.
Mantığı basit: "devam" demek yeni bir iş başlatmak değil, süren işi sürdürmektir. Maliyeti de o işe aittir.
Uyguladığımızda:
| Öncesi | Sonrası | |
|---|---|---|
| Belirsiz görev oranı | %42 | %1,4 |
| Belirsiz maliyet payı | %35 | %0,2 |
İki önemli ayrıntı
Miras alınan etiketin güveni sınırlanır. Devralınan bir kategori, doğrudan sınıflandırılmış bir kategoriden daha zayıf kanıttır. Bizim boru hattımızda miras alınan etiketin güven skoru en fazla 0,5 olabilir. Raporda bu görevler "(devam)" ekiyle işaretlenir.
Miras oturum içinde kalır. Farklı bir oturumdaki göreve miras verilmez. Oturum sınırı, konu sınırının en iyi yaklaşık göstergesidir.
Bağlam devralma bir tahmin değil, olgusal bir atıftır. "devam" istemi gerçekten önceki görevin devamıdır; maliyetini oraya yazmak uydurma değil, doğru muhasebedir. Uydurma olan, o maliyeti hiç yazmamak veya rastgele bir kategoriye koymaktır.
Bloklara ayırmak: ikinci düzeltme
Bağlam devralmanın bir yan etkisi var. Bir çalışan iş dışı bir konuda on tur konuştuysa, on ayrı iş dışı işaret üretilir. Rapor bir suçlama yığını gibi görünür.
Ardışık ve aynı kategorideki görevleri tek bir blok olarak raporluyoruz. On tur süren bir freelance konuşması, on ihlal değil, bir olaydır.
Bu hem daha adil hem de yönetici için daha okunaklı. "3 iş dışı blok, toplam 26 dolar" cümlesi, "31 iş dışı görev" cümlesinden hem daha doğru hem daha kullanışlıdır.
Abonelik koltuklarında dolar rakamı
Buraya bir uyarı düşmek gerekiyor. Ölçtüğümüz kullanım abonelik kapsamındaydı; token başına faturalanmıyordu. Dolar rakamlarını API fiyatlarıyla hesapladık ve bu nosyonel bir rakamdır.
Abonelik koltuklarında anlamlı metrik kota payıdır: bu çalışan aldığı koltuğun kapasitesinin ne kadarını iş dışı işe harcadı? Dolar cinsinden ifade etmek iletişimi kolaylaştırır ama faturayla birebir eşleşmez.
Export dosyalarında ise durum daha keskin: claude.ai export'u token bilgisi içermez. Bu yüzden ürünümüz export kaynaklı raporlarda oranı görev sayısına göre hesaplar ve bunu açıkça etiketler. Token verisi olmadan maliyet oranı hesaplamak, sıfır bölen bir hesaptır — sonucu %0 çıkar ve yöneticiyi yanıltır.
Diğer araçlarda ne aramalısınız
Bir AI kullanım analitiği aracı değerlendiriyorsanız şu soruyu sorun:
Kısa devam istemlerini nasıl ele alıyorsunuz? Maliyetleri hangi kategoriye yazılıyor?
Cevap "onları saymıyoruz" veya "belirsiz olarak işaretliyoruz" ise, o aracın raporundaki toplam sizin faturanızla tutmayacaktır.
Özet
- Ajan tarzı kullanımda istemlerin yaklaşık yarısı bağlamsız devam istemi olabilir.
- Bunlar tek başına anlamsızdır ama maliyetin üçte birini taşır.
- Doğru yöntem, aynı oturumdaki önceki görevin kategorisini miras vermektir.
- Miras alınan etiketin güveni sınırlanmalı ve raporda işaretlenmelidir.
- Ardışık iş dışı görevler tek blok olarak raporlanmalıdır.
Ölçümün tamamı 739 görevi ölçtük yazısında; doğruluğun diğer kritik değişkeni için şirket tanımı ve yanlış pozitifler yazısına bakın.