Kısa cevap: Takviminize değil, araştırma sorunuza uyan yöntemi seçin. Uzaktan moderasyonsuz test, bilinen akışları büyük ölçekte doğrulamanın en hızlı yoludur. Uzaktan moderasyonlu test, çoğu ürün sorusu için varsayılan ve en çok başvurulan yöntemdir. Laboratuvar testi, kontrollü koşullara, donanıma ya da hassas bağlamlara ihtiyaç duyduğunuzda maliyetini hak eder. Bağlamsal sorgulama (contextual inquiry), bir ürünün içinde yaşadığı ortamı anlamak içindir. Gerilla testi ise ucuz ve erken yapılan hızlı sağlamalar içindir: ne eksik ne fazla.

Things'te dördünü de uyguluyoruz. "Önce araştırma, sonra görüş" duvara astığımız bir slogan değil; hayata geçirdiğimiz 50'yi aşkın ürünü pahalı yeniden tasarımlardan koruyan çalışma biçimimiz. İşte gerçekte kullandığımız karar çerçevesi.

Başlıca kullanılabilirlik testi yöntemleri nelerdir?

Dört temel yöntem vardır: uzaktan (moderasyonlu ya da moderasyonsuz), laboratuvar, bağlamsal ve gerilla testi. Bu yöntemler üç eksende birbirinden ayrılır: kontrol, bağlam ve maliyet.

  • Uzaktan moderasyonlu: Bir moderatör, görüntülü görüşme üzerinden katılımcıyı görevler boyunca yönlendirir; ekran paylaşılır, katılımcı sesli düşünür.
  • Uzaktan moderasyonsuz: Katılımcılar görevleri bir test platformu üzerinden tek başına tamamlar; siz de kayıtları ve metrikleri sonradan incelersiniz.
  • Laboratuvar testi: Katılımcılar kontrollü bir ortama gelir; onları doğrudan, çoğu zaman göz izleme, prototipler ya da fiziksel cihazlar eşliğinde gözlemlersiniz.
  • Bağlamsal sorgulama: İnsanların ürünü kullanışını (ya da ürününüzün üstleneceği işi yapışını) kendi gerçek ortamlarında gözlemlersiniz: ofislerinde, depolarında, mutfaklarında, arabalarında.
  • Gerilla testi: Kafelerde, ortak çalışma alanlarında ya da koridorlarda insanlara yaklaşır ve orada, o anda beş dakikalık oturumlar yaparsınız.

Uzaktan moderasyonlu kullanılabilirlik testi ne zaman kullanılmalı?

Akışları, prototipleri ve yeni özellikleri değerlendirirken, özellikle de o anda "neden?" diye sormanız gerektiğinde uzaktan moderasyonlu testi varsayılan yönteminiz yapın.

Moderatör, katılımcının tereddüdünün nedenini sorgulayabilir, takip soruları sorabilir ve prototip bozulduğunda oturumu kurtarabilir.

Güçlü yönleri: oturum başına derin içgörü, oturum sırasında esneklik, geniş bir katılımcı havuzuna erişim, kaba prototiplerle de uygulanabilmesi.

Zayıf yönleri: planlama yükü, moderatör becerisinin belirleyici olması (yönlendirici sorular veriyi zehirler), katılımcıların doğal bağlamlarının dışında olması, teknik sorunların oturum süresini yemesi.

Maliyet/hız profili: orta maliyet, orta hız. Beş oturumluk bir tur, sentez dahil bir hafta içinde tamamlanabilir.

Şu durumlarda seçin: yeniden tasarlanmış bir ödeme akışını, yeni bir onboarding akışını ya da alışılmadık bir etkileşim kalıbını test ediyorsanız ve yalnızca başarı oranlarını değil, kullanıcıların akıl yürütmesini de anlamanız gerekiyorsa.

Uzaktan moderasyonsuz test ne zaman doğru tercihtir?

Görevleriniz iyi tanımlanmışsa, prototipiniz stabilse ve derinlikten çok hacme ya da hıza ihtiyacınız varsa moderasyonsuz testi kullanın.

Katılımcılar tek başına çalıştığı için kafa karıştıran bir görevi açıklayacak kimse yoktur; bu da test planınızın kusursuz olması gerektiği anlamına gelir. Önce bir pilot çalışma yapın.

Güçlü yönleri: hızlıdır (sonuçlar haftalar değil saatler içinde gelir), onlarca katılımcıya ölçeklenebilir, randevu planlaması gerektirmez, katılımcıyı izleyen bir moderatör olmadığı için doğal bir tempo sunar; görev başarısı ve görev süresi (time-on-task) gibi metrikleri sürümler arasında kıyaslamak (benchmarking) için elverişlidir.

Zayıf yönleri: takip sorusu sorulamaz, katılımcılar görevi en az çabayla geçiştirebilir ya da yanlış okuyabilir, görev metinlerinde "çöp girerse çöp çıkar" kuralı geçerlidir, panel katılımcıları "profesyonel test kullanıcısı" olabilir.

Maliyet/hız profili: düşük-orta maliyet; dört yöntem arasında en hızlı sonuç veren yöntem.

Şu durumlarda seçin: iki navigasyon etiketini karşılaştırırken, canlıdaki bir ürün için üç ayda bir kıyaslama (benchmark) yaparken ya da nitel olarak zaten anladığınız bir akışı doğrularken.

Laboratuvar kullanılabilirlik testi maliyetini ne zaman hak eder?

Kontrole, özel ekipmana ya da uzaktan kurulumların sağlayamayacağı türden bir gözleme ihtiyacınız olduğunda katılımcıları laboratuvara getirin.

Laboratuvar testi, katılımcı başına en pahalı yöntemdir (tesis, katılımcı bulma, teşvikler, ulaşım, personel); bu nedenle daha ucuz yöntemlerin yanıtlayamadığı soruları yanıtlamalıdır.

Güçlü yönleri: ortam üzerinde tam kontrol, göz izleme ve biyometri, fiziksel ürünleri ve çoklu cihaz kurulumlarını test edebilme, paydaşların camın arkasından canlı gözlem yapabilmesi (şüpheci bir yöneticiyi ikna etmekte, gerçek bir kullanıcının zorlandığını izlemek kadar etkili bir şey yoktur), hassas verilerin odadan çıkmaması.

Zayıf yönleri: pahalıdır, organize etmesi zaman alır, katılımcı bulma coğrafi olarak sınırlıdır ve ortam yapaydır. İnsanlar laboratuvarda, işe gidip gelirken bindikleri kalabalık bir trende olduğundan farklı davranır.

Maliyet/hız profili: yüksek maliyet, yavaş. Her tur için iki ila dört hafta ayırın.

Şu durumlarda seçin: donanım ya da kiosk arayüzlerini test ederken, göz izleme çalışmaları yürütürken, sıkı gizlilik koşulları altında çalışırken ya da yüz yüze destek gerektiren kullanıcı gruplarıyla test yaparken.

Bağlamsal sorgulama ile kullanılabilirlik testi arasındaki fark nedir?

Kullanılabilirlik testi, insanların tasarımınızı kullanıp kullanamadığını değerlendirir; bağlamsal sorgulama ise işin gerçek dünyada nasıl yürüdüğünü araştırır. Biri değerlendirici (evaluative), diğeri keşfedici (generative) bir yöntemdir.

Bağlamsal sorgulamada katılımcının yanına gidersiniz (bir hemşire istasyonu, bir lojistik deposu, bir borsacının masası) ve onları gerçek araçlarıyla gerçek işlerini yaparken, araya giren kesintiler dahil gözlemlersiniz. Görevleri test etmezsiniz; görevlerin ne olduğunu öğrenirsiniz. Klasik duruş usta–çırak ilişkisidir: Onlar çalışır, siz izler ve sorarsınız.

Güçlü yönleri: kullanıcıların laboratuvarda asla dile getirmeyeceği geçici çözümleri, çevresel kısıtları ve ihtiyaçları ortaya çıkarır; ne inşa edileceğini tanımlamak için tek başına en değerli girdidir.

Zayıf yönleri: zaman alıcıdır, örneklemler küçüktür, gerçek çalışma ortamlarına erişim gerektirir ve gözlemin kendisi davranışı fark edilmeden değiştirebilir.

Maliyet/hız profili: oturum başına yüksek efor, ama her oturum keşiflerle doludur.

Tasarlamadan önce, yeni bir ürünün kapsamını belirlerken ya da yabancı olduğunuz bir alana girerken bağlamsal sorgulamayı seçin. Tasarladıktan sonra, değerlendirilecek somut bir şeyiniz olduğunda kullanılabilirlik testini seçin. Olgun ekipler ikisini de yapar: problemi çerçevelemek için sorgulama, çözümü doğrulamak için test.

Gerilla testi neye yarar, neye yaramaz?

Gerilla testi, erken konseptler için ucuz ve hızlı bir duman testidir (smoke test); yapılandırılmış araştırmanın yerini tutmaz.

Bir telefon ya da dizüstü bilgisayar alıp bir kafeye gider, yabancılara kibarca yaklaşır ve bir kahve parasına beş ila on dakikalık oturumlar yaparsınız. Tek bir öğleden sonrada göze batan sorunları yakalayabilirsiniz: bulunamayan bir buton, anlaşılmaz bir etiket, kimsenin anlamadığı bir değer önerisi.

Güçlü yönleri: neredeyse sıfır maliyet, aynı gün sonuç, tasarımcıları ofisten dışarı çıkmaya zorlar, açıkça kötü fikirleri erkenden elemek için idealdir.

Zayıf yönleri: katılımcılar o sırada etrafta kim varsa odur ve neredeyse hiçbir zaman gerçek hedef kullanıcılarınız değildir; oturumlar yüzeyseldir; bağlam yoktur; bulgular temsil edici kabul edilirse yanıltıcı olabilir. Bir radyoloji aracını kafe müşterileriyle test etmek, size ancak kafe müşterileri hakkında bir şey söyler.

Maliyet/hız profili: en düşük maliyet, başlatması en hızlı yöntem.

Şu durumlarda seçin: eskiz ya da erken prototip aşamasındaysanız, ürününüz geniş bir tüketici kitlesine hitap ediyorsa ve düzgün bir katılımcı bulma sürecine yatırım yapmadan önce yön gösterici bir sinyale ihtiyacınız varsa. Bir ürünün gördüğü tek araştırmanın bu olmasına asla izin vermeyin.

Bir kullanılabilirlik testi için kaç kullanıcı gerekir?

Her tur ve her farklı kitle segmenti için yaklaşık beş kullanıcı. Ardından bulduklarınızı düzeltin ve yeniden test edin.

Bu, Jakob Nielsen ve Tom Landauer'ın araştırmasından çıkan ve iyi bilinen bir temel kuraldır: Yaklaşık beş katılımcı, belirli bir tasarımdaki kullanılabilirlik sorunlarının büyük çoğunluğunu ortaya çıkarır ve eklenen her kullanıcının getirisi giderek azalır. Sıkça alıntılanan rakama göre beş kullanıcı, o test kurgusuyla tespit edilebilecek sorunların yaklaşık %85'ini bulur.

Çoğu yazının atladığı nüanslar:

  • Toplamda beş değil, segment başına beş. Doktorlar ve hastalar ürünü farklı kullanıyorsa, bu beşer kişilik iki tur demektir.
  • Yineleyin. Bu kuralın gücü tekrarda yatar: Beş kişiyle test edin, düzeltin, yeniden beş kişiyle test edin. Beşer kişilik üç tur, on beş kişilik tek bir turdan daha iyidir.
  • Nicel çalışmalar daha fazlasını gerektirir. Görev başarı oranlarını ölçüyor ya da tasarımları istatistiksel olarak karşılaştırıyorsanız, anlamlı güven aralıkları için 20–40+ katılımcıya ihtiyacınız vardır. Beş kullanıcı kuralı yalnızca nitel sorun tespiti için geçerlidir.
  • Karmaşık ya da yüksek riskli ürünler (tıbbi, finansal, güvenlik açısından kritik) daha büyük ve daha özenle oluşturulmuş örneklemler gerektirir.

Moderasyonlu mu, moderasyonsuz mu: Nasıl karar verilir?

Anlamanız gerekiyorsa moderasyonlu; ölçmeniz gerekiyorsa moderasyonsuz. En önemli sorunuz "neden?" ya da "kullanıcılar … hakkında nasıl düşünüyor?" türündeyse moderasyonlu test yapın. "Kaç kişi?", "ne kadar hızlı?" ya da "hangi versiyon?" türündeyse moderasyonsuz test yapın. Bütçeniz elveriyorsa ikisini birleştirin: sorunları bulmak ve açıklamak için moderasyonlu bir tur, düzeltmeleri büyük ölçekte doğrulamak için moderasyonsuz bir tur.

Yapay zeka kullanılabilirlik testini nasıl değiştiriyor?

Yapay zeka gözlemi değil, analizi kısaltır. Things'te yapay zeka destekli iş akışları, araştırmanın mekanik katmanlarını üstlenir:

  • Transkripsiyon: her oturumun dakikalar içinde ve birden fazla dilde yazıya dökülmesi. Katılımcıyı izlemek ile not almak arasında seçim yapmak zorunda kalmazsınız.
  • Sentez desteği: oturumlar arasındaki gözlemleri kümelemek, tekrarlayan sürtünme noktalarını işaretlemek, araştırmacıların daha sonra doğruladığı affinity map taslakları hazırlamak.
  • Öne çıkan kesitler (highlight reel): katılımcıların zorlandığı anları otomatik olarak bulmak; böylece paydaşlar beş saatlik kayıt yerine üç dakikalık kanıt izler.

Yapay zekanın yapmadığı şey, gerçek kullanıcıları izlemenin yerini almaktır. Bir model bir transkripti özetleyebilir; ama tıklamadan önceki duraksamayı, iç çekişi, katılımcının bahsetmeye bile değer bulmadığı geçici çözümü fark edemez. Simüle edilmiş "yapay zeka kullanıcıları" bir protokolün pilotunu yapmak için faydalıdır, bir ürünü doğrulamak için değil. Gözlem insanda kalır. Evrak işi hızlanır.

Hangi kullanılabilirlik testi yöntemini seçmelisiniz? Bir karar tablosu

DurumEn iyi yöntemNeden
Erken konsept, geniş tüketici kitlesiGerillaHızlı, ucuz, yön gösterici sinyal
Tasarlamadan önce bir alanı anlamakBağlamsal sorgulamaGerçek iş akışlarını ve kısıtları ortaya çıkarır
Yeni bir akışı ya da prototipi değerlendirmekUzaktan moderasyonluDerinlik, esneklik, takip soruları
Kıyaslama (benchmarking) ya da varyant karşılaştırmaUzaktan moderasyonsuzÖlçek, hız, tutarlı metrikler
Donanım, göz izleme, gizli çalışmalarLaboratuvarKontrol ve ekipman
Lansman sonrası sürekli ölçümUzaktan moderasyonsuzTekrarlanabilir, düşük operasyonel yük
Paydaşlar sorunun varlığına inanmıyorLaboratuvar ya da uzaktan moderasyonluCanlı gözlem ikna eder

En yaygın kullanılabilirlik testi hataları nelerdir?

  1. Çok geç test etmek. Lansmandan sonra yapılan kullanılabilirlik testi tasarım değil, hasar kontrolüdür.
  2. Tanığı yönlendirmek. "Bunu kolay buluyor musunuz?" sorusu nazik yalanlar üretir. İnsanlardan bir şey yapmalarını isteyin, sonra izleyin.
  3. Gerilla bulgularını temsil edici kabul etmek. Bunlar yön gösterici sinyallerdir, fazlası değil.
  4. Birçok küçük çalışma yerine tek büyük çalışma yapmak. Tek turda on beş kullanıcı, beş kullanıcının bulacağı sorunların aynısını bulur; üstelik yapılan düzeltmeler test edilmeden kalır.
  5. Hedefler yerine görevleri test etmek. "Dışa aktar butonuna tıklayın" okuduğunu anlamayı test eder. "Bu raporu yöneticinize ulaştırın" ise ürünü test eder.
  6. Sentezi atlamak. Kimsenin analiz etmediği oturumlar tiyatrodan ibarettir. Bulgular kararlara dönüşmelidir.

Things bir proje için test yöntemlerini nasıl seçiyor?

Biz bir ajans değil, bir stüdyoyuz; yani standart bir paket satıp sorununuzu o pakete uydurmuyoruz. Things'te yöntem seçimi araştırma sorusundan, ürünün olgunluk düzeyinden ve risk profilinden yola çıkar. Bir fintech onboarding akışı, ardından moderasyonsuz kıyaslama testleriyle desteklenen uzaktan moderasyonlu turlardan geçer. Bir depo lojistiği aracı bağlamsal sorgulamayla başlar, çünkü arayüzün gerçek rakibi klipsli bir kâğıt panosudur. Erken aşamadaki bir tüketici konsepti ise tasarıma tek bir saat bile ayırmadan önce bir öğleden sonralık gerilla testinden geçebilir.

Kullanılabilirlik testi nadiren tek başına yürür: Onu kullanıcı görüşmeleri, sezgisel değerlendirme ve veri analiziyle birleştirir, ardından her şeyi ekibin uygulayabileceği kararlara dönüştürürüz. Önce araştırma, sonra görüş: İşimizin, İstanbul ve Elazığ'dan dünyanın dört bir yanındaki markalar için geliştirdiğimiz 50'yi aşkın üründe ve bir Red Dot ödülünde sağlam durmasının nedeni bu.

Sıkça Sorulan Sorular

Uzaktan kullanılabilirlik testi, laboratuvar testi kadar iyi mi? Yazılımla ilgili çoğu soru için evet. Uzaktan moderasyonlu test, daha düşük maliyetle ve daha geniş bir katılımcı havuzuyla karşılaştırılabilir düzeyde içgörü sağlar. Kontrollü koşullara, fiziksel cihazlara, göz izlemeye ya da sıkı gizliliğe ihtiyaç duyduğunuzda ise laboratuvar testi öne çıkar.

Kullanılabilirlik testi ne kadara mal olur? Gerilla turlarının, harcanan zaman dışında neredeyse hiçbir maliyeti yoktur. Uzaktan moderasyonsuz çalışmalar platform ve katılımcı teşviki ücretleri gerektirir. Moderasyonlu ve laboratuvar çalışmalarına katılımcı bulma, moderasyon ve analiz maliyetleri eklenir. Asıl karşılaştırılması gereken, yanlış şeyi inşa etmenin maliyetidir.

Bitmiş bir ürün olmadan kullanılabilirlik testi yapabilir miyim? Evet. Tıklanabilir prototipler, kâğıt eskizler, hatta rakip ürünler bile işe yarar. Ne kadar erken test ederseniz, düzeltmeler o kadar ucuza gelir.

Beş kullanıcı gerçekten yeterli mi? Tek bir kitle segmenti için tek bir tasarımdaki nitel sorunları bulmak açısından, yinelemeli her turda beş kişi sağlam dayanakları olan bir temel kuraldır (Nielsen/Landauer). İstatistiksel ölçüm için 20+ katılımcı planlayın.

Yapay zeka, kullanılabilirlik testi katılımcılarının yerini alabilir mi? Hayır. Yapay zeka transkripsiyonu, sentezi ve öne çıkan kesitlerin hazırlanmasını hızlandırır, bir protokolün pilotunu yapmaya da yardımcı olabilir; ancak doğrulanmış içgörü, gerçek kullanıcıları gözlemlemekten gelir.

Bizimle test edin

Yöntemler arasında seçim yapmaya, hatta test yapıp yapmamaya karar vermeye çalışıyorsanız bizimle konuşun. Things, 2018'de kurulan ve Türkiye'de ve dünya genelinde önde gelen markalar için ürünler geliştiren bir dijital tasarım ve mühendislik stüdyosudur. Design. Code. Mastery.

hello@things.ist adresine yazın ve ne geliştirdiğinizi anlatın. İlk olarak neyi test etmeniz gerektiğini size söyleyelim.