Hogyan mérünk
Ha azt állítjuk, hogy a robot forrás nélkül nem válaszol, azt meg is kell tudnunk mutatni. Ez az oldal arról szól, hogy pontosan mit mérünk, min, hogyan — és hol vannak a mérés határai.
Miért mérünk egyáltalán
Egy ügyfélszolgálati asszisztensről bármit le lehet írni, és a legtöbb állítás ellenőrizhetetlen. Nálunk a fő ígéret („forrás nélkül nem válaszol") olyan, amit KI LEHET mérni: fel kell tenni olyan kérdéseket, amikre a tudásbázisban nincs fedezet, és meg kell nézni, mit csinál. Ezt csináljuk, minden érdemi változtatás után, kétszer.
A próbakészlet
Egy domain- és tárhelyszolgáltatást bemutató, valós tartalmú mintaoldal tudásbázisa, és hozzá 52 kézzel megírt kérdés. Nem a robot írta őket, és nem is a tudásbázisból generáltuk: úgy vannak megfogalmazva, ahogy egy látogató kérdezne.
40 megválaszolható kérdés
Olyan, amire a weboldal tartalmában VAN fedezet. Mindegyikhez fel van jegyezve, melyik oldalról kellene származnia a válasznak.
12 megválaszolhatatlan kérdés
Olyan, amire NINCS és nem is lehet fedezet: fiókspecifikus adat („mikor jár le az ÉN domainem"), vagy olyasmi, amihez rendszerhozzáférés kellene. Ez a készlet fontosabb fele.
Megválaszolható: „Mennyibe kerülnek nálatok a domainek nettó áron?" — az árlista oldalon ott a válasz.
Megválaszolhatatlan: „Mikor jár le pontosan az én domainem?" — ehhez a látogató fiókjába kellene látni. Erre a helyes válasz az, hogy nem tudja, és embert hív.
Mit mérünk
Helyes visszautasítás
A 12 megválaszolhatatlan kérdésből hányra mondja ki, hogy nem tudja. Ez a legfontosabb szám: itt hibázni azt jelenti, hogy magabiztosan mond valótlant egy leendő ügyfélnek. A cél 100%, és 100% alatt a mérés HIBÁNAK számít, nem „jó eredménynek".
Élő forráshivatkozás
A válaszokban megjelölt források közül hány mutat tényleg létező, elérhető oldalra. Egy kitalált hivatkozás ugyanolyan hallucináció, mint egy kitalált ár — csak nehezebb észrevenni. 100% alatt ez is hiba.
Találati arány
A 40 megválaszolható kérdésből hányra válaszol egyáltalán. Külön nézzük azt is, hogy a VÁRT oldalt jelölte-e meg forrásként — ez szigorúbb mérőszám, mint amennyire igazságos: több oldal is adhat helyes választ.
Válaszidő és költség
Kérdésenkénti medián és 90. percentilis, keresésre és nyelvi modellre bontva, valamint a kérdésenkénti tényleges költség. A válaszidő nagyrészt a nyelvi modell szolgáltatóján múlik, nem a mi kódunkon — ezért adunk meg tartományt, nem egyetlen számot.
Hogyan fut a mérés
- Az ÉLES rendszeren, végponttól végpontig: ugyanaz a keresés, ugyanaz a modellhívás, ugyanaz a válaszséma, amit egy látogató kap. Nem laboratóriumi másolat.
- Ötös párhuzamossággal, hogy a mérés ne álljon órákig — és hogy a terhelés is hasonlítson az éles használatra.
- MINDIG KÉTSZER, egymás után. Egy futás önmagában félrevezet: a nyelvi modell nem determinisztikus, és a szolgáltató késleltetése is ingadozik.
- Minden érdemi kódváltoztatás előtt és után. A projekt szabálya: kódváltozást CSAK közvetlenül egymás után futtatott mérésekkel szabad összehasonlítani — két különböző napon mért érték a szolgáltató terheltségét mutatja, nem a mi munkánkat.
A legutóbbi eredmény
Amit ezek a számok NEM jelentenek
- NEM ígéret a te oldaladra. Ezek egy konkrét weboldal tudásbázisán születtek. A te eredményedet a te tartalmad minősége dönti el: egy ellentmondásos, elavult weboldalból nem lesz jó robot — legfeljebb egy robot, ami tisztességesen megmondja, hogy nem tudja.
- NEM ügyfélhivatkozás. Ezt mi mértük, a saját eszközünkkel. Nem független audit, és nem is annak adjuk ki.
- NEM garancia arra, hogy a robot sosem téved. A nyelvi modell hibázhat, és a tudásbázisod is tartalmazhat hibát. Ezért van minden válasz mögött forrásmegjelölés és minden beszélgetés mögött napló: nem azt ígérjük, hogy nincs hiba, hanem azt, hogy KIDERÜL.
- A válaszidő NEM szolgáltatási szintű vállalás. A nyelvi modell szolgáltatójának terheltségétől függ; mértünk már ugyanazon a készleten 2,2 és 4,2 másodperc közötti mediánt is, változatlan kód mellett.
Mérd meg a sajátodat
Ugyanez a mérés a te tudásbázisodon is lefuttatható, és a panelen a Minőségmérés lapon látod az eredményét. A visszautasítási arány és a hiányzó tudás listája együtt megmutatja, hol tart a tartalmad — sokszor ez a legértékesebb dolog, amit a robot bevezetése ad.
Kipróbálom díjmentesen