Ugrás a tartalomra
Menü

Hogyan mérünk

Ha azt állítjuk, hogy a robot forrás nélkül nem válaszol, azt meg is kell tudnunk mutatni. Ez az oldal arról szól, hogy pontosan mit mérünk, min, hogyan — és hol vannak a mérés határai.

Miért mérünk egyáltalán

Egy ügyfélszolgálati asszisztensről bármit le lehet írni, és a legtöbb állítás ellenőrizhetetlen. Nálunk a fő ígéret („forrás nélkül nem válaszol") olyan, amit KI LEHET mérni: fel kell tenni olyan kérdéseket, amikre a tudásbázisban nincs fedezet, és meg kell nézni, mit csinál. Ezt csináljuk, minden érdemi változtatás után, kétszer.

A próbakészlet

Egy domain- és tárhelyszolgáltatást bemutató, valós tartalmú mintaoldal tudásbázisa, és hozzá 52 kézzel megírt kérdés. Nem a robot írta őket, és nem is a tudásbázisból generáltuk: úgy vannak megfogalmazva, ahogy egy látogató kérdezne.

40

40 megválaszolható kérdés

Olyan, amire a weboldal tartalmában VAN fedezet. Mindegyikhez fel van jegyezve, melyik oldalról kellene származnia a válasznak.

12

12 megválaszolhatatlan kérdés

Olyan, amire NINCS és nem is lehet fedezet: fiókspecifikus adat („mikor jár le az ÉN domainem"), vagy olyasmi, amihez rendszerhozzáférés kellene. Ez a készlet fontosabb fele.

Példa mindkét fajtára
Megválaszolható: „Mennyibe kerülnek nálatok a domainek nettó áron?" — az árlista oldalon ott a válasz.
Megválaszolhatatlan: „Mikor jár le pontosan az én domainem?" — ehhez a látogató fiókjába kellene látni. Erre a helyes válasz az, hogy nem tudja, és embert hív.

Mit mérünk

Helyes visszautasítás

A 12 megválaszolhatatlan kérdésből hányra mondja ki, hogy nem tudja. Ez a legfontosabb szám: itt hibázni azt jelenti, hogy magabiztosan mond valótlant egy leendő ügyfélnek. A cél 100%, és 100% alatt a mérés HIBÁNAK számít, nem „jó eredménynek".

Élő forráshivatkozás

A válaszokban megjelölt források közül hány mutat tényleg létező, elérhető oldalra. Egy kitalált hivatkozás ugyanolyan hallucináció, mint egy kitalált ár — csak nehezebb észrevenni. 100% alatt ez is hiba.

Találati arány

A 40 megválaszolható kérdésből hányra válaszol egyáltalán. Külön nézzük azt is, hogy a VÁRT oldalt jelölte-e meg forrásként — ez szigorúbb mérőszám, mint amennyire igazságos: több oldal is adhat helyes választ.

Válaszidő és költség

Kérdésenkénti medián és 90. percentilis, keresésre és nyelvi modellre bontva, valamint a kérdésenkénti tényleges költség. A válaszidő nagyrészt a nyelvi modell szolgáltatóján múlik, nem a mi kódunkon — ezért adunk meg tartományt, nem egyetlen számot.

Hogyan fut a mérés

  • Az ÉLES rendszeren, végponttól végpontig: ugyanaz a keresés, ugyanaz a modellhívás, ugyanaz a válaszséma, amit egy látogató kap. Nem laboratóriumi másolat.
  • Ötös párhuzamossággal, hogy a mérés ne álljon órákig — és hogy a terhelés is hasonlítson az éles használatra.
  • MINDIG KÉTSZER, egymás után. Egy futás önmagában félrevezet: a nyelvi modell nem determinisztikus, és a szolgáltató késleltetése is ingadozik.
  • Minden érdemi kódváltoztatás előtt és után. A projekt szabálya: kódváltozást CSAK közvetlenül egymás után futtatott mérésekkel szabad összehasonlítani — két különböző napon mért érték a szolgáltató terheltségét mutatja, nem a mi munkánkat.

A legutóbbi eredmény

Ehhez a belső benchmark-projekthez most nincs lezárt (kesz állapotú) mérési futás — ezért itt szándékosan nem mutatunk se táblázatot, se százalékot. Amint lefut egy mérés, ez a szakasz a valós számmal frissül.

Amit ezek a számok NEM jelentenek

  • NEM ígéret a te oldaladra. Ezek egy konkrét weboldal tudásbázisán születtek. A te eredményedet a te tartalmad minősége dönti el: egy ellentmondásos, elavult weboldalból nem lesz jó robot — legfeljebb egy robot, ami tisztességesen megmondja, hogy nem tudja.
  • NEM ügyfélhivatkozás. Ezt mi mértük, a saját eszközünkkel. Nem független audit, és nem is annak adjuk ki.
  • NEM garancia arra, hogy a robot sosem téved. A nyelvi modell hibázhat, és a tudásbázisod is tartalmazhat hibát. Ezért van minden válasz mögött forrásmegjelölés és minden beszélgetés mögött napló: nem azt ígérjük, hogy nincs hiba, hanem azt, hogy KIDERÜL.
  • A válaszidő NEM szolgáltatási szintű vállalás. A nyelvi modell szolgáltatójának terheltségétől függ; mértünk már ugyanazon a készleten 2,2 és 4,2 másodperc közötti mediánt is, változatlan kód mellett.

Mérd meg a sajátodat

Ugyanez a mérés a te tudásbázisodon is lefuttatható, és a panelen a Minőségmérés lapon látod az eredményét. A visszautasítási arány és a hiányzó tudás listája együtt megmutatja, hol tart a tartalmad — sokszor ez a legértékesebb dolog, amit a robot bevezetése ad.

Kipróbálom díjmentesen

GYIK · Hogyan működik

A működéshez szükséges sütiket mindig használjuk, ezek nélkül az oldal nem működne: robi_fox_session, XSRF-TOKEN, felulet_nyelv, ss_suti_valasztas Ezen kívül szeretnénk mérni, hogyan használják az oldalt (Google Analytics) — ehhez a te engedélyed kell. Hirdetési sütit nem használunk, és a próba-oldalakon egyáltalán nem mérünk. Részletes süti-tájékoztató