Definicja i granice
Stabilność opisuje, jak często system powtarza podobny obraz marki, cytowanie lub rekomendację przy kontrolowanych warunkach. Im większa zmienność, tym ostrożniej należy interpretować pojedynczy test. Granicą tego pojęcia jest jego funkcja w całym pipeline AI Search. Nie należy rozszerzać go na obszary, które mają inną rolę techniczną lub decyzyjną.
| # | Wymiar | Zasada |
|---|---|---|
| 1 | Wykonuj serie powtórzeń. | mierz osobno |
| 2 | Rozdziel stabilność faktów od stabilności rekomendacji. | mierz osobno |
| 3 | Porównuj modele osobno. | mierz osobno |
Warunki badania
Każdy test zapisuje model, datę, język, lokalizację, stan konta, prompt, liczbę powtórzeń i źródła. Dopiero wtedy wynik można porównywać w czasie lub między systemami.
Interpretacja
Wysoki wynik jednego wymiaru nie kompensuje automatycznie błędu w innym. Marka może mieć świetną crawlability, ale słabe dowody; może też mieć silną reputację, ale niską stabilność rekomendacji.
Jak wykorzystać to pojęcie w praktyce?
W kontekście „Stabilność — pojedyncza odpowiedź nie jest wynikiem badania” najważniejsze jest, aby mierzyć rozrzut wyników w powtórzeniach zamiast przedstawiać pojedynczą odpowiedź jako stały stan. Wiarygodny pomiar zaczyna się przed zebraniem odpowiedzi. Należy zapisać próbę promptów, platformę, model lub produkt, język, rynek, stan sesji, datę, liczbę powtórzeń i regułę kodowania. Dopiero wtedy wyniki z kolejnych okresów są porównywalne.
Przykład i sposób weryfikacji
Jedna odpowiedź z widoczną marką jest obserwacją, nie trendem. Seria powtórzeń może pokazać, że marka występuje w 7 z 20 odpowiedzi, bywa rekomendacją w 3 i źródłem w 2. Te role powinny pozostać osobnymi miarami.
Granice interpretacji
Nie należy łączyć platform w jedną średnią bez pokazania składowych ani rozszerzać wyniku panelu promptów na wszystkich użytkowników. Zmiana produktu, trybu lub zestawu pytań tworzy nową serię albo wymaga jawnej adnotacji.
Wniosek dotyczący „Stabilność — pojedyncza odpowiedź nie jest wynikiem badania” powinien wskazywać, co rzeczywiście zaobserwowano, czego nie da się potwierdzić oraz jaki następny test może rozstrzygnąć wątpliwość. Taka forma chroni czytelnika przed pozorną pewnością i pozwala wykorzystać dokument jako część powtarzalnej metodologii AI Search.
Co sprawdzić dalej?
Ten dokument jest częścią spójnego modelu AI Search. Kolejny krok zależy od tego, czy problem dotyczy query processing, retrieval, encji, źródeł, architektury czy pomiaru.