Laboratorium probabilistyczne / symulacja

Kalibracja, ranking i koncentracja.

Trzy własności prognozy. Żadna nie zastępuje pozostałych. Zmieniaj pewność modelu i ilość dostępnej informacji, a potem sprawdź, co naprawdę daje się naprawić.

4 000 obserwacji · 2 000 kalibracyjnych / 2 000 testowych · β = 3 · b₀ = 0 · bez zewnętrznych danych

Wybierz punkt wyjścia

C · RLHF
0 · pełny sygnał 6 · silne zakłócenia
0,25 · ostrożność 4 · nadmierna pewność
Zachowany seed utrzymuje te same z, ν i y przy ruchu suwaków.
Kalibracja / ECE Czy deklarowane liczby są uczciwe?
Dyskryminacja / AUC Czy model porządkuje przypadki?
Sharpness / SD(p) Jak rozproszone są prognozy?

Proces generujący dane i granice interpretacji
zᵢ, νᵢ ~ N(0,1); yᵢ ~ Bernoulli(sigmoid(3zᵢ))
ẑᵢ = zᵢ + szum · νᵢ; pᵢ = warpγ(sigmoid(3ẑᵢ))
warpγ(p) = p^γ / (p^γ + (1−p)^γ) = sigmoid(γ · logit(p))

Podział 50/50 jest stały i niezależny od etykiet. Bazowa częstość populacji wynosi 0,5 z symetrii, a klimatolog przypisuje tę znaną stałą symulacji wszystkim obserwacjom. Jego predykcje nie korzystają z etykiet kalibracyjnych ani testowych. „RLHF” jest nazwą scenariusza nadmiernej pewności, nie symulacją algorytmu uczenia RLHF.

To trzy odrębne kryteria, nie statystycznie niezależne wielkości. Gamma zachowuje ranking, ale zmienia kalibrację i sharpness; szum w podanym generatorze psuje zarówno ranking, jak i kalibrację. Gamma = 1 daje kalibrację populacyjną tylko przy szumie = 0.

01

Czy 80% naprawdę oznacza osiem na dziesięć?

Diagram niezawodności · 15 koszyków równej szerokości · wyłącznie test

Prognoza kontra częstość

95% Wilson
częstość i przedział wzorzec y = x
Wskaż punkt lub dotknij wykresu, aby sprawdzić koszyk.
Liczebności n w koszykach 1–15; czerwone oznaczenie: n < 30.
ECE ↓ średni błąd ważony n
MCE ↓ najgorszy koszyk
Częstość y = 1 na zbiorze testowym

Wielkość punktu koduje liczebność. Pionowe kreski pokazują niepewność częstości; szeroki przedział nie jest dowodem dobrej ani złej kalibracji.

Puste koszyki nie mają punktu. W koszyku z jedną obserwacją wynik 0% lub 100% to przede wszystkim słaby pomiar.

ECE = Σₘ (nₘ / n) · |p̄ₘ − ȳₘ|
MCE = maxₘ |p̄ₘ − ȳₘ|, dla nₘ > 0
Wszystkie koszyki: średnie, liczebności i przedziały
Koszyk n Częstość 95% Wilson

Kalibracja pyta o częstość zdarzenia w grupie podobnych prognoz, a nie o trafność pojedynczej odpowiedzi. Punkt ponad przekątną oznacza niedoszacowanie prawdopodobieństwa, punkt pod nią — przeszacowanie.

ECE i MCE zależą od koszyków i skończonej próby. Nawet model poprawny w populacji nie musi mieć ECE = 0 na tych 2 000 obserwacji; przedziały Wilsona są punktowe, nie jednoczesne dla całego wykresu.

02

Dobry ranking nie uwiarygodnia liczb.

Ten sam test, dwie własności. Rusz gammą i obserwuj nieruchome AUC.

GŁÓWNY EKSPERYMENT

ROC / ranking

Niezawodność / liczby

Te same 15 koszyków; liczebności i szczegóły w panelu 01.

Ściśle rosnący warpγ nie zmienia kolejności żadnej pary obserwacji, więc ROC i AUC pozostają takie same. ECE zmienia się, bo liczby trafiają do innych koszyków i obiecują inne częstości.

Dodanie szumu niszczy informację o ukrytym z; kalibrator nie potrafi jej odzyskać. W tym generatorze szum psuje też kalibrację — ruch w drugą stronę nie jest symetryczny.

03

Uczciwa niewiedza nadal jest niewiedzą.

Sharpness i rozkład Murphy’ego · wybierz preset B i porównaj Brier z Uncertainty

Rozkład prognoz / sharpness

20 przedziałów p bazowa częstość z kalibracji
Składnik / 15 koszyków Wartość Rola w wyniku

Trzy składniki sumują się dokładnie do BS₁₅, liczonego po zastąpieniu każdego p średnią jego koszyka. Dla surowego BS dochodzi reszta wewnątrz koszyków; nie wolno jej po cichu zerować.

Wzory i dokładna kontrola tożsamości
BS = (1/n) Σᵢ (pᵢ − yᵢ)²
Reliability = Σₘ (nₘ/n)(p̄ₘ − ȳₘ)²
Resolution = Σₘ (nₘ/n)(ȳₘ − ȳ)²
Uncertainty = ȳ(1 − ȳ)
BS₁₅ = Reliability − Resolution + Uncertainty
Reszta W = (1/n) Σᵢ [(pᵢ−p̄ₘ)² − 2(pᵢ−p̄ₘ)(yᵢ−ȳₘ)]
BS = Reliability − Resolution + Uncertainty + W
SD(p) = √[(1/n) Σᵢ(pᵢ − p̄)²]

Klimatolog podaje każdemu tę samą częstość: ma zerowe Resolution i sharpness, niemal zerowe Reliability, a Brier zbliżony do Uncertainty. Jest uczciwy, lecz nie pomaga wybierać przypadków.

Sharpness opisuje sam rozkład prognoz, bez etykiet; rozpychanie go gammą nie tworzy informacji. Resolution używa etykiet i nagradza rozdzielanie grup o różnych częstościach zdarzenia, dlatego w rozkładzie Briera występuje ze znakiem minus.

04

Napraw liczby. Nie oczekuj nowej informacji.

Temperature scaling, Platt i izotoniczna · dopasowanie lokalne przez NLL / MLE / PAV

100 · duża wariancja 2 000 · pełna próba
Celowy wyciek: dopasowanie do pierwszych n etykiet testowych.

Metoda ECE przed → po ↓ AUC przed → po Brier przed → po ↓ Parametry

Definicje metod i obsługa remisów
Temperature scaling: pT = sigmoid(logit(p)/T), T > 0
Platt: p′ = sigmoid(a·logit(p)+b), a > 0
NLL = (1/n) Σᵢ [softplus(ℓᵢ) − yᵢℓᵢ]
Izotoniczna: po sortowaniu po p łącz sąsiednie bloki, gdy ich częstości maleją.

Temperatura i Platt minimalizują NLL na wybranej próbie; Platt ma ograniczenie a > 0, aby zachować orientację rankingu. PAV agreguje identyczne wyniki przed dopasowaniem; poza próbką używa stałych poziomów i granic w połowie między blokami.

AUC przyznaje remisowi ½ punktu. Dla dużych logitów ranking surowego modelu, temperatury i Platta jest liczony na logitach, co zapobiega sztucznym remisom po numerycznym zaokrągleniu p do 1; izotoniczna zachowuje swoje rzeczywiste remisy.

Podstawienie T = gamma algebraicznie cofa warpγ. Temperatura dopasowana z próby jest estymatą: nie musi równać się gammie, zwłaszcza gdy szum wprowadza dodatkowe rozkalibrowanie.

Izotoniczna może przeuczyć 100 obserwacji i zmieniać AUC przez remisy; różnica na teście może mieć oba znaki. Większa próba stabilizuje dopasowanie, lecz nie gwarantuje zwycięstwa nad Plattem po 1 000 punktów — przy szumie 0 Platt ma tu dokładnie poprawną postać modelu.

05

Zbiór z pokryciem zamiast kolejnej liczby.

Split conformal na surowym modelu · ten sam seed i rozmiar kalibracji · bez wycieku

0,001 · cel 99,9% 0,200 · cel 80%
sᵢ = 1 − p̂ᵢ(yᵢ)
k = ceil((nkal + 1)(1 − alpha)); q̂ = s₍k₎
C(x) = {y ∈ {0,1}: 1 − p̂(y) ≤ q̂}

Pokrycie w tercylach trudności

Trudne = małe |z|, łatwe = duże |z|. Znamy z wyłącznie dlatego, że to symulacja.
Pokrycie testowe
Średni rozmiar zbioru od 0 do 2 etykiet
Abstencja {0,1} obie odpowiedzi są dopuszczone
Zbiory puste ∅ żadna odpowiedź nie przechodzi
Trudność wg |z| n testowe Pokrycie 95% Wilson

Gwarancja jest brzegowa, nie warunkowa. Dotyczy losowej przyszłej obserwacji oraz losowej próby kalibracyjnej przy wymienności danych. Nie obiecuje tego samego pokrycia każdej grupie, ani dokładnego wyniku na jednej skończonej próbie.

Conformal nie kalibruje prawdopodobieństwa. Nawet źle skalibrowany model może dać poprawne pokrycie; ceną słabego sygnału bywają częste zbiory {0,1}. W tym binarnym modelu zmiana gamma zachowuje nawet całe zbiory wynikowe, jeśli za każdym razem przeliczymy kwantyl.

Przy alpha < 1/(nkal + 1) żądany rząd statystyki wychodzi poza próbę. Zamiast pozornej precyzji pojawia się ostrzeżenie; formalna konwencja q̂ = ∞ zwróciłaby wszystkim {0,1}. Conformal zawsze korzysta z odłożonych danych, niezależnie od przełącznika wycieku w panelu 04.

06

Próg w kodzie nie pilnuje prawdy.

Warstwa biznesowa · y = 1 oznacza poprawną automatyzację · surowe p

Automatyzuj, gdy p > t*
t* = L / (G + L). Sukces: +G; pomyłka: −L; brak automatyzacji: 0.
Oczekiwane pomyłki wg modelu Σ(1 − p) dla p > t*, po przeskalowaniu
Faktyczne pomyłki
Wynik finansowy [zł]

To nie jest awaria, którą widać w logach.

Reguła p > t* maksymalizuje oczekiwany zysk tylko wtedy, gdy p jest wiarygodną szansą sukcesu przy tych kosztach. Gamma > 1 przepuszcza więcej spraw i może zamienić obiecany mały budżet błędu w realną stratę bez zmiany AUC.

Wybierz A, a potem C: zdarzenia są te same, zmieniają się tylko deklarowane p. Liczby są liniowo przeskalowane z 2 000 obserwacji testowych do podanego wolumenu, więc faktyczne błędy mogą być ułamkowe; przy rzadkich błędach wynik jednej próby jest niestabilny nawet dla poprawnego modelu.

07

„Confidence” nie musi być prawdopodobieństwem.

Przykładowa statystyka koncentracji · znaczenie wartości zależy od definicji API

c = (N·pmax − 1)/(N − 1)
pmax = [c·(N − 1) + 1]/N

Liczba opcji N Próg confidence Równoważny próg pmax

AUC transformacji porównujemy przy ustalonym N i tej samej etykiecie. Mieszanie różnych N może zmienić ranking.

Przy confidence = 0,85 równoważne pmax wynosi 0,925 dla N = 2, 0,900 dla N = 3, 0,880 dla N = 5 i 0,865 dla N = 10. Ściśle rosnąca transformacja zachowuje AUC, lecz nie zachowuje znaczenia progu prawdopodobieństwa.

Podstawienie c w miejsce p w panelu 06 zmienia regułę ekonomiczną i rachunek Σ(1 − p). Samo odwrócenie wzoru odzyskuje pmax modelu, ale nie gwarantuje, że to prawdopodobieństwo jest skalibrowane.

08

Sprawdź rachunek, nie deklarację.

Żywe autotesty · progi zgodne ze specyfikacją · stałe scenariusze, bieżący seed

Obliczanie

Testy 1–4 i 6–7 uruchamiają własne scenariusze kontrolne; nie zależą od aktualnego presetu ani wycieku. Test 5 sprawdza bieżący surowy Brier, a test 8 kontroluje deterministyczność i zapis odcisku do porównania po przeładowaniu.

Literalny test 5 wymaga równości, która nie zachodzi ogólnie dla surowych prognoz i 15 koszyków. Pokazujemy jego rzeczywisty wynik przy progu 10⁻⁶ oraz dodatkowe kontrole dokładnej tożsamości; nie podmieniamy BS ani progu.

Testy 4, 6 i 7 opisują własności jednej losowej próby, a nie twierdzenia dla każdego seed. Niezaliczenie nie uprawnia do wybierania wygodniejszych obserwacji ani wymuszania zwycięstwa metody.

Kontrole numeryczne obejmują remisy AUC, znak przy Resolution i rząd kwantyla z poprawką n + 1. Każdy wynik zawiera wartość zmierzoną, więc da się odróżnić błąd implementacji od nieprawdziwego założenia eksperymentu.

Ten sam seed, parametry i kod dają tę samą próbę oraz te same metryki. Zmiana rozmiaru kalibracji bierze początek istniejącej próby; ruch gamma lub szumu nie losuje nowych etykiet.