Shahed-136 / Geran-2
- Rola
- Uzbrojenie / wyposażenie
- Konstrukcja i cechy
Ten sam seed odtwarza te same dane. Rozpoczęcie próby zeruje Twoje decyzje w grze.
Model rozpoznawał drony. W archiwum zostały jego oceny i późniejsze potwierdzenia. Sprawdźmy, czy można mu zaufać.
To fikcyjna odprawa po dyżurze, na danych syntetycznych. Klasyfikujemy „dron / inny obiekt”; nie oceniamy uzbrojenia ani nie wybieramy sposobu działania. Każda kratka reprezentuje zapis klasyfikacji.
Generator tworzy 4000 obserwacji. 2000 służy do kalibracji. Resztę z góry dzielimy na rezerwę 300 zapisów dla pierwszej rundy i niezależne bloki 700, 500 oraz 500 dla kolejnych. Do otwarcia trafia do 100 pierwszych ocen z rezerwy o pewności co najmniej 95%, bez podglądania ich etykiet.
W rundach 1–3 szum = 0; wyjściowa gamma = 2,5. W rundzie 4 szum = 0,8 i gamma = 3: to trudniejsza próba. Ponowne sprawdzanie odsłoniętych danych jest ćwiczeniem, nie niezależnym testem.
Mechanika nauki przez działanie: The Evolution of Trust, Parable of the Polygons, Conditional Probability. Kod i oprawa tej gry są autorskie.
Geran, Gerbera, Orłan, Mavic. Cztery konstrukcje, różne role i wyposażenie. Poznaj konstrukcje, a potem sprawdź na danych syntetycznych, kiedy ocenie modelu można zaufać.
Wybierz kartę i zajrzyj poza sylwetkę.
Autorskie schematy typów konstrukcji, bez wspólnej skali; nie służą do identyfikacji obiektów. Atlas jest wyborem przykładów, nie pełnym katalogiem.
Wszystkie cztery przykłady są dronami. W laboratorium model rozróżnia „dron” i „inny obiekt” na symulowanej próbie. Atlas nie przypisuje platformom fikcyjnych prawdopodobieństw wykrycia.
Jeden plik · działa offline · jawny seed · osiem eksperymentów. Fakty o sprzęcie mają własne źródła; dane do obliczeń pochodzą z generatora.
Tutaj p oznacza P(dron): ocenę, że obiekt jest dronem. Nie rozstrzyga o uzbrojeniu. Etykieta: 1 = dron, 0 = inny obiekt.
Rozpoznanie drona nie rozstrzyga o uzbrojeniu, zamiarze ani skuteczności przechwycenia. W esejach pytaliśmy o uzbrojenie; tu ćwiczymy wcześniejszy etap oceny informacji. To symulacja statystyczna, nie stanowisko dowodzenia.
Radar, obraz optyczny, sygnały radiowe i inne źródła dostarczają różnych informacji. Pojedyncze wykrycie jest początkiem oceny.
Systemy C2 pomagają łączyć informacje i utrzymywać spójny opis obiektów. C2 oznacza dowodzenie i kierowanie.
Klasyfikację trzeba odróżnić od potwierdzenia i od decyzji o działaniu. Tu badamy jakość ocen, którymi posługuje się zespół.
Gdy wynik zostanie ustalony, można porównać go z wcześniejszą oceną. W ćwiczeniu wszystkie etykiety zna generator; w praktyce materiał bywa niepełny.
Funkcje opisano na podstawie JRC (2025), ćwiczenia NCIA TIE26 (2026) oraz opisu kształcenia oficerów identyfikacji LAW. Lokalnego centrum C-UAS nie utożsamiamy z polskim COP-DKP. Scena i układ tego ćwiczenia są autorskie.
Generator streszcza informację w jednej umownej cesze. Nie symuluje osobnych sensorów, ich zasięgów ani fizycznej siły zakłóceń. Częstość dronów 50% jest założeniem ćwiczenia, a 4000 rekordów — rozmiarem próby, nie liczbą obiektów podczas realnego dyżuru.
Zacznij od przykładowych zapisów. Potem porównaj oceny z potwierdzeniami w całej próbie.
Suwaki działają we wszystkich panelach. Przejście do kroku zachowuje ustawienia; „Ustaw eksperyment” przywraca jego punkt wyjścia i zachowuje Twój seed.
Podział 50/50 jest stały i niezależny od etykiet. Bazowa częstość populacji wynosi 0,5 z symetrii. Preset B, wcześniej „Klimatolog”, przypisuje tę znaną stałą wszystkim obiektom, bez podglądania etykiet. Preset C zastępuje dawną nazwę „RLHF”: pokazuje nadmierną pewność, nie działanie konkretnego algorytmu uczenia.
To trzy odrębne kryteria, nie statystycznie niezależne wielkości. Gamma zachowuje ranking, ale zmienia kalibrację i sharpness; szum w podanym generatorze psuje zarówno ranking, jak i kalibrację. Gamma = 1 daje kalibrację populacyjną tylko przy szumie = 0.
Diagram niezawodności · 15 koszyków równej szerokości · wyłącznie test
To pierwszych sześć przykładów testowych. Ich identyfikatory i etykiety pozostają te same, gdy ruszasz gammą lub szumem. Procent dotyczy hipotezy „dron”; 2% oznacza więc silną hipotezę „inny obiekt”.
Wynik jednego przypadku nie dowodzi kalibracji. Wykres poniżej obejmuje wszystkie 2000 przykładów testowych.
Wielkość punktu koduje liczebność. Pionowe kreski pokazują niepewność częstości; szeroki przedział nie jest dowodem dobrej ani złej kalibracji.
Puste koszyki nie mają punktu. W koszyku z jedną obserwacją wynik 0% lub 100% to przede wszystkim słaby pomiar.
| Koszyk | n | p̄ | Częstość | 95% Wilson |
|---|
Kalibracja pyta o częstość zdarzenia w grupie podobnych prognoz, a nie o trafność pojedynczej odpowiedzi. Punkt ponad przekątną oznacza niedoszacowanie prawdopodobieństwa, punkt pod nią — przeszacowanie.
ECE i MCE zależą od koszyków i skończonej próby. Nawet model poprawny w populacji nie musi mieć ECE = 0 na tych 2 000 obserwacji; przedziały Wilsona są punktowe, nie jednoczesne dla całego wykresu.
Ten sam test, dwie własności. Rusz gammą i obserwuj nieruchome AUC.
Gamma rozsuwa lub zbliża oceny, zachowując ich kolejność. Obiekt oceniony wyżej od innego nadal jest wyżej: ROC i AUC pozostają takie same. ECE może się zmienić, bo wartości oznaczają teraz inne częstości i trafiają do innych koszyków.
Dodanie szumu niszczy informację o ukrytym z; kalibrator nie potrafi jej odzyskać. W tym generatorze szum psuje też kalibrację — ruch w drugą stronę nie jest symetryczny.
Sharpness i rozkład Murphy’ego · wybierz preset B i porównaj Brier z Uncertainty
| Składnik / 15 koszyków | Wartość | Rola w wyniku |
|---|
Trzy składniki sumują się dokładnie do BS₁₅, liczonego po zastąpieniu każdego p średnią jego koszyka. Dla surowego BS dochodzi reszta wewnątrz koszyków; nie wolno jej po cichu zerować.
Preset B podaje każdemu obiektowi tę samą częstość: ma zerowe Resolution i sharpness, niemal zerowe Reliability, a Brier zbliżony do Uncertainty. Jest skalibrowany, lecz nie pomaga rozróżniać obiektów.
Sharpness opisuje sam rozkład prognoz, bez etykiet; rozpychanie go gammą nie tworzy informacji. Resolution używa etykiet i nagradza rozdzielanie grup o różnych częstościach zdarzenia, dlatego w rozkładzie Briera występuje ze znakiem minus.
Trzy korekty ocen · uczymy się na archiwum, sprawdzamy na odłożonych przypadkach
| Metoda | ECE przed → po [pp] ↓ | AUC przed → po | Brier przed → po ↓ | Parametry |
|---|
Temperatura i Platt minimalizują NLL na wybranej próbie; Platt ma ograniczenie a > 0, aby zachować orientację rankingu. PAV agreguje identyczne wyniki przed dopasowaniem; poza próbką używa stałych poziomów i granic w połowie między blokami.
AUC przyznaje remisowi ½ punktu. Dla dużych logitów ranking surowego modelu, temperatury i Platta jest liczony na logitach, co zapobiega sztucznym remisom po numerycznym zaokrągleniu p do 1; izotoniczna zachowuje swoje rzeczywiste remisy.
Podstawienie T = gamma algebraicznie cofa warpγ. Temperatura dopasowana z próby jest estymatą: nie musi równać się gammie, zwłaszcza gdy szum wprowadza dodatkowe rozkalibrowanie.
Izotoniczna może przeuczyć 100 obserwacji i zmieniać AUC przez remisy; różnica na teście może mieć oba znaki. Większa próba stabilizuje dopasowanie, lecz nie gwarantuje zwycięstwa nad Plattem po 1 000 punktów — przy szumie 0 Platt ma tu dokładnie poprawną postać modelu.
Conformal: można pozostawić więcej niż jedną odpowiedź · surowy model i odłożone dane
| Trudność wg |z| | n testowe | Pokrycie | 95% Wilson |
|---|
„Dron” i „inny obiekt” są etykietami. Zbiór pusty oznacza, że żadna etykieta nie spełniła reguły; nie oznacza odkrycia trzeciego rodzaju obiektu.
Pokrycie dotyczy ogółu, nie każdej grupy osobno. To gwarancja brzegowa: uśredniona po losowaniu nowego przypadku i zbioru kalibracyjnego. Wymienność oznacza, że ich wspólny rozkład nie zależy od kolejności; niezależne przypadki z tej samej populacji spełniają ten warunek. Nowe warunki, także wskutek działania przeciwnika, mogą go podważyć.
Conformal nie kalibruje prawdopodobieństwa. Nawet źle skalibrowany model może dać poprawne pokrycie; ceną słabego sygnału bywają częste zbiory {0,1}. W tym binarnym modelu zmiana gamma zachowuje nawet całe zbiory wynikowe, jeśli za każdym razem przeliczymy kwantyl.
Przy alpha < 1/(nkal + 1) żądany rząd statystyki wychodzi poza próbę. Zamiast pozornej precyzji pojawia się ostrzeżenie; formalna konwencja q̂ = ∞ zwróciłaby wszystkim {0,1}. Conformal zawsze korzysta z odłożonych danych, niezależnie od przełącznika wycieku w panelu 04.
Umowny koszt automatycznej klasyfikacji w raporcie · te same obiekty, sprawdzona poprawność odpowiedzi
Model wpisuje do roboczego zestawienia „dron”, gdy p ≥ 50%, albo „inny obiekt” w przeciwnym razie. Teraz potrzebujemy q = max(p, 1 − p): ocenianej szansy, że wybrana odpowiedź jest poprawna. Koszty dotyczą wpisów do raportu, nie użycia uzbrojenia.
To nie jest awaria, którą widać w logach.
Próg ma sens przy wiarygodnej szansie poprawności i przyjętych kosztach. Niskie ECE dla całej próby nie zapewnia wiarygodności ocen w wąskiej grupie powyżej progu. Suma 1 − q jest oczekiwaniem modelu, nie górną granicą liczby błędów.
Korekty w tym panelu zawsze korzystają z odrębnych danych, również podczas ćwiczenia z wyciekiem w kroku 4. Przy 2000 wpisów widzisz całkowite liczby pomyłek; inny wolumen skaluje tę samą próbę. Zero błędów w tej próbie nie zapewnia zera w następnej. Rachunek pomija koszt dalszego sprawdzania i opóźnień. Człowiek również może popełnić błąd.
Przykładowa statystyka koncentracji · znaczenie wartości zależy od definicji API
| Liczba opcji N | Próg confidence | Równoważny próg pmax |
|---|
AUC transformacji porównujemy przy ustalonym N i tej samej etykiecie. Mieszanie różnych N może zmienić ranking.
Przy confidence = 0,85 równoważne pmax wynosi 0,925 dla N = 2, 0,900 dla N = 3, 0,880 dla N = 5 i 0,865 dla N = 10. Ściśle rosnąca transformacja zachowuje AUC, lecz nie zachowuje znaczenia progu prawdopodobieństwa.
Podstawienie c w miejsce q w panelu 06 zmienia regułę ekonomiczną i rachunek Σ(1 − q). Samo odwrócenie wzoru odzyskuje pmax modelu, ale nie gwarantuje, że to prawdopodobieństwo jest skalibrowane.
Kontrole kodu i wyniki eksperymentów to dwa różne rodzaje sprawdzania
Najpierw sprawdzamy tożsamości i granice, które kod musi zachować. Osobno pokazujemy, czy w tej konkretnej próbie wystąpiły oczekiwane efekty. Wszystkie pierwotne progi i zmierzone wartości pozostają dostępne.
Inny wynik próby nie musi oznaczać błędu programu. Pięciokrotny spadek ECE, zwycięstwo jednej metody i pokrycie na konkretnym teście nie są gwarantowane dla każdego seed. Pokazujemy wynik także wtedy, gdy oczekiwanie się nie spełnia.
Równość surowego Briera z samymi trzema składnikami jest niepełna po koszykowaniu. Kontrola kodu obejmuje poprawny wzór z resztą; osobno pozostaje widoczny wynik pierwotnej hipotezy bez reszty przy tym samym progu 10⁻⁶.
Kontrole numeryczne obejmują remisy AUC, znak przy Resolution i rząd kwantyla z poprawką n + 1. Każdy wynik zawiera wartość zmierzoną, więc da się odróżnić błąd implementacji od nieprawdziwego założenia eksperymentu.
Ten sam seed, parametry i kod dają tę samą próbę oraz te same metryki. Zmiana rozmiaru kalibracji bierze początek istniejącej próby; ruch gamma lub szumu nie losuje nowych etykiet.