Czego AI nie wie o meczu: prawdziwe granice analizy sportowej
·8 min czytania
Są dwie rzeczy, których AI o meczu nie wie. Pierwsza: wszystko, co wydarzyło się po złożeniu analizy. Druga: wszystko, co w żadnym źródle nie stało się danymi. Reszta klasycznej listy zarzutów — „model nie ma pojęcia o pogodzie, kontuzjach i tabeli” — jest nieaktualna: miejsce w tabeli przychodzi z bazy sportowej razem ze statystyką, a pogoda i wyznaczony sędzia są wyszukiwane osobno, zanim cokolwiek zostanie policzone. Prawdziwe granice biegną gdzie indziej. Poniżej po kolei, z uczciwą adnotacją wszędzie tam, gdzie rzekome ograniczenie okazuje się mitem.
Co AI o meczu wie naprawdę
Spory o granice AI w sporcie prowadzi się niemal zawsze po ciemku: dyskutujący nie wiedzą, co faktycznie trafia do modelu. A to właśnie decyduje o wszystkim. Analiza jest dokładnie tak mądra, jak zestaw danych, który do niej wszedł.
Wejście Sharkline ma dwie warstwy. Pierwsza to API danych sportowych: statystyki drużyn i zawodników, aktualna forma, miejsce w tabeli, historia bezpośrednich spotkań, składy, kontuzje. Drugą dokłada się ręcznie: przed analizą system wykonuje do trzech wyszukiwań w sieci i szuka dokładnie tego, czego baza danych z definicji nie pomieści. Potwierdzone składy, świeże komunikaty klubów, pogoda w dniu meczu, wyznaczony sędzia.
Osobno stoi warstwa konsensusu: kilkadziesiąt niezależnych ocen tego samego meczu, sprowadzonych do jednej skali i zważonych według wiarygodności każdego źródła. Do modelu trafia jedno porównywalne prawdopodobieństwo, a wymyślanie liczb spoza źródeł jest mu wprost zabronione. Nudny szczegół inżynierski — i jednocześnie to, co oddziela obliczenie od dobrze napisanego zgadywania.
To samo w formie mapy.
| Czynnik | Widoczny | Skąd pochodzi |
|---|---|---|
| Statystyki drużyn i zawodników | tak | API danych sportowych |
| Forma z ostatnich meczów | tak | to samo |
| Miejsce w tabeli | tak | to samo |
| Historia bezpośrednich spotkań | tak | to samo |
| Ogłoszone składy i kontuzje | tak | baza + osobne wyszukiwanie wiadomości |
| Pogoda w dniu meczu | tak | wyszukiwanie przed analizą |
| Wyznaczony sędzia | tak | wyszukiwanie przed analizą |
| Jak źródła oceniają mecz | tak | konsensus 20+ źródeł |
| Motywacja drużyny | częściowo | tabelę widać, odczytu tabeli przez trenera już nie |
| Rzadkie rozgrywki i niższe ligi | częściowo | cienka statystyka, ocena researchu spada |
| Uraz na rozgrzewce | nie | wydarzył się po złożeniu analizy |
| Późna zmiana w składzie | nie | to samo |
| Nieogłoszona rotacja | nie | decyzja istnieje, komunikatu nie ma |
| Konflikt w szatni | nie | nigdy nie staje się danymi |
Pierwsze osiem wierszy to rzeczy zwykle poza zasięgiem analizy robionej ręcznie: nikt fizycznie nie zbierze takiej ilości materiału dla trzystu meczów w jeden wieczór. Cztery ostatnie wiersze opisują sufit, a ten sufit nigdzie nie zniknie.
Granica pierwsza: analiza to zdjęcie
Każda analiza ma datę. Opisuje mecz takim, jaki był w chwili składania, i od tej sekundy zaczyna się starzeć.
Zawodnik łapie uraz na rozgrzewce. Czterdzieści minut przed gwizdkiem trener zmienia ustawienie. Skład podawany rano wieczorem wygląda inaczej. Nic z tego nie dotrze do analizy zrobionej wcześniej i żadna częstotliwość odświeżania nie rozwiązuje tego do końca: między ostatnim przeliczeniem a pierwszym gwizdkiem zawsze zostaje szczelina.
Praktyczny wniosek jest prosty. Im bliżej rozpoczęcia czytasz analizę, tym więcej jest warta i tym mniej czasu miał świat, żeby zmienić się za jej plecami.
Granica druga: decyzje, o których nikt nie poinformował
Najbardziej niedoceniany punkt listy. Model widzi miejsce w tabeli, więc zdanie „AI nie rozumie motywacji” wymaga poprawki: tabelę ma, a fakt, że drużyna nie ma już o co grać, nie jest dla niego nowością.
Czego nie ma, to decyzji trenera. Oszczędzić podstawowy skład przed europejskim tygodniem, dać grać młodym, wystawić drugiego bramkarza. Dopóki taka decyzja nie została ogłoszona, dla systemu nie istnieje, a bywa ogłaszana godzinę przed meczem. Dane o drużynie mówią jedno, sztab już postanowił drugie i nic tej szczeliny nie domyka.
Granica trzecia: to, co nigdy nie stało się danymi
Konflikt z zarządem. Zaległe wypłaty. Ustalenia, o których nikt nie pisze. Zawodnik, który wczoraj pochował kogoś bliskiego, a mimo to wyszedł na boisko, bo trener poprosił.
Takie rzeczy nie pokazują się w statystyce z wyprzedzeniem. Pokazują się później, w postaci dziwnego wyniku, który wszyscy tłumaczą po fakcie. Żaden model tego nie zobaczy, a obiecywanie inaczej jest nieuczciwe. Informacja z wewnątrz zostaje terenem człowieka z kontaktem w klubie, nie terenem algorytmu.
Granica czwarta: rozgrywki bez statystyki
Są mecze, przy których wszystko powyższe po prostu nie działa, bo nie ma czego zbierać.
Z karty analizy
Jakość researchu
★★★ wysoka
wysoka pewność
Danych dużo, źródła i model są zgodne, analiza jest pewna.
Jakość researchu
★ niska
Mętny mecz: pewnego wniosku nie ma i mówi to wprost.
Po lewej mecz z gęstą bazą danych. Po prawej przypadek, w którym uczciwa odpowiedź jest tylko jedna. Liczby na obu kartach są ilustracyjne.
Trzecia liga, wczesna runda Pucharu Polski, rozgrywki, w których połowa składu zmienia się z tygodnia na tydzień. Formalnie dane istnieją. Praktycznie jest ich dziesięć razy mniej niż przy spotkaniu czołówki Ekstraklasy, a część przeczy reszcie.
Poprawne zachowanie w takim miejscu to obniżyć ocenę jakości researchu i powiedzieć „lepiej odpuść”. Nie z lenistwa, tylko dlatego, że każda liczba policzona na takim materiale będzie wyglądać przekonująco i nie będzie znaczyć prawie nic. Cienkie dane dają cienką analizę, a przyznanie się do tego kosztuje mniej niż odgrywanie pewności.
Granica piąta: nawet poprawne 70% myli się trzy razy na dziesięć
Tej granicy nie da się obejść w ogóle, bo siedzi w samej idei prawdopodobieństwa.
Jeśli system mówi „70%” i jest dobrze skalibrowany, to z dziesięciu takich meczów trzy nie pójdą po jego myśli. To nie jest awaria. To dokładnie znaczenie liczby 70. Model, w którym sprawdzają się wszystkie analizy z pewnością 70%, nie jest genialny — ma zepsutą skalę, a poprawne wartości byłyby tam znacznie wyższe.
Stąd niewygodna konsekwencja dla czytelnika. Jakości analizy nigdy nie sprawdza się na jednym meczu. Jeden wynik to jeden rzut monetą i nie dowodzi niczego w żadną stronę. Ocena jest możliwa dopiero na dystansie i tylko przez porównanie, jak zachowują się analizy o różnym poziomie pewności. Właśnie dlatego żadna metoda, także AI, nie może obiecać gwarantowanego wyniku — powód jest matematyczny, nie kwestią starania, i opisujemy go w tekście dlaczego nikt nie gwarantuje wyniku.
Czy można ufać AI w analizie sportowej
Zależy, co nazwiemy zaufaniem.
Ufać jak wyroczni — nie. Żadnemu serwisowi, żadnemu człowiekowi, żadnemu modelowi. W sporcie nie istnieje narzędzie, które zna wynik z góry, i każdą taką obietnicę można wyrzucić bez czytania.
Ufać jak maszynie, która odwaliła za ciebie nudną robotę — tak, z zastrzeżeniami. Zebrała dane o trzystu meczach, nie zmęczyła się przy dwusetnym i nie zakochała się w pierwszej wersji odpowiedzi. Pokazała rozkład prawdopodobieństw zamiast jednej opcji, oceniła jakość własnych danych i nazwała okoliczność, w której się pomyli. Sprawdzalna praca z podanymi granicami jest użyteczna. Niesprawdzalna pewność siebie nie jest — niezależnie od tego, kto ją roztacza.
Jak czytać analizę, znając te granice
Sevilla — Getafe
LaLiga
Prawdopodobieństwo wygranej
1 · Sevilla
46%
X
29%
2 · Getafe
25%
Wniosek
Goli będzie dużo
Obie ofensywy w formie, ich mecze zwykle są bramkostrzelne.
Pewność
Gospodarze strzelają dwa lub więcej w ośmiu domowych meczach z rzędu.
Ryzyko: rotacja przed meczem europejskim w środku tygodnia.
Przykładowa karta analizy. Liczby są ilustracyjne.
Trzy nawyki zmieniają wszystko.
Najpierw jakość danych, dopiero potem wniosek. Gwiazdki researchu odpowiadają na pytanie, czy w ogóle warto czytać dalej. Efektowne prawdopodobieństwo przy jednej gwiazdce jest warte mniej niż skromne przy trzech.
Główne ryzyko czytaj jako część analizy. Linijka, w której system z góry nazywa to, co może go wywrócić, jest najcenniejsza w całej karcie. Wytłumaczyć wynik po meczu potrafi każdy; wskazać słaby punkt przed meczem — znacznie mniej osób.
Sprawdź datę złożenia. Analiza zrobiona wczoraj wieczorem nic nie wie o porannych wiadomościach. To nie zarzut wobec niej, to właściwość każdego zdjęcia.
Jak z surowych danych powstaje gotowa analiza, krok po kroku, opisaliśmy w tekście jak działa AI w analizie meczów, a metryki takie jak xG — w tekście co to jest xG. Pięć prostych sprawdzeń, dzięki którym w minutę odróżnisz taką analizę od kanału sprzedającego pewność, jest w tekście analiza AI czy kanał z prognozami — to samo porównanie, tylko krok po kroku. Jak ten mechanizm jest zbudowany u nas — na stronie jak działa Sharkline.
Najczęstsze pytania
Czy AI wie o pogodzie i kontuzjach przed meczem? Tak. Kontuzje i ogłoszone składy przychodzą z bazy sportowej, a pogoda, świeże komunikaty klubów i wyznaczony sędzia są wyszukiwane osobno, zanim cokolwiek zostanie policzone — do trzech wyszukiwań na analizę. W analizie brakuje wyłącznie tego, co stało się wiadome po jej złożeniu.
Czego AI w analizie sportowej nie zrobi nigdy? Nie zobaczy przyszłości i nie odczyta myśli. Nieogłoszona rotacja, decyzja trenera, o której nikt nie powiedział, konflikt w szatni, ciche ustalenia — nic z tego nie istnieje w danych, czyli nie istnieje dla modelu.
Dlaczego analizy rzadkich rozgrywek są słabsze? Bo statystyki jest o nich kilka razy mniej i częściej przeczy sobie nawzajem. System obniża wtedy ocenę jakości researchu i radzi odpuścić mecz. Pewna liczba na pustym materiale wyglądałaby lepiej i znaczyła mniej.
Skoro pewność wynosiła 70%, dlaczego analiza się nie sprawdziła? Bo 70% oznacza dokładnie tyle, że mniej więcej trzy razy na dziesięć potoczy się inaczej. Dobrze skalibrowana skala ma obowiązek mylić się w podanym tempie. Sprawdza się ją na dystansie, nie na jednym meczu.
Czy można ufać analizie sportowej opartej na AI? Jako źródłu sprawdzalnej pracy — tak: widać, jakie dane zebrano, jak oceniono ich jakość i jakie ryzyko system nazwał sam. Jako obietnicy wyniku — nie, bo takiej obietnicy nie może złożyć nikt.
Mecze są przeanalizowane. Decyzja należy do ciebie.