Sharkline

← Wszystkie artykuły

Czego AI nie wie o meczu: prawdziwe granice analizy sportowej

·8 min czytania

Są dwie rzeczy, których AI o meczu nie wie. Pierwsza: wszystko, co wydarzyło się po złożeniu analizy. Druga: wszystko, co w żadnym źródle nie stało się danymi. Reszta klasycznej listy zarzutów — „model nie ma pojęcia o pogodzie, kontuzjach i tabeli” — jest nieaktualna: miejsce w tabeli przychodzi z bazy sportowej razem ze statystyką, a pogoda i wyznaczony sędzia są wyszukiwane osobno, zanim cokolwiek zostanie policzone. Prawdziwe granice biegną gdzie indziej. Poniżej po kolei, z uczciwą adnotacją wszędzie tam, gdzie rzekome ograniczenie okazuje się mitem.

Co AI o meczu wie naprawdę

Spory o granice AI w sporcie prowadzi się niemal zawsze po ciemku: dyskutujący nie wiedzą, co faktycznie trafia do modelu. A to właśnie decyduje o wszystkim. Analiza jest dokładnie tak mądra, jak zestaw danych, który do niej wszedł.

Wejście Sharkline ma dwie warstwy. Pierwsza to API danych sportowych: statystyki drużyn i zawodników, aktualna forma, miejsce w tabeli, historia bezpośrednich spotkań, składy, kontuzje. Drugą dokłada się ręcznie: przed analizą system wykonuje do trzech wyszukiwań w sieci i szuka dokładnie tego, czego baza danych z definicji nie pomieści. Potwierdzone składy, świeże komunikaty klubów, pogoda w dniu meczu, wyznaczony sędzia.

Osobno stoi warstwa konsensusu: kilkadziesiąt niezależnych ocen tego samego meczu, sprowadzonych do jednej skali i zważonych według wiarygodności każdego źródła. Do modelu trafia jedno porównywalne prawdopodobieństwo, a wymyślanie liczb spoza źródeł jest mu wprost zabronione. Nudny szczegół inżynierski — i jednocześnie to, co oddziela obliczenie od dobrze napisanego zgadywania.

To samo w formie mapy.

Czynnik Widoczny Skąd pochodzi
Statystyki drużyn i zawodników tak API danych sportowych
Forma z ostatnich meczów tak to samo
Miejsce w tabeli tak to samo
Historia bezpośrednich spotkań tak to samo
Ogłoszone składy i kontuzje tak baza + osobne wyszukiwanie wiadomości
Pogoda w dniu meczu tak wyszukiwanie przed analizą
Wyznaczony sędzia tak wyszukiwanie przed analizą
Jak źródła oceniają mecz tak konsensus 20+ źródeł
Motywacja drużyny częściowo tabelę widać, odczytu tabeli przez trenera już nie
Rzadkie rozgrywki i niższe ligi częściowo cienka statystyka, ocena researchu spada
Uraz na rozgrzewce nie wydarzył się po złożeniu analizy
Późna zmiana w składzie nie to samo
Nieogłoszona rotacja nie decyzja istnieje, komunikatu nie ma
Konflikt w szatni nie nigdy nie staje się danymi

Pierwsze osiem wierszy to rzeczy zwykle poza zasięgiem analizy robionej ręcznie: nikt fizycznie nie zbierze takiej ilości materiału dla trzystu meczów w jeden wieczór. Cztery ostatnie wiersze opisują sufit, a ten sufit nigdzie nie zniknie.

Granica pierwsza: analiza to zdjęcie

Każda analiza ma datę. Opisuje mecz takim, jaki był w chwili składania, i od tej sekundy zaczyna się starzeć.

Zawodnik łapie uraz na rozgrzewce. Czterdzieści minut przed gwizdkiem trener zmienia ustawienie. Skład podawany rano wieczorem wygląda inaczej. Nic z tego nie dotrze do analizy zrobionej wcześniej i żadna częstotliwość odświeżania nie rozwiązuje tego do końca: między ostatnim przeliczeniem a pierwszym gwizdkiem zawsze zostaje szczelina.

Praktyczny wniosek jest prosty. Im bliżej rozpoczęcia czytasz analizę, tym więcej jest warta i tym mniej czasu miał świat, żeby zmienić się za jej plecami.

Granica druga: decyzje, o których nikt nie poinformował

Najbardziej niedoceniany punkt listy. Model widzi miejsce w tabeli, więc zdanie „AI nie rozumie motywacji” wymaga poprawki: tabelę ma, a fakt, że drużyna nie ma już o co grać, nie jest dla niego nowością.

Czego nie ma, to decyzji trenera. Oszczędzić podstawowy skład przed europejskim tygodniem, dać grać młodym, wystawić drugiego bramkarza. Dopóki taka decyzja nie została ogłoszona, dla systemu nie istnieje, a bywa ogłaszana godzinę przed meczem. Dane o drużynie mówią jedno, sztab już postanowił drugie i nic tej szczeliny nie domyka.

Granica trzecia: to, co nigdy nie stało się danymi

Konflikt z zarządem. Zaległe wypłaty. Ustalenia, o których nikt nie pisze. Zawodnik, który wczoraj pochował kogoś bliskiego, a mimo to wyszedł na boisko, bo trener poprosił.

Takie rzeczy nie pokazują się w statystyce z wyprzedzeniem. Pokazują się później, w postaci dziwnego wyniku, który wszyscy tłumaczą po fakcie. Żaden model tego nie zobaczy, a obiecywanie inaczej jest nieuczciwe. Informacja z wewnątrz zostaje terenem człowieka z kontaktem w klubie, nie terenem algorytmu.

Granica czwarta: rozgrywki bez statystyki

Są mecze, przy których wszystko powyższe po prostu nie działa, bo nie ma czego zbierać.

Z karty analizy

Jakość researchu

★★★ wysoka

wysoka pewność

Danych dużo, źródła i model są zgodne, analiza jest pewna.

Jakość researchu

★ niska

lepiej odpuścić

Mętny mecz: pewnego wniosku nie ma i mówi to wprost.

Po lewej mecz z gęstą bazą danych. Po prawej przypadek, w którym uczciwa odpowiedź jest tylko jedna. Liczby na obu kartach są ilustracyjne.

Trzecia liga, wczesna runda Pucharu Polski, rozgrywki, w których połowa składu zmienia się z tygodnia na tydzień. Formalnie dane istnieją. Praktycznie jest ich dziesięć razy mniej niż przy spotkaniu czołówki Ekstraklasy, a część przeczy reszcie.

Poprawne zachowanie w takim miejscu to obniżyć ocenę jakości researchu i powiedzieć „lepiej odpuść”. Nie z lenistwa, tylko dlatego, że każda liczba policzona na takim materiale będzie wyglądać przekonująco i nie będzie znaczyć prawie nic. Cienkie dane dają cienką analizę, a przyznanie się do tego kosztuje mniej niż odgrywanie pewności.

Granica piąta: nawet poprawne 70% myli się trzy razy na dziesięć

Tej granicy nie da się obejść w ogóle, bo siedzi w samej idei prawdopodobieństwa.

Jeśli system mówi „70%” i jest dobrze skalibrowany, to z dziesięciu takich meczów trzy nie pójdą po jego myśli. To nie jest awaria. To dokładnie znaczenie liczby 70. Model, w którym sprawdzają się wszystkie analizy z pewnością 70%, nie jest genialny — ma zepsutą skalę, a poprawne wartości byłyby tam znacznie wyższe.

Stąd niewygodna konsekwencja dla czytelnika. Jakości analizy nigdy nie sprawdza się na jednym meczu. Jeden wynik to jeden rzut monetą i nie dowodzi niczego w żadną stronę. Ocena jest możliwa dopiero na dystansie i tylko przez porównanie, jak zachowują się analizy o różnym poziomie pewności. Właśnie dlatego żadna metoda, także AI, nie może obiecać gwarantowanego wyniku — powód jest matematyczny, nie kwestią starania, i opisujemy go w tekście dlaczego nikt nie gwarantuje wyniku.

Czy można ufać AI w analizie sportowej

Zależy, co nazwiemy zaufaniem.

Ufać jak wyroczni — nie. Żadnemu serwisowi, żadnemu człowiekowi, żadnemu modelowi. W sporcie nie istnieje narzędzie, które zna wynik z góry, i każdą taką obietnicę można wyrzucić bez czytania.

Ufać jak maszynie, która odwaliła za ciebie nudną robotę — tak, z zastrzeżeniami. Zebrała dane o trzystu meczach, nie zmęczyła się przy dwusetnym i nie zakochała się w pierwszej wersji odpowiedzi. Pokazała rozkład prawdopodobieństw zamiast jednej opcji, oceniła jakość własnych danych i nazwała okoliczność, w której się pomyli. Sprawdzalna praca z podanymi granicami jest użyteczna. Niesprawdzalna pewność siebie nie jest — niezależnie od tego, kto ją roztacza.

Jak czytać analizę, znając te granice

Analiza meczuANALIZA AI
Sevilla

Sevilla — Getafe

LaLiga

Getafe

Prawdopodobieństwo wygranej

1 · Sevilla

46%

X

29%

2 · Getafe

25%

Wniosek

Goli będzie dużo

Obie ofensywy w formie, ich mecze zwykle są bramkostrzelne.

63%

Pewność

★★★jakość danych

Gospodarze strzelają dwa lub więcej w ośmiu domowych meczach z rzędu.

Ryzyko: rotacja przed meczem europejskim w środku tygodnia.

Przykładowa karta analizy. Liczby są ilustracyjne.

Trzy nawyki zmieniają wszystko.

Najpierw jakość danych, dopiero potem wniosek. Gwiazdki researchu odpowiadają na pytanie, czy w ogóle warto czytać dalej. Efektowne prawdopodobieństwo przy jednej gwiazdce jest warte mniej niż skromne przy trzech.

Główne ryzyko czytaj jako część analizy. Linijka, w której system z góry nazywa to, co może go wywrócić, jest najcenniejsza w całej karcie. Wytłumaczyć wynik po meczu potrafi każdy; wskazać słaby punkt przed meczem — znacznie mniej osób.

Sprawdź datę złożenia. Analiza zrobiona wczoraj wieczorem nic nie wie o porannych wiadomościach. To nie zarzut wobec niej, to właściwość każdego zdjęcia.

Jak z surowych danych powstaje gotowa analiza, krok po kroku, opisaliśmy w tekście jak działa AI w analizie meczów, a metryki takie jak xG — w tekście co to jest xG. Pięć prostych sprawdzeń, dzięki którym w minutę odróżnisz taką analizę od kanału sprzedającego pewność, jest w tekście analiza AI czy kanał z prognozami — to samo porównanie, tylko krok po kroku. Jak ten mechanizm jest zbudowany u nas — na stronie jak działa Sharkline.

Najczęstsze pytania

Czy AI wie o pogodzie i kontuzjach przed meczem? Tak. Kontuzje i ogłoszone składy przychodzą z bazy sportowej, a pogoda, świeże komunikaty klubów i wyznaczony sędzia są wyszukiwane osobno, zanim cokolwiek zostanie policzone — do trzech wyszukiwań na analizę. W analizie brakuje wyłącznie tego, co stało się wiadome po jej złożeniu.

Czego AI w analizie sportowej nie zrobi nigdy? Nie zobaczy przyszłości i nie odczyta myśli. Nieogłoszona rotacja, decyzja trenera, o której nikt nie powiedział, konflikt w szatni, ciche ustalenia — nic z tego nie istnieje w danych, czyli nie istnieje dla modelu.

Dlaczego analizy rzadkich rozgrywek są słabsze? Bo statystyki jest o nich kilka razy mniej i częściej przeczy sobie nawzajem. System obniża wtedy ocenę jakości researchu i radzi odpuścić mecz. Pewna liczba na pustym materiale wyglądałaby lepiej i znaczyła mniej.

Skoro pewność wynosiła 70%, dlaczego analiza się nie sprawdziła? Bo 70% oznacza dokładnie tyle, że mniej więcej trzy razy na dziesięć potoczy się inaczej. Dobrze skalibrowana skala ma obowiązek mylić się w podanym tempie. Sprawdza się ją na dystansie, nie na jednym meczu.

Czy można ufać analizie sportowej opartej na AI? Jako źródłu sprawdzalnej pracy — tak: widać, jakie dane zebrano, jak oceniono ich jakość i jakie ryzyko system nazwał sam. Jako obietnicy wyniku — nie, bo takiej obietnicy nie może złożyć nikt.

Mecze są przeanalizowane. Decyzja należy do ciebie.

Otwórz w Telegramie