logo elektroda
logo elektroda
X
logo elektroda
REKLAMA
REKLAMA
Adblock/uBlockOrigin/AdGuard mogą powodować znikanie niektórych postów z powodu nowej reguły.

Benchmark mierzący odporność sztucznej inteligencji na nonsens

p.kaczmarek2 07 Mar 2026 09:53 582 6

TL;DR LABEL_AI_GENERATED

  • Benchmark sprawdza, jak modele sztucznej inteligencji odmawiają i wykrywają błędne założenia w prompcie, zamiast bezmyślnie akceptować nonsens.
  • Zestaw obejmuje około 100 pytań brzmiących technicznie i profesjonalnie, lecz celowo miesza pojęcia z finansów, marketingu i fizyki.
  • Ocena dzieli odpowiedzi na clear pushback, partial challenge i accepted nonsense.
  • Wyniki pokazują, że wiele modeli nadal grzecznie współpracuje z użytkownikiem, tworząc pewne siebie, fachowo brzmiące, ale błędne odpowiedzi.
  • Większa liczba tokenów na rozumowanie nie zawsze poprawia wynik, a czasem prowadzi do jeszcze dłuższych nonsensownych odpowiedzi.
Podsumowanie AI na podstawie dyskusji. Może zawierać błędy.
REKLAMA
Słuchaj:
  • Wykres słupkowy rankingujący modele AI wg wykrywania nonsensu: zielony, pomarańczowy i czerwony udział odpowiedzi
    Peter Gostev opublikował na GitHub interesujący benchmark. Sprawdza on zdolność sztucznej inteligencji do odmawiania i wykrywania błędnych założeń w prompcie. Benchmark zawiera zestaw około 100 pytań, które brzmią technicznie i profesjonalnie, ale w rzeczywistości zawierają błędne założenia lub logiczny nonsens. Przykładowe prompty mieszają pojęcia z różnych dziedzin - np. finansów, marketingu czy fizyki - tworząc zdania, które "brzmią mądrze", lecz nie mają spójnego znaczenia.

    Modele oceniane są w trzech kategoriach. Najlepszy wynik to "clear pushback", czyli sytuacja, gdy model wyraźnie wskazuje, że pytanie jest bez sensu. Druga kategoria to "partial challenge", gdy model zauważa problem, ale mimo to próbuje częściowo odpowiedzieć. Najgorszy wynik to "accepted nonsense", czyli wygenerowanie pewnej siebie odpowiedzi na kompletnie błędne założenie

    Wyniki pokazują, że wiele modeli nadal ma tendencję do "grzecznego współpracowania" z użytkownikiem, nawet jeśli pytanie jest absurdalne. Zamiast zakwestionować założenie, model potrafi stworzyć długą, brzmiącą fachowo odpowiedź opartą na fikcyjnych zależnościach. To zjawisko jest często określane jako halucynacje modeli językowych.

    Co ciekawe, większa liczba tokenów przeznaczonych na "rozumowanie" nie zawsze poprawia wynik. W niektórych przypadkach prowadzi wręcz do bardziej rozbudowanych, ale nadal bezsensownych odpowiedzi. Benchmark sugeruje więc, że sama skala modeli i moc obliczeniowa nie rozwiązują problemu krytycznego myślenia.

    Dla zastosowań biznesowych ma to duże znaczenie. Systemy AI wykorzystywane w analizach, raportach czy automatyzacji procesów mogą generować wiarygodnie brzmiące, lecz błędne wnioski. Benchmark Gosteva pokazuje więc nie tylko możliwości modeli, ale też ich potencjalne ryzyka.

    Repozytorium projektu:
    https://github.com/petergpt/bullshit-benchmark
    Ostatnia wersja live:
    https://petergpt.github.io/bullshit-benchmark/viewer/index.v2.html
    X/Twitter autora:
    https://x.com/petergostev
    No i najciekawsze - nonsensowne pytania:
    https://github.com/petergpt/bullshit-benchmark/blob/main/questions.json

    Czy też spotkaliście się z problemem nadmiernego entuzjazmu AI, które tylko ślepo potwierdza to, co podaliście w prompcie?

    Fajne? Ranking DIY
    Pomogłem? Kup mi kawę.
    O autorze
    p.kaczmarek2
    Moderator Smart Home
    Offline 
    Inżynier programista z wieloletnim doświadczeniem embedded i full stack developer.
    Specjalizuje się w: embedded, Full-Stack Developer
    p.kaczmarek2 napisał 14760 postów o ocenie 12886, pomógł 659 razy. Jest z nami od 2014 roku.
  • REKLAMA
  • #2 21856920
    krzbor
    Poziom 29  
    Posty: 1783
    Pomógł: 42
    Ocena: 1072
    Bardzo ciekawa analiza. Claude pozostawił konkurencję daleko w tyle. To chyba dlatego amerykańskie wojsko z niego korzysta, a po decyzji Trumpa może być problem z zastąpieniem go czymś innym. Wysoko jest także Qwen.
  • REKLAMA
  • #3 21857051
    p.kaczmarek2
    Moderator Smart Home
    Posty: 14760
    Pomógł: 659
    Ocena: 12886
    Dobre modele AI pomału już nawet wiedzą, jakie standardy ISO istnieją...
    Zrzut ekranu BullshitBench v2 porównujący odpowiedzi Claude Sonnet 4.6 i o4-mini na pytanie o ISO 34271
    Pomogłem? Kup mi kawę.
  • REKLAMA
  • #4 21858037
    Andrzej Ch.
    Poziom 33  
    Posty: 2243
    Pomógł: 223
    Ocena: 393
    A który model AI polecacie do pisania kodu dla IoT?
    Chodzi mi głównie o to żeby wygenerowany kod działał, zgodnie z założeniami.
  • REKLAMA
  • #5 21865293
    Konto nie istnieje
    Poziom 1  
  • #6 21865362
    Imekxus
    Poziom 20  
    Posty: 877
    Pomógł: 38
    Ocena: 238
    >>21865293
    U mnie w takim przypadku (kod był "ok" w sensie buga można było zobaczyć tylko wizualnie w apce, nie dało się go wykryćw kodzie) miałem dwa scenariusze w zależności od modelu:
    - Claude Sonet 4.6 - zjadał całą sesję, pracował kilkadziesiąt minut po czym albo się wywalał, albo pisał tokens exceeded albo raz naniósł poprawki które nic nie psuły, uprościł kod, ale dalej nie działało (przyczyny j/w)
    - GPT Codex - ten szybko zwracał rezultat, też nie wiedział gdzie jest błąd ale starał się refaktorować kod, upraszczać
  • #7 21875245
    LEDówki
    Poziom 43  
    Posty: 9629
    Pomógł: 1320
    Ocena: 2596
    Claude radzi sobie z kodowaniem lepiej niż gpt. Grok to już całkiem bałwochwalca. Kołczowe gadki ma w każdym zdaniu, ale wyniki są mierne.
    Przy budowaniu logiki filtra żadne z modeli grok/gemini,gpt,claude, nie dał zadowalających wyników. W kody dobry jest claude i co zaskakuje, dobry bywa gemini. Pozostałe można sobie traktować jako ciekawostkę i wybryk natury.
    Jeżeli ktoś ma funkcjonalną logikę, to z tymi modelami w miarę poprawnie zamknie ją w kodzie. Przy tym mam wrażenie, że claude robi najsolidniejszy kod. Z pewnością poprawił błędy po GPT i Gemini. GPT podsuwa dużo możliwości, ale nie nadaje kierunku. Pisze, pisze, uznaje, że kod trzeba rafaktoryzować zgodnie z zasadami programowania i tracisz czas na refaktoryzację... Potrafi wywalić działający kod i zastąpić badziewiem. Grok sypie wulgaryzmami i slangiem programistów. Na LM Arena jest ranking botów, więc można z niego skorzystać. Ja tak testowałem najlepsze boty w kat. programowania.
Słuchaj:

Podsumowanie tematu

LABEL_AI_GENERATED
Omówiono benchmark opracowany przez Petera Gosteva, który ocenia zdolność modeli sztucznej inteligencji do wykrywania i odrzucania nonsensownych lub błędnych założeń w promptach. Benchmark zawiera około 100 pytań technicznych z błędnymi założeniami, a modele klasyfikowane są według trzech kategorii reakcji: "clear pushback" (wyraźne odrzucenie nonsensu), "partial challenge" (częściowe zakwestionowanie) oraz "accepted nonsense" (przyjęcie błędnych założeń i generowanie pewnej siebie odpowiedzi). W dyskusji podkreślono, że modele nadal często udzielają odpowiedzi na nonsens, choć niektóre radzą sobie lepiej. Wśród ocenianych modeli wyróżniono Claude, który uzyskał najlepsze wyniki i jest wykorzystywany m.in. przez amerykańskie wojsko. Wysoko oceniono także model Qwen. W kontekście generowania kodu dla IoT i programowania, Claude jest chwalony za solidność i zdolność do poprawiania błędów, podczas gdy GPT (w tym GPT Codex) oferuje wiele propozycji, ale czasem generuje nieoptymalny kod wymagający refaktoryzacji. Modele Grok i Gemini oceniono jako mniej skuteczne, z Grokiem charakteryzującym się nieprofesjonalnym językiem. Wspomniano również ranking botów na platformie LM Arena, który może służyć do porównań w kategorii programowania.
Podsumowanie AI na podstawie dyskusji. Może zawierać błędy.
REKLAMA