Peter Gostev opublikował na GitHub interesujący benchmark. Sprawdza on zdolność sztucznej inteligencji do odmawiania i wykrywania błędnych założeń w prompcie. Benchmark zawiera zestaw około 100 pytań, które brzmią technicznie i profesjonalnie, ale w rzeczywistości zawierają błędne założenia lub logiczny nonsens. Przykładowe prompty mieszają pojęcia z różnych dziedzin - np. finansów, marketingu czy fizyki - tworząc zdania, które "brzmią mądrze", lecz nie mają spójnego znaczenia.
Modele oceniane są w trzech kategoriach. Najlepszy wynik to "clear pushback", czyli sytuacja, gdy model wyraźnie wskazuje, że pytanie jest bez sensu. Druga kategoria to "partial challenge", gdy model zauważa problem, ale mimo to próbuje częściowo odpowiedzieć. Najgorszy wynik to "accepted nonsense", czyli wygenerowanie pewnej siebie odpowiedzi na kompletnie błędne założenie
Wyniki pokazują, że wiele modeli nadal ma tendencję do "grzecznego współpracowania" z użytkownikiem, nawet jeśli pytanie jest absurdalne. Zamiast zakwestionować założenie, model potrafi stworzyć długą, brzmiącą fachowo odpowiedź opartą na fikcyjnych zależnościach. To zjawisko jest często określane jako halucynacje modeli językowych.
Co ciekawe, większa liczba tokenów przeznaczonych na "rozumowanie" nie zawsze poprawia wynik. W niektórych przypadkach prowadzi wręcz do bardziej rozbudowanych, ale nadal bezsensownych odpowiedzi. Benchmark sugeruje więc, że sama skala modeli i moc obliczeniowa nie rozwiązują problemu krytycznego myślenia.
Dla zastosowań biznesowych ma to duże znaczenie. Systemy AI wykorzystywane w analizach, raportach czy automatyzacji procesów mogą generować wiarygodnie brzmiące, lecz błędne wnioski. Benchmark Gosteva pokazuje więc nie tylko możliwości modeli, ale też ich potencjalne ryzyka.
Repozytorium projektu:
https://github.com/petergpt/bullshit-benchmark
Ostatnia wersja live:
https://petergpt.github.io/bullshit-benchmark/viewer/index.v2.html
X/Twitter autora:
https://x.com/petergostev
No i najciekawsze - nonsensowne pytania:
https://github.com/petergpt/bullshit-benchmark/blob/main/questions.json
Czy też spotkaliście się z problemem nadmiernego entuzjazmu AI, które tylko ślepo potwierdza to, co podaliście w prompcie?
Modele oceniane są w trzech kategoriach. Najlepszy wynik to "clear pushback", czyli sytuacja, gdy model wyraźnie wskazuje, że pytanie jest bez sensu. Druga kategoria to "partial challenge", gdy model zauważa problem, ale mimo to próbuje częściowo odpowiedzieć. Najgorszy wynik to "accepted nonsense", czyli wygenerowanie pewnej siebie odpowiedzi na kompletnie błędne założenie
Wyniki pokazują, że wiele modeli nadal ma tendencję do "grzecznego współpracowania" z użytkownikiem, nawet jeśli pytanie jest absurdalne. Zamiast zakwestionować założenie, model potrafi stworzyć długą, brzmiącą fachowo odpowiedź opartą na fikcyjnych zależnościach. To zjawisko jest często określane jako halucynacje modeli językowych.
Co ciekawe, większa liczba tokenów przeznaczonych na "rozumowanie" nie zawsze poprawia wynik. W niektórych przypadkach prowadzi wręcz do bardziej rozbudowanych, ale nadal bezsensownych odpowiedzi. Benchmark sugeruje więc, że sama skala modeli i moc obliczeniowa nie rozwiązują problemu krytycznego myślenia.
Dla zastosowań biznesowych ma to duże znaczenie. Systemy AI wykorzystywane w analizach, raportach czy automatyzacji procesów mogą generować wiarygodnie brzmiące, lecz błędne wnioski. Benchmark Gosteva pokazuje więc nie tylko możliwości modeli, ale też ich potencjalne ryzyka.
Repozytorium projektu:
https://github.com/petergpt/bullshit-benchmark
Ostatnia wersja live:
https://petergpt.github.io/bullshit-benchmark/viewer/index.v2.html
X/Twitter autora:
https://x.com/petergostev
No i najciekawsze - nonsensowne pytania:
https://github.com/petergpt/bullshit-benchmark/blob/main/questions.json
Czy też spotkaliście się z problemem nadmiernego entuzjazmu AI, które tylko ślepo potwierdza to, co podaliście w prompcie?
Fajne? Ranking DIY Pomogłem? Kup mi kawę.