logo elektroda
logo elektroda
X
logo elektroda
REKLAMA
REKLAMA
Adblock/uBlockOrigin/AdGuard mogą powodować znikanie niektórych postów z powodu nowej reguły.

Sztuka konfrontacji AI czyli droga do lepszych odpowiedzi

25 Kwi 2025 16:41 1770 8

TL;DR LABEL_AI_GENERATED

  • Konfrontacja odpowiedzi wielu modeli AI zamiast polegania na jednym asystencie ma prowadzić do lepszych, pełniejszych i bardziej rzetelnych odpowiedzi.
  • Zapytanie trafia do kilku niezależnych modeli, a potem ich odpowiedzi są wzajemnie recenzowane, porównywane i oceniane pod kątem różnic, błędów oraz stronniczości.
  • Takie tarcie zmusza człowieka do roli arbitra i rozwija krytyczne myślenie; w tekście pojawia się też uzupełnienie po 4 godzinach 32 minutach.
Podsumowanie AI na podstawie dyskusji. Może zawierać błędy.
REKLAMA
Słuchaj:
  • O autorze
    Konto nie istnieje
    Poziom 1  
    Konto nie istnieje napisał 0 postów. Jest z nami od 1978 roku.
  • REKLAMA
  • #3 21531853
    Konto nie istnieje
    Poziom 1  
  • REKLAMA
  • #4 21531939
    lemgo
    Poziom 15  
    Posty: 147
    Ocena: 153
    Ta decyzja (w środku obrazka) "odpowiedź poprawna?" - kto ocenia? AI i czy człowiek?
    I poprzednie "przekaż odpowiedź do kolejnego modelu" - czyli "AI_eNte - czy się z tym zgadzasz?" ??? Czy jakiś inny prompt?
    Wprowadzenie całego stada modeli do obrazka jakoś chyba niewiele wnosi w sensie jakościowym, a tylko utrudnia percepcję, chyba
  • #6 21546193
    Konto nie istnieje
    Poziom 1  
  • REKLAMA
  • #7 21546244
    lemgo
    Poziom 15  
    Posty: 147
    Ocena: 153
    Troll mode:
    Ale nie dostałeś odpowiedzi na pytanie "czy najlepszy?" Bardzo zachowawcze, zbiasowane prompty tam mają - "sam se oceń, a ja Ci podpowiem, na jakie kryteria zwracaj uwagę".
    "Assistant B" ciut bliżej zadanego pytania

    A u mnie - owszem
    https://github.com/jbanaszczyk/BotForum/tree/main/examples/examples_4

    qwen3:14b:
    Elektroda.pl is widely regarded as one of the leading Polish portals for electronics enthusiasts, known for its active community, comprehensive forums, and extensive technical discussions covering topics like microcontrollers, DIY projects, and general electronics. [...]

    gemma3:4b:
    Elektroda.pl is widely considered one of the most popular and comprehensive resources for electronics enthusiasts in Poland, offering a wide range of topics, an active community, and valuable technical discussions. [...]

    ... dalej są oczywiście, że może szukasz czegoś innego

    [ standardowo, bielik nie zrozumiał konceptu bycia sędzią;) ]
  • #8 21546906
    Konto nie istnieje
    Poziom 1  
  • REKLAMA
  • #9 21766501
    LEDówki
    Poziom 43  
    Posty: 9655
    Pomógł: 1322
    Ocena: 2604
    Po odpowiedziach ich poznacie. Model B wygląda na groka. Ona wali takie afirmacyjne teksty nawet gdy wpisuje kompletne bzdury. GPT-5 zapętla się czasem i wtedy lepiej przerwać czat, bo będzie wypisywał głupoty i przepraszał gdy mu się te głupoty wytknie.
    Kod dość sprawnie piszą modele claude, chociaż potrafią wytworzyć masę błędów i długo im schodzi z ich usunięciem. Jednakże usuwają błędy, które stworzył grok lub gpt-5 i z którymi ich autorzy nie mogli sobie poradzić. Mistral dobrze sobie radzi z zadaniami logicznymi (sugestia kolegów z forum, ja rozwiązywałem tylko jeden problem, z którym pozostałe modele nie dały rady). Gpt-5 to bajarz. Może podpowiedzieć kierunek poszukiwać, rzucić szkielet kodu, ale to wszystko. Nieco lepszy jest grok, ale wali błędy aż miło i "wywala od miesięcy dopieszczaną logikę aplikacji" (nasi tu byli!). Na arenie trafiłem na jakieś dwa pomniejsze model i kod był taki sobie, trzeba go było poprawić. ciekawie wygląda porównanie modeli zwykłych i głębiej myślących. Myśliciele potrafią zwrócić mocno skomplikowany kod, który nie działa. Prostszy model jest w stanie zwrócić działający kod. Przy porównaniu modeli wklejając rozwiązanie jednego wpływamy na myślenie drugiego modelu. Chcesz odpowiedzieć jak się sprawują dwa rozwiązania, to możesz wkleić kod obu i skomentować jak działają. Modele odniosą się do swoich rozwiązań i rozwiązań oponenta.
    Na arenie jest tablica liderów. Z niej wziąłem nazwy modeli, które wg. ocen lepiej kodują. Zupełnie nie rozumiem dlaczego grok jest wskazany jako dobry koder, gdyż generowany przez niego kod jest przeciętny. Czasem modelom z areny podrzucam informacje zdobyte w modelu gpt-5.

    GPT-5 pomógł mi rozwiązać stare problemy konfiguracyjne MySQL, KRB-5. Udało się skonfigurować dodatkowe repozytorium pakietów w linux.
    Proste rzeczy programistyczne lepiej wychodzą modelom sonnet w systemie linux z użyciem interpretera python niz w Windows z .Net.
Słuchaj:

Podsumowanie tematu

LABEL_AI_GENERATED
Dyskusja dotyczy metody konfrontacji odpowiedzi uzyskiwanych z różnych modeli sztucznej inteligencji w celu uzyskania głębszej i bardziej wartościowej informacji. Zamiast polegać na pojedynczym modelu AI, proponuje się zadawanie tego samego pytania wielu niezależnym modelom, a następnie wzajemne ocenianie i recenzowanie ich odpowiedzi przez kolejne AI. Proces ten uwzględnia różnice w danych treningowych, architekturze i sposobie generowania odpowiedzi, co może prowadzić do ciekawszych i bardziej zróżnicowanych wyników. W dyskusji pojawiły się przykłady algorytmów i narzędzi wspierających takie podejście, m.in. platforma LMArena, gdzie testowano różne modele na pytaniu o popularność portalu elektroda.pl. Wskazano, że niektóre modele, jak GPT-5, Grok, Claude czy Mistral, mają różne mocne i słabe strony, np. GPT-5 bywa niekiedy zapętlony i generuje błędy, Grok popełnia błędy logiczne, a Claude potrafi skutecznie poprawiać błędy innych modeli. Konfrontacja modeli pozwala na lepszą ocenę jakości odpowiedzi i może wspierać proces tworzenia bardziej precyzyjnych i wiarygodnych rozwiązań w dziedzinie AI.
Podsumowanie AI na podstawie dyskusji. Może zawierać błędy.
REKLAMA