Spaces:
Running
Running
BenCzechMark – evaluace reasoning modelů
#4
by mitkaj - opened
Dobrý den,
líbí se mi Váš benchmark BenCzechMark. Rád bych ale evaluoval také modely, které využívají CoT/reasoning, což současný způsob evaluace benchmarku přímo nepodporuje. Předpokládám, že by bylo potřeba reasoning modelům umožnit vygenerovat celý reasoning výstup a pro evaluaci následně pracovat pouze s finální odpovědí, případně upravit současný likelihood-based způsob hodnocení.
Chtěl jsem se proto zeptat, zda plánujete benchmark rozšířit také o možnost evaluace reasoning modelů, protože reasoning hraje u současných frontier LLM modelů stále významnější roli.