BenCzechMark – evaluace reasoning modelů

#4
by mitkaj - opened

Dobrý den,

líbí se mi Váš benchmark BenCzechMark. Rád bych ale evaluoval také modely, které využívají CoT/reasoning, což současný způsob evaluace benchmarku přímo nepodporuje. Předpokládám, že by bylo potřeba reasoning modelům umožnit vygenerovat celý reasoning výstup a pro evaluaci následně pracovat pouze s finální odpovědí, případně upravit současný likelihood-based způsob hodnocení.

Chtěl jsem se proto zeptat, zda plánujete benchmark rozšířit také o možnost evaluace reasoning modelů, protože reasoning hraje u současných frontier LLM modelů stále významnější roli.

Sign up or log in to comment