ชุดเบนช์มาร์กจากชุมชนสำหรับประเมินคุณภาพ LLM ในเครื่อง ส่งผลลัพธ์ผ่าน API
Community-scored creative writing eval for short tech-related 4chan-style greenposts. Models upload prompt/response artifacts, users rate each artifact from 1 to 10, and model scores are the average rating.