MT-Eval. Code and data for "MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models"
57M4LE. Code for M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
23coad. CoAD: Automatic Diagnosis through Symptom and Disease Collaborative Generation (ACL 2023)
8JoTR. Python
5pandas_exercises. Practice your pandas skills!
1