HyperAIHyperAI

Command Palette

Search for a command to run...

Commonsense Reasoning

Evaluating a model's ability to apply everyday knowledge and common sense to answer questions and make inferences.

Leaderboard

100 models total

Benchmarks

Wino Grande
PaLM 540B (0-shot)
PIQA
BoolQ
Hella-Swag
ARC-c
ARC-e
OBQA
SIQA
GSM-8K
Arc-Challenge
Common-senseQA
MUPPET Roberta Large
SVAMP
Arc-Easy
ST-MoE-32B 269B (fine-tuned)
Open-BookQA
AQuA
MMLU
CSQA
LAMBADA
MATH
Strategy-QA
MAWPS
ReCoRD
DeBERTa-1.5B
SIQA
ARC
MultiArith
MMLU-Pro
RTE
AddSub
TruthfulQA
SST-2
MRPC
SciQ
PARus
RuCoS
RWSD
WinoG
HellaS
LogiQA
Drop
MMLU-Redux
SingleEq
ScienceQA
AVReasonBench
PubMedQA
WNLI
MATH-500
MM-Bench
MNLI
RACE
Wino
GSM8K-MC
Hallusion Bench
MM-Star
MULTIPUN
BBH
Commonsense Reasoning
CosmosQA
GQA
HS
Trivia QA
WG
BioASQ
Hella
ProcessBank
QNLI
XHOPREASON
CSQA-2
Intent-QA
NExT-QA
ToMbench
Commonsense-170K
M3CoT
SciQA
AIME-25
BIG-bench (Causal Judgment)
BIG-bench (Date Understanding)
BIG-bench (Disambiguation QA)
FANToM
GPQA
NQ
QQP
SingEq
SNLI-VE val
EVE-ROI*
SQA
SQuAD
Story Cloze
VQA-v2
WIC
A-OKVQA
BBH-EN
BBH-ZH
BIG-bench (Sports Understanding)
CRUX-Eval
KOR-Bench
LC-O
LiveBench
M³UCD
MMLU-STEM
QASC
QBQA
REBUS
GPT-4V
ScienceQA + ARC-Challenge
SNLI-VE test
OFA
TextVQA
V* Bench
WG-M
WG-S
ZebraGrid
BLINK
COPA
Creak
GLUE
HotpotQA
MCTest
MMToM-QA
MuSR
ProntoQA
Video-MME
VSR
AGI
ANLI
BIG-Bench Hard
CLEVRER
CrisisMMD
GPQA Main
GSM-Plus
HumanEval
MedQA-zh
POPE
PopQA
SimpleTom
SWDE
1DC
BigToM
Chem
Event2Mind test
EA-VQ-VAE
FD-A
Hi-ToM
MA
MBPP
MCEval8K
MIR
MIRBENCH
Muir-Bench
Phy
RULER
ToMi
TwoHop
Vizwiz
WorldValuesBench
WSC
ancient Egyptian
Andersen tales
apartment (seen)
BIG-bench
Orca 2-13B
BIG-bench (Winowhy)
Bingo
CoBRa
COCO-Spatial
Combined
Community Alignment
CSQA-COT1000
GD-VCR
Human
GQA-OOD
GridToM
HaloQuest
KoBALT-Hard
KoBEST-General
MATH-V
GPT4V
medieval castle
Mini-ARC
MM MU
MMLU-DE
MultiRC
MuSiQue
NumGLUE
OCR-VQA
outer space
PACS-Material
PACS-QA
RealToxicityPrompts
Toxigen
TruthfulQA-DE
Visual Abstractions Benchmark
VQA-CP v2
VTAB-1K
wild west
Winogrd
X-Sum
3DSRBench
ACRE
AGIEval-MATH
AIME-2025
AQUA-RAT
arith
BIG-bench (Known Unknowns)
PaLM-540B (few-shot, k=5)
BillSum
Bongard-LOGO
ChartQA
CNN-DM
Combined Data
combined dataset
CV-Bench
Date Understanding
Falling Tower
ImageNet
LMB
LongBench
M-NIAH
Math-Vista
Med QA
MedM-CQA
MMLU-Medical
MMSU
Modular Arithmetic
Parity
PittAds
RealWorldQA
StimuliQA
TVQA
VisWiz
What's-up
AG-News
ARC-Gen
Belebele
BIG-bench (Logical Sequence)
Chinchilla-70B (few-shot, k=5)
C.B.
CANDLE500
Causal-VidQA
CLE
CLEVR
CLEVR-Ref
COCO_one
COCO_two
COMMON2SENSE
Controlled_A
Controlled_B
cross-event dataset
CulturalBench
Deductive Reasoning
DocMSU-PLUS
e-SNLI-VE
EgoToM
EmbSpatial
EmoSet
Emotion6
Geographical QA
GlobalCultureQA
HelaS
M-MMLU
Math10K
MCNC public dataset
MIntRec 2.0
MM-Vet
MMBench-DEV
MME-CoT
MME-RealWorld-Lite
MMLU-ST
Multi-Illumination Event-Instruction Benchmark
Natural Questions
OCR-Bench
Oogiri-GO
OpenToM
Physical IQA
PLASMA
POPE-adversarial
RefCOCO-g
ScienceQA-IMG
SEED-Image
SpatialBench
SpatialMQA
SpinBench
SQA-IMG
SQuAD-C
SSRBENCH
SuperGLUE
TabMWP
TODAY
V-Star
VCR (Q-AR) dev
VCR (Q-AR) test
PEVL
VG_one
VG_two
Visual Commonsense Reasoning
VQAT
VRUBench
WebEmo
Winoground
2WikiMQA
ACE
ACL
AI
AI2D
AlgoPuzzleVQA
GPT-4
ARC_eu
AST
ATIS
Banking-77
BasqueGLUE
benchmarks
Bird
BL2MP
C-Eval
Camera
car
ChartBench
CharXiv
CIFAR-100
CLadder 1.5
Clinc-150
Clotho-AQA
CNN/DM
CODAH
BERT-LARGE
Colored Objects
COMFORT VI
COMFORT#
CommonsenseQA 2.0
CosmosReason1-Bench
CREHate
CRPE
CSQA→OBQA
CSQA→QASC
CTRC
CUBS
CulturalVQA
CultureAtlas
DICE-D
Dog
DTD
e-SNLI
EgoPlanBench2
Euro SAT
EusExams
EusProficiency
EusReading
EusTrivia
EvoChart
FBT
FCMR
FGVC
Flower
fr-grammar
fr-vocab
FRT
GSM8K-Rev
GTSRB
HellaSwag_eu
HEval.
HID-Chart
HR-4K
HR-8K
HR-Bench
HT
IEMOCAP
IEMOCAP-DA
IFEval
IFVL.
ImageNet-1K
INCLUDE
InfoSeek
LLaVA-Bench-in-the-wild
Logical Deduction
LRA
MaQA.
MatchIntel
MATH-Vision
MathQA
MCNC original dataset
MELD-DA
MIntRec
MM-AU
MMBench-Chinese
MMBench-EN
MMLU_eu
MMMU-Pro
MMSI
MMVP
MUIR
Multi-domain Deductive Reasoning
Multi-News
Multimodal-RewardBench
MV-Bench
MyVLM
NIAH-MK
NIAH-MQ
NS
NuScenes-MQA
NuScenes-QA
OBQA→CSQA
OK-VQA
OpenQA
Penguin
PerVA
Phone
PhyCritic-Bench
PHYSICLEAR
PlotQA
PST
PsychGenerator
Pubmed
QASC→CSQA
QASC→OBQA
QASPER
QuaRel
QuaRTz
RE-SISC45
Recipe-MPR
RefCOCO
RefCOCO+
Restaurant
Reverse Curse
RS
RULER-CWE
RULER-Hotpot
Ruozhiba
S-CIFAR-100
S-Cifar10
S-NIAH
Science-VQA
SCT
SD
SD-QA
SEED-Bench
SEEDBench-2-Plus
SemEval 2020
SemEval 2021
Sit
SNIPS
Social-IQ
SS T
SSC
Stanford-Cars
SUN-397
SVHN
TallyQA
TreeBench
TruthfulQA 1
TruthfulQA 2
TVK
ULogic
UniVaR
UOT
V*
VCR (Q-A) dev
VCR (Q-A) test
VL-RewardBench
VLM2
VRef
VSI
VTAB
VTK
Winogrande_eu
WSC273
X-StoryCloze
Yo'LLaVA