HyperAI
Command Palette
Search for a command to run...
Factual Consistency
Verifying that generated text is factually consistent with source material, detecting hallucinations and factual errors in model outputs.
Leaderboard
100 models total
Benchmarks
POPE
KILT: FEVER
Re2G
MedClaim
StrategyClaim
TruthfulClaim
B-score evaluation set
MMLU
AMBER
CorFEVER
FEVER
ProoFVer-SB
BEAF
CSQA
HLE
MuSiQue
MedM-CQA
AVeriTeC
FNC-1
Sepúlveda-Torres R., Vicente M., Saquete E., Lloret E., Palomar M. (2021)
MediEval
SQuAD
A-OKVQA
GQA
LIAR
Hybrid CNNs (Text + All)
MMRel
MS-COCO
R-Bench
TruthfulQA
AVHBench
COCO
HotpotQA
MOCHEG
PhD
SNLI
VERITE
ARC-c
Hella-Swag
Math-Vista
NewsCLIPpings
PubMedQA
WHOOPS
BIG-bench
CosmosQA
FaithEval
FakeHealth
LLaVA-Bench
Med QA
MM-FakeBench
MMLU Clinic
MMLU Col-Bio
MMLU Col-Med
MMLU Gene
MMLU (Anatomy)
MMLU-Pro-med
MovieSum
PubHealth
RAGTruth
RAWFC
RPE
Sci-fact
Biography
CICERO V1
CICERO V2
CLAIMREVIEW2024+
CommonsenseQA 2.0
Daily-Omni
Disagreement Set
EG-QA
Feverous
Hallusion Bench
Hover
MISBENCH
MMEval-Pro
MMVP
PIQA
POPE-A
POPE-P
POPE-R
QASC
RealWorldQA
SIQA
SWAG
Trivia QA
True-False
V-Star
VMCBench
5Pils-OOC
ADE
Adversarial GLUE
bAbI
BORDER-LINES
CALTECH-101
CIFAR-100
CIFAR10
CMM
Country-211
CRPE_R
DASH
Dolly (AC)
DTD
Euro SAT
FActScore
Flowers
Food
Geometry 3K
GTSRB
HQH
JudgeBench
LLMBar
LogicStruct
MATH-Vision
MathVerse
MM-AU
MM-Bench
MM-Vet
MMK12-Bio
MMK12-Chem
MMK12-Math
MMK12-Phys
MNIST
MNLI
MV-Bench
Natural Question
Pets
PopQA
Real-MM-RAG
RePOPE
SST-2
STL-10
SUN-397
True-False dataset
TruthfulQA MC1
VisuLogic
Wiki-C
Wiki-L
Wiki-S
(QA)
2Wiki-MultiHopQA
AbstainQA (MMLU)
AmbigQA
Athlete Sport
BioGEN
Book Author
CLAPNQ
CNN/Daily Mail
Company Founder
Company Headquarter
DA
ELI5-WebGPT
ExpertQA
FM2
FreshQA
GAIA
HaGRID
HaluEval-Summary
Hate Speech Ending
History of Science qa
JudgeAnything
JudgeLM val set
KUQ
LLaVA QA90
LogicStruct dataset
MENSA
MLLM-Judge
MWPs
NQ-Open
NQ-Swap
Official Language
PandaLM test set
POPE-MSCOCO
Proverb Ending
Proverb Translation
QAGS-CNNDM
QuoteSum
Real-World Benchmarks
SAMSum
SC
SCBench
SUM
VerifierBench
VerifyBench
Vizwiz
VLMBias
VQAv2-IDK
World Capital
XBench-DeepSearch
2WikiMQA
AlpacaFact
ASAP
ASDiv
chain dataset
ContextualJudgeBench
ContraDoc
FactCheckGPT
FACTOR
FAITH-M
FaithBench
Fava
FELM-Science
GSM8K+MathQA
HELM
KLAR
LongBench-Chat & LongBench
LongFact
MathQA
MediaSum
MeetingBank
MT-Bench
OOD Object
OOD Relation
POLITIFACT-HIDDEN
POPE-COCO
Strategy-QA
SummEval
SVAMP
TrendFact
Twitter
UnKEBench
Weibo
Wikibio-GPT3
2-hop HOVER
3-hop HOVER
3D-POPE
4-hop HOVER
ActivityNet-FOIL
AFaCTA
Alpaca-Judge
ARC
ASKHISTORIANSPIC
BingCheck
BoolQ
Ch-3
CHECKWHY
CheeseBurger
ClassEval
CMHE-HD
CommenseQA
COVID-19 Fake News Dataset
Ensemble Model + Heuristic Post-Processing
COVID-QA
DanFEVER
DanFEVER XLM-RoBERTa Large
DeepFact-Bench
DevEval
Eli5
ELI5PIC
En-3
ENTITYBIOSPIC
EX-FEVER
expert
EXPERTQAPIC
Fact-FOLX-KG
FactKG
FakeNewsDataset
FakeSV
FakeSVIM
FakeTT
FakeTTIM
FinanceBench
FOIL-COCO
FutureOmni
GossipCop
H-Bench
HalluQA
HaluEval2
KNIGHT-Judge
L-Bench
Latest News
LUDWIG, CIRCA
MC-Fake
MediaEval2016
MHaluBench
MM-COVID
MM-MISLEADING
MR2-en
MUSIC-AVQA
NORMBANK
NORMBANK, LUDWIG, CIRCA
NQ
OmniBench
Pheme
POPBIOS-CFPIC
POPBIOS-PPIC
PTSD
R^2-HalBench
ReCOVery
ScienceQA
Social media
TextRNN
SOCIALCHEM
SOCIALCHEM, LUDWIG, CIRCA
SOCIALCHEM, NORMBANK
sub-WikiBio
TripleCom
trivia
UltraChat
Weibo-21
Weibo NER
WikiBio
WIKICOLLIDE
WikiTQ
WIQA set consistency
Worldsense