Pith. sign in

Paper Citation Record · LEDGER

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking

As of 21 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2506.12538.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.12538 v1

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:51:47.218026Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:05:38.978358Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-06T18:05:39.131213Z

Reference resolution

51 of 51 outbound references displayed

  • verified exact4
  • verified fuzzy3
  • unresolved43
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1ebe1ed1-fe71-4da3-bdfd-4f1947a347ad · outbound

This paper cites GPT-4 Technical Report.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:45.401451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:45.401451Z digest=sha256:220860d8cfc0f2c335292e2c1ff148f1d0d19d66013ce425b37378faa8c6e698

Observation 4f5ff4f8-941e-43e8-9bd9-5a3c22785194 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.977780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:45.479689Z digest=sha256:f7d59bb82fd36510d0935a5569d3a28b98c5e84fba6422fb54fd473d21f6beef

Observation ed3e911e-6cd9-4d32-9fae-a0d4d30fb72e · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 3

Resolution
verified exact
doi, observed 2026-08-07T00:51:47.254570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:45.557953Z digest=sha256:66f1e299f8cf01b4376ad775d748190694ba2af0d315bee7b6e6fb68ff55f6ba

Observation a7b0e061-c952-46fd-8fed-3e2ee8fadd8b · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.965284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:45.670253Z digest=sha256:0188f1e0993ecb10c6dd3de5ae18d3f1d2ed300ed6628389f67673dfef02ff5c

Observation fecbfde6-64c8-4a5c-a74a-50763f2f8156 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.953616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:45.779526Z digest=sha256:5948bcd8976f4c4c725b092a53407e88fdeccfd91adc863669b407c07fe54aef

Observation 4a8178e1-aa29-4acf-b8d6-6a48295682d9 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.929114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:45.938535Z digest=sha256:36d007a16e31bde4e11f4ea6370a2503a645e74fd98df51cb770ef36645a0e43

Observation 03152f90-928d-4a02-92fb-20a726f0fc2a · outbound

This paper cites Qwen Technical Report.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Qwen Technical Report

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:46.022682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:46.022682Z digest=sha256:80656fa748fecf2132187be7ec2a2255cf977bf126139142e7b58078b036575c

Observation 4db6d88c-7dee-4e8a-8540-66d535483505 · outbound

This paper cites FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:51:47.589158Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:46.117806Z digest=sha256:345f600a7560bdbfcc75842746913057ad6428e44c76c39e0e581e20537375f0

Observation 7f4c8b79-16f6-4a57-8b36-7ffde87eebe9 · outbound

This paper cites Can LLMs Improve Multimodal Fact-Checking by Asking Relevant Questions?.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Can LLMs Improve Multimodal Fact-Checking by Asking Relevant Questions?

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:46.179013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:46.179013Z digest=sha256:7078e46595ece71ff326a29f6f1a230aa36aca715bf18554fcb220aecc1a3f4a

Observation 9effccd2-fcf4-47a0-b456-8353b6438c20 · outbound

This paper cites FacTool: Factuality Detection in Generative AI -- A Tool Augmented Framework for Multi-Task and Multi-Domain Scenarios.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking FacTool: Factuality Detection in Generative AI -- A Tool Augmented Framework for Multi-Task and Multi-Domain Scenarios

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:46.348549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:46.348549Z digest=sha256:4cccfb86dd776d3f52132dc674fce2c4dd6a7f2135bea7f908a2719554747567

Observation 01044271-72ea-43be-9808-46f3930ec56d · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.916925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:46.438506Z digest=sha256:5e98dbf4d390fc75198399e267004cc3ffb7cf023f3b7dbba05c5c6029507c49

Observation 8773e3da-a978-4d6e-809d-4078cd58bac6 · outbound

This paper cites 2025.Gemini 2.5 Flash Preview: Model Card.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking 2025.Gemini 2.5 Flash Preview: Model Card

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:51:47.905107Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:46.561997Z digest=sha256:f1525b1f9a60bedcc056db401042d0b5ca357b103f3dee1f8f2a0158ee921b15

Observation ba5495fc-d1f6-404f-9f5f-d8aacd23fc5e · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:46.695233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:46.695233Z digest=sha256:eb458d9a6f7b1f9a5fde5132ea95cec5e961866bbdae9c8e7c2e3073bcab4c19

Observation af39b30c-8488-4bb9-b6d7-11ec16d841e2 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.892774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:46.738709Z digest=sha256:0e0e705870db08a4102874077187b72f8f8eb929b29cb4763602aa9da69d2b0f

Observation e762a968-8aab-41e9-8631-9aac2b895e7c · outbound

This paper cites Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:51:47.470649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:46.873206Z digest=sha256:b491cbda34567e588be379407445c38ff2d70ea3db898e77297a918282db01d6

Observation db4837fb-4eb5-4022-a794-11af203f19c0 · outbound

This paper cites Do Large Language Models Know about Facts?.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Do Large Language Models Know about Facts?

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.036026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.036026Z digest=sha256:3d7725b590e8af4440c88354ede4e0a8ca5baf7da9068c5fb068243cbe206d0b

Observation 84ea9e25-994c-45d7-9015-adac41299a73 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.879634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.086938Z digest=sha256:8f2b720a3aa78a54f5b4be46fa0aaef93cb1bc9f251f6d36081c2856819dc2f4

Observation f610a3ac-c0fc-48d8-aac6-a4165239cd22 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.867371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.090894Z digest=sha256:4db8b0d86d37fa01d0a431a5cc7fa7d55f624a71c68934ffd505b619c0b72efa

Observation 917d0631-5793-4d33-90d9-0b2db20f746f · outbound

This paper cites HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.094995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.094995Z digest=sha256:c78c518c915575bd3cd91f9f7a72cb9df568c257e0ec0d114b2cd3412e3dfb5a

Observation 10f686e2-d920-4614-930e-dde8cc2174c3 · outbound

This paper cites Large Language Model Agent for Fake News Detection.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Large Language Model Agent for Fake News Detection

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.099248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.099248Z digest=sha256:d6d290f5fb3647dd3182d2cf5a8d2aa147fdb3855a130c58cf07050bf055bc4d

Observation ee039324-2d8b-4905-8b73-38aa1edaf1a8 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.854755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.103789Z digest=sha256:4ac3162aa6fc40023f0a91f8c4c48ef30fe3c7833d523e5c775680c44345c5c3

Observation 72406eee-512b-4b2c-aa2f-9e4a42c1586d · outbound

This paper cites FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.111948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.111948Z digest=sha256:1e2fdbfb9d728143a6a01aa6273b05ce4c858190cf8848892ce55bd8183ed2b8

Observation a4e661b3-2b1f-4456-b006-c615f13f0bd0 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.828711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.116051Z digest=sha256:2ad14c7f914e69a9a222601acfbf260788506f8b8fabf495535c48ebed219312

Observation 2ca970c1-5790-4c33-b1c0-b29899c8f10a · outbound

This paper cites DeepSeek-V3 Technical Report.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking DeepSeek-V3 Technical Report

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.120025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.120025Z digest=sha256:ccbb34d1bd6f7eb7f932441eea0cd20f4e719463bd3aa05f5c19dec761ac0e54

Observation fbff2460-3f35-417b-ba84-73776ce93e96 · outbound

This paper cites MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.124066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.124066Z digest=sha256:2089fcec6680179e656a7f516ebaec60557c507a80f3736723257c4c9772abde

Observation c9d81fe3-d0d6-4517-b34d-bb411f23b1da · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.815978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.127858Z digest=sha256:2fcae01da978d48eb22fc88824d29e8a3b8ced034ab5360e9acae0805b11c6cf

Observation 88d49459-49a6-49fd-8b71-fb02da16a45d · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.803707Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.131242Z digest=sha256:c31e9871ebd280e5fdac22b3607c3d09745f0d3df003f1c7fa823a65c8ed8b4f

Observation f3c83d7d-0a54-40b5-baf3-226ead4a6ad8 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.789962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.134820Z digest=sha256:14d06c5e274f809d0c9e4656cf1eb23a79e917d23ae672beb276de1efbc0fe21

Observation 7e05e39f-e9df-4fee-bd6c-80051ade0dfe · outbound

This paper cites FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.138804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.138804Z digest=sha256:62b8602e402942fbd5c9d84098f510f790525d730d03d75d74df407fd16131f1

Observation 6e6fed9c-f282-4d93-ba01-429ca1af880f · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.777377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.142614Z digest=sha256:a448eeb85f120106e967af65ab2ac68df3d64bd1fc04f59f7f0e7c83a326f801

Observation 5903a929-8588-481a-ac8d-c18c4c1d95e6 · outbound

This paper cites Fact-Checking Complex Claims with Program-Guided Reasoning.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Fact-Checking Complex Claims with Program-Guided Reasoning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.145817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.145817Z digest=sha256:b7772e77762cf00c0eab5a222bc20996007d4c1c61a74781fa304a1bfb57c6eb

Observation ee2ae949-e5a1-4ad1-a9b5-41827b4881e4 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.149801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.149801Z digest=sha256:f6e9bfc1c440f3e1d113d325eb913830c5201711d6e1c40d0fdcb128d6b0555f

Observation 5ea86b96-ac27-4a07-a49d-aa5c417f8cdb · outbound

This paper cites Exploring the Deceptive Power of LLM-Generated Fake News: A Study of Real-World Detection Challenges.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Exploring the Deceptive Power of LLM-Generated Fake News: A Study of Real-World Detection Challenges

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.153923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.153923Z digest=sha256:b8f8b2fc5f6d42cf6315a84805ccd28ea9031321dbd2e062b2281927fadf8bb5

Observation 642b8417-7f85-4486-99d0-fe5cbac9e395 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.157724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.157724Z digest=sha256:a738fb3cc15ba361cade39cd3330a9bca9624eef031c2caf71c857eec387fde5

Observation 39fadc18-64c3-4d2c-927f-ba34ab1e0838 · outbound

This paper cites Generative Large Language Models in Automated Fact-Checking: A Survey.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Generative Large Language Models in Automated Fact-Checking: A Survey

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.165377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.165377Z digest=sha256:fa733364c1a221b0061c8a6ef8f22a718b21495d3a5b5cd735ad57a4ba16de09

Observation a92184fa-c109-4484-af52-e2d653f3f284 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.748867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.169173Z digest=sha256:f5b2e7535ab3f32e9db36a9782a18d7752aeae1671ece34a2c336f47e3500d30

Observation 37945801-953c-4c50-92af-5f990f8ff8f5 · outbound

This paper cites MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.173316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.173316Z digest=sha256:8620e46c6437bb87239f62ca0a96445ee5708053ec26db3eacec8e732235f70f

Observation 4431c997-95cc-48d9-ae55-51ed4a4ee657 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.736387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.177142Z digest=sha256:5aa160f2f15d74e44b69e665893a2f7aa5136cc36bc414cf9aa585e036c0974a

Observation 89bd2d61-5881-4935-b719-bf0f7a1b9c9d · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.723399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.180630Z digest=sha256:4395f79b44a764fbe99215648d0774d9ad9a9edb81b0a15e68e4173cc1f88f63

Observation 1b197b68-f82b-41fa-9cc2-dac98002e09e · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.710452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.189473Z digest=sha256:ad5e0a555062b787d589b30afbb70139dd1d3021273df54e20d041e662634ed9

Observation 1d85d0e5-e388-4c72-83fa-14526e3f3203 · outbound

This paper cites TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:51:47.274723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.193268Z digest=sha256:fffe84d1a13e2cc7f12d3d90168dda485120657f9ed8fb17bee975e41d40ce74

Observation 55b1da68-1329-4b2c-9e49-16c209071c30 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.697284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.197380Z digest=sha256:fe0b552a957fdb352373420bb43db0f1a0dd6df8ffb52aad751ce306ce5fac15

Observation c2dcf01b-4e35-4276-95f5-0e034b3270a4 · outbound

This paper cites Long-form factuality in large language models.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Long-form factuality in large language models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.184863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.184863Z digest=sha256:76ad889d5b61140a35498f8d4f3293fa9e0fce40f64d6c5e8f0c76ed8146d2c3

Observation 18cbcaba-bdae-42d8-8590-20fcb4368dff · outbound

This paper cites evidence.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking evidence

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:51:47.670788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.205571Z digest=sha256:da673ae5dcc09d1b1c8890913b52350b73917529cce172a2b7a36831c1581f18

Observation e1b56da4-bb4f-4d8c-836d-13dca2e299f2 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 49

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.657527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.209655Z digest=sha256:03d656d08ea69b4c33cab84885676758b261f685d9908af70b5f9d3b61db0651

Observation 70b84f8e-3b88-40c4-9cc7-963e2c335519 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.643427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.213694Z digest=sha256:0fbc21c9b5cb8427cdde85c2186ff7312a2b116a504d16b6c89eb79791778033

Observation 1f61ce84-a089-40df-a453-a816ff074c51 · outbound

This paper cites score":.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking score":

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:51:47.629772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.218026Z digest=sha256:cb2557bdcb570a8ede8177e4f654f5a8b4f6558a16ca6a42cea188c934a98200

Observation b8f259b8-967c-4317-8271-57f9938daa2a · outbound

This paper cites FEVER: a large-scale dataset for Fact Extraction and VERification.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking FEVER: a large-scale dataset for Fact Extraction and VERification

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-07T00:51:47.161514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:51:47.161514Z digest=sha256:7fee66092bc3d3f21f0b8a5683a53e1d3035c140df163817d6d61f7453a17c5e

Observation 224e85fe-de3e-4af1-85d4-b18479babf27 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 2022

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.941546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:45.872346Z digest=sha256:62236c1069e15615055370b5ffddc00fa82c1b8112b42500f09ac150b60537c1

Observation 4fd1cae4-7959-454d-ab18-00f0f4dc4a2a · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 2023

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:51:47.683974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.201906Z digest=sha256:b700cd54b7297f1cfa8b6e06c6d409016cdefaa76986a6535e2a5b6b0ffca9a6

Observation 60f0bdc5-daa9-4dd0-bb8a-309591832c35 · outbound

This paper cites an unresolved cited work.

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking Unresolved cited work

Reference 2024

Resolution
parse uncertain
raw_fallback, observed 2026-08-07T00:51:47.841853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T00:51:47.107920Z digest=sha256:02bc9650f6a2302a167b2d0b0fc1058fe3bb3d9633632071f0a7ca7cb1ab2d32

Pith citing papers

Observation 1b0e443b-8ea8-47b9-9062-b65c83b5b731 · inbound

RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking cites this paper.

RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking

Reference 61

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:05:39.139377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:05:38.978358Z digest=sha256:cdf3f6a26d224810002c395f75db9fba1503d76d59ceece8b3b90d19d3336f7c