{"as_of":"2026-08-21T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b7c064374b6ce59b5dc5b3c785a914fb446254524ebf2f372518f48abed20ba","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:51:47.218026Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:05:38.978358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:05:39.131213Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"cited_work":{"arxiv_id":"2506.12538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12538","snapshot_observed_at":"2026-08-06T18:05:39.131213Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","venue":"cs.CL","work_id":"59eeda3e-53ca-4673-86f7-4edfd4a4b896","year":2025},"citing_paper":{"arxiv_id":"2507.09174","last_updated":"2025-07-12T07:46:51Z","snapshot_observed_at":"2026-08-18T03:04:32.463903Z","submitted_at":"2025-07-12T07:46:51Z","title":"RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:05:38.978358Z"},"links":{"cited_paper":"/paper/2506.12538","citing_paper":"/paper/2507.09174"},"observation_digest":"sha256:cdf3f6a26d224810002c395f75db9fba1503d76d59ceece8b3b90d19d3336f7c","observation_id":"1b0e443b-8ea8-47b9-9062-b65c83b5b731","resolution":{"observed_at":"2026-08-06T18:05:39.139377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12538/citation-record","integrity":"/paper/2506.12538/integrity","json":"/paper/2506.12538/citation-record.json","paper":"/paper/2506.12538"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:51:45.401451Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.401451Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:220860d8cfc0f2c335292e2c1ff148f1d0d19d66013ce425b37378faa8c6e698","observation_id":"1ebe1ed1-fe71-4da3-bdfd-4f1947a347ad","resolution":{"observed_at":"2026-08-07T00:51:45.401451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.973763Z","title":null,"venue":null,"work_id":"9f11e4cd-7a5e-421f-a21c-42f51a78a125","year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.479689Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:f7d59bb82fd36510d0935a5569d3a28b98c5e84fba6422fb54fd473d21f6beef","observation_id":"4f5ff4f8-941e-43e8-9bd9-5a3c22785194","resolution":{"observed_at":"2026-08-07T00:51:47.977780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i12.26648","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"577cbab7-48d2-4ac8-beff-b36b84e8057e","year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.557953Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:66f1e299f8cf01b4376ad775d748190694ba2af0d315bee7b6e6fb68ff55f6ba","observation_id":"ed3e911e-6cd9-4d32-9fae-a0d4d30fb72e","resolution":{"observed_at":"2026-08-07T00:51:47.254570Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.961774Z","title":null,"venue":null,"work_id":"f4e860d1-58ed-4133-a795-7481ce1e7883","year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.670253Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:0188f1e0993ecb10c6dd3de5ae18d3f1d2ed300ed6628389f67673dfef02ff5c","observation_id":"a7b0e061-c952-46fd-8fed-3e2ee8fadd8b","resolution":{"observed_at":"2026-08-07T00:51:47.965284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.949509Z","title":null,"venue":null,"work_id":"70138bd2-d1ee-4b69-85da-b6e410f2aede","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.779526Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:5948bcd8976f4c4c725b092a53407e88fdeccfd91adc863669b407c07fe54aef","observation_id":"fecbfde6-64c8-4a5c-a74a-50763f2f8156","resolution":{"observed_at":"2026-08-07T00:51:47.953616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.925402Z","title":null,"venue":null,"work_id":"53f0d156-2cff-4338-89f9-6b3b72e4703d","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.938535Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:36d007a16e31bde4e11f4ea6370a2503a645e74fd98df51cb770ef36645a0e43","observation_id":"4a8178e1-aa29-4acf-b8d6-6a48295682d9","resolution":{"observed_at":"2026-08-07T00:51:47.929114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T00:51:46.022682Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.022682Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:80656fa748fecf2132187be7ec2a2255cf977bf126139142e7b58078b036575c","observation_id":"03152f90-928d-4a02-92fb-20a726f0fc2a","resolution":{"observed_at":"2026-08-07T00:51:46.022682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22257","last_updated":"2025-01-08T02:33:39Z","snapshot_observed_at":"2026-08-16T13:04:52.570486Z","submitted_at":"2024-10-29T17:19:56Z","title":"FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation","version":2},"cited_work":{"arxiv_id":"2410.22257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22257","snapshot_observed_at":"2026-08-07T00:51:47.584738Z","title":"FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation","venue":"cs.CL","work_id":"8b326284-2aaf-4da6-bca7-492be6794649","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.117806Z"},"links":{"cited_paper":"/paper/2410.22257","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:345f600a7560bdbfcc75842746913057ad6428e44c76c39e0e581e20537375f0","observation_id":"4db6d88c-7dee-4e8a-8540-66d535483505","resolution":{"observed_at":"2026-08-07T00:51:47.589158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04616","last_updated":"2025-02-20T21:34:03Z","snapshot_observed_at":"2026-08-16T14:42:33.329124Z","submitted_at":"2024-10-06T20:33:22Z","title":"Can LLMs Improve Multimodal Fact-Checking by Asking Relevant Questions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04616","snapshot_observed_at":"2026-08-07T00:51:46.179013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.179013Z"},"links":{"cited_paper":"/paper/2410.04616","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:7078e46595ece71ff326a29f6f1a230aa36aca715bf18554fcb220aecc1a3f4a","observation_id":"7f4c8b79-16f6-4a57-8b36-7ffde87eebe9","resolution":{"observed_at":"2026-08-07T00:51:46.179013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13528","last_updated":"2023-07-26T15:17:49Z","snapshot_observed_at":"2026-08-20T12:00:54.415406Z","submitted_at":"2023-07-25T14:20:51Z","title":"FacTool: Factuality Detection in Generative AI -- A Tool Augmented Framework for Multi-Task and Multi-Domain Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13528","snapshot_observed_at":"2026-08-07T00:51:46.348549Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.348549Z"},"links":{"cited_paper":"/paper/2307.13528","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:4cccfb86dd776d3f52132dc674fce2c4dd6a7f2135bea7f908a2719554747567","observation_id":"9effccd2-fcf4-47a0-b456-8353b6438c20","resolution":{"observed_at":"2026-08-07T00:51:46.348549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.913294Z","title":null,"venue":null,"work_id":"bf80ac4a-1255-4037-b021-d494eaa5160e","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.438506Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:5e98dbf4d390fc75198399e267004cc3ffb7cf023f3b7dbba05c5c6029507c49","observation_id":"01044271-72ea-43be-9808-46f3930ec56d","resolution":{"observed_at":"2026-08-07T00:51:47.916925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.901306Z","title":"2025.Gemini 2.5 Flash Preview: Model Card","venue":null,"work_id":"aec1468c-f6f1-4e46-bad4-a42be3b4579f","year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.561997Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:f1525b1f9a60bedcc056db401042d0b5ca357b103f3dee1f8f2a0158ee921b15","observation_id":"8773e3da-a978-4d6e-809d-4078cd58bac6","resolution":{"observed_at":"2026-08-07T00:51:47.905107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:46.695233Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.695233Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:eb458d9a6f7b1f9a5fde5132ea95cec5e961866bbdae9c8e7c2e3073bcab4c19","observation_id":"ba5495fc-d1f6-404f-9f5f-d8aacd23fc5e","resolution":{"observed_at":"2026-08-07T00:51:46.695233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.888372Z","title":null,"venue":null,"work_id":"66480785-2174-4918-a69d-d1a154412ac5","year":2022},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.738709Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:0e0e705870db08a4102874077187b72f8f8eb929b29cb4763602aa9da69d2b0f","observation_id":"af39b30c-8488-4bb9-b6d7-11ec16d841e2","resolution":{"observed_at":"2026-08-07T00:51:47.892774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.09036","last_updated":"2021-04-21T18:06:11Z","snapshot_observed_at":"2026-08-09T15:46:35.797078Z","submitted_at":"2020-08-20T15:39:36Z","title":"Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries","version":2},"cited_work":{"arxiv_id":"2008.09036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.09036","snapshot_observed_at":"2026-08-07T00:51:47.466251Z","title":"Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries","venue":"cs.CL","work_id":"d6b4283f-a3b2-4c92-8caf-0df1b51d6c94","year":2020},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:46.873206Z"},"links":{"cited_paper":"/paper/2008.09036","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:b491cbda34567e588be379407445c38ff2d70ea3db898e77297a918282db01d6","observation_id":"e762a968-8aab-41e9-8631-9aac2b895e7c","resolution":{"observed_at":"2026-08-07T00:51:47.470649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05177","last_updated":"2023-10-08T14:26:55Z","snapshot_observed_at":"2026-08-21T08:27:11.106470Z","submitted_at":"2023-10-08T14:26:55Z","title":"Do Large Language Models Know about Facts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05177","snapshot_observed_at":"2026-08-07T00:51:47.036026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.036026Z"},"links":{"cited_paper":"/paper/2310.05177","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:3d7725b590e8af4440c88354ede4e0a8ca5baf7da9068c5fb068243cbe206d0b","observation_id":"db4837fb-4eb5-4022-a794-11af203f19c0","resolution":{"observed_at":"2026-08-07T00:51:47.036026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.875910Z","title":null,"venue":null,"work_id":"4974e0c4-e15b-4686-bce4-a961b24c74dd","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.086938Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:8f2b720a3aa78a54f5b4be46fa0aaef93cb1bc9f251f6d36081c2856819dc2f4","observation_id":"84ea9e25-994c-45d7-9015-adac41299a73","resolution":{"observed_at":"2026-08-07T00:51:47.879634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.863678Z","title":null,"venue":null,"work_id":"03de5f9a-6233-4fc3-aef6-eeff8d1c9a5e","year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.090894Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:4db8b0d86d37fa01d0a431a5cc7fa7d55f624a71c68934ffd505b619c0b72efa","observation_id":"f610a3ac-c0fc-48d8-aac6-a4165239cd22","resolution":{"observed_at":"2026-08-07T00:51:47.867371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11747","last_updated":"2023-10-23T01:49:32Z","snapshot_observed_at":"2026-08-19T06:07:46.029387Z","submitted_at":"2023-05-19T15:36:27Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11747","snapshot_observed_at":"2026-08-07T00:51:47.094995Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.094995Z"},"links":{"cited_paper":"/paper/2305.11747","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:c78c518c915575bd3cd91f9f7a72cb9df568c257e0ec0d114b2cd3412e3dfb5a","observation_id":"917d0631-5793-4d33-90d9-0b2db20f746f","resolution":{"observed_at":"2026-08-07T00:51:47.094995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01593","last_updated":"2024-04-30T06:55:27Z","snapshot_observed_at":"2026-08-17T03:50:43.564193Z","submitted_at":"2024-04-30T06:55:27Z","title":"Large Language Model Agent for Fake News Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01593","snapshot_observed_at":"2026-08-07T00:51:47.099248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.099248Z"},"links":{"cited_paper":"/paper/2405.01593","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:d6d290f5fb3647dd3182d2cf5a8d2aa147fdb3855a130c58cf07050bf055bc4d","observation_id":"10f686e2-d920-4614-930e-dde8cc2174c3","resolution":{"observed_at":"2026-08-07T00:51:47.099248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.850527Z","title":null,"venue":null,"work_id":"37f76082-49d9-424b-81d8-bdab07d67c7e","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.103789Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:4ac3162aa6fc40023f0a91f8c4c48ef30fe3c7833d523e5c775680c44345c5c3","observation_id":"ee039324-2d8b-4905-8b73-38aa1edaf1a8","resolution":{"observed_at":"2026-08-07T00:51:47.854755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17924","last_updated":"2025-03-02T06:46:48Z","snapshot_observed_at":"2026-08-18T16:52:05.648668Z","submitted_at":"2025-02-25T07:44:22Z","title":"FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17924","snapshot_observed_at":"2026-08-07T00:51:47.111948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.111948Z"},"links":{"cited_paper":"/paper/2502.17924","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:1e2fdbfb9d728143a6a01aa6273b05ce4c858190cf8848892ce55bd8183ed2b8","observation_id":"72406eee-512b-4b2c-aa2f-9e4a42c1586d","resolution":{"observed_at":"2026-08-07T00:51:47.111948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.824991Z","title":null,"venue":null,"work_id":"280652ea-01a7-4f4e-8633-6d0f93666089","year":2022},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.116051Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:2ad14c7f914e69a9a222601acfbf260788506f8b8fabf495535c48ebed219312","observation_id":"a4e661b3-2b1f-4456-b006-c615f13f0bd0","resolution":{"observed_at":"2026-08-07T00:51:47.828711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:51:47.120025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.120025Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:ccbb34d1bd6f7eb7f932441eea0cd20f4e719463bd3aa05f5c19dec761ac0e54","observation_id":"2ca970c1-5790-4c33-b1c0-b29899c8f10a","resolution":{"observed_at":"2026-08-07T00:51:47.120025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08772","last_updated":"2025-02-27T03:19:48Z","snapshot_observed_at":"2026-08-16T13:43:30.667941Z","submitted_at":"2024-06-13T03:04:28Z","title":"MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08772","snapshot_observed_at":"2026-08-07T00:51:47.124066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.124066Z"},"links":{"cited_paper":"/paper/2406.08772","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:2089fcec6680179e656a7f516ebaec60557c507a80f3736723257c4c9772abde","observation_id":"fbff2460-3f35-417b-ba84-73776ce93e96","resolution":{"observed_at":"2026-08-07T00:51:47.124066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.812341Z","title":null,"venue":null,"work_id":"39509c8a-eadc-4497-92d5-0452510f4bae","year":2025},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.127858Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:2fcae01da978d48eb22fc88824d29e8a3b8ced034ab5360e9acae0805b11c6cf","observation_id":"c9d81fe3-d0d6-4517-b34d-bb411f23b1da","resolution":{"observed_at":"2026-08-07T00:51:47.815978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.799372Z","title":null,"venue":null,"work_id":"edd84243-4554-4f1c-adf7-1cdd0c00c67c","year":2020},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.131242Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:c31e9871ebd280e5fdac22b3607c3d09745f0d3df003f1c7fa823a65c8ed8b4f","observation_id":"88d49459-49a6-49fd-8b71-fb02da16a45d","resolution":{"observed_at":"2026-08-07T00:51:47.803707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.785940Z","title":null,"venue":null,"work_id":"29baf803-64c5-4df9-9239-6d6d7e6ca7f0","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.134820Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:14d06c5e274f809d0c9e4656cf1eb23a79e917d23ae672beb276de1efbc0fe21","observation_id":"f3c83d7d-0a54-40b5-baf3-226ead4a6ad8","resolution":{"observed_at":"2026-08-07T00:51:47.789962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14251","last_updated":"2023-10-11T05:27:50Z","snapshot_observed_at":"2026-08-19T19:54:57.212265Z","submitted_at":"2023-05-23T17:06:00Z","title":"FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14251","snapshot_observed_at":"2026-08-07T00:51:47.138804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.138804Z"},"links":{"cited_paper":"/paper/2305.14251","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:62b8602e402942fbd5c9d84098f510f790525d730d03d75d74df407fd16131f1","observation_id":"7e05e39f-e9df-4fee-bd6c-80051ade0dfe","resolution":{"observed_at":"2026-08-07T00:51:47.138804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.773816Z","title":null,"venue":null,"work_id":"6ec63b1c-c456-46b3-aa6f-92832e2d0d4c","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.142614Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:a448eeb85f120106e967af65ab2ac68df3d64bd1fc04f59f7f0e7c83a326f801","observation_id":"6e6fed9c-f282-4d93-ba01-429ca1af880f","resolution":{"observed_at":"2026-08-07T00:51:47.777377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12744","last_updated":"2023-05-22T06:11:15Z","snapshot_observed_at":"2026-08-21T04:23:45.568438Z","submitted_at":"2023-05-22T06:11:15Z","title":"Fact-Checking Complex Claims with Program-Guided Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12744","snapshot_observed_at":"2026-08-07T00:51:47.145817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.145817Z"},"links":{"cited_paper":"/paper/2305.12744","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:b7772e77762cf00c0eab5a222bc20996007d4c1c61a74781fa304a1bfb57c6eb","observation_id":"5903a929-8588-481a-ac8d-c18c4c1d95e6","resolution":{"observed_at":"2026-08-07T00:51:47.145817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.149801Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.149801Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:f6e9bfc1c440f3e1d113d325eb913830c5201711d6e1c40d0fdcb128d6b0555f","observation_id":"ee2ae949-e5a1-4ad1-a9b5-41827b4881e4","resolution":{"observed_at":"2026-08-07T00:51:47.149801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18249","last_updated":"2024-04-08T19:55:37Z","snapshot_observed_at":"2026-08-21T22:48:20.897461Z","submitted_at":"2024-03-27T04:39:18Z","title":"Exploring the Deceptive Power of LLM-Generated Fake News: A Study of Real-World Detection Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18249","snapshot_observed_at":"2026-08-07T00:51:47.153923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.153923Z"},"links":{"cited_paper":"/paper/2403.18249","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:1ecaa3ce1476381471dd8b4c5608930d3b73e7fe685a608b89490a5c6799a262","observation_id":"5ea86b96-ac27-4a07-a49d-aa5c417f8cdb","resolution":{"observed_at":"2026-08-07T00:51:47.153923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.157724Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.157724Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:a738fb3cc15ba361cade39cd3330a9bca9624eef031c2caf71c857eec387fde5","observation_id":"642b8417-7f85-4486-99d0-fe5cbac9e395","resolution":{"observed_at":"2026-08-07T00:51:47.157724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02351","last_updated":"2026-06-29T08:12:53Z","snapshot_observed_at":"2026-08-16T13:37:42.377692Z","submitted_at":"2024-07-02T15:16:46Z","title":"Generative Large Language Models in Automated Fact-Checking: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02351","snapshot_observed_at":"2026-08-07T00:51:47.165377Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.165377Z"},"links":{"cited_paper":"/paper/2407.02351","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:fa733364c1a221b0061c8a6ef8f22a718b21495d3a5b5cd735ad57a4ba16de09","observation_id":"39fadc18-64c3-4d2c-927f-ba34ab1e0838","resolution":{"observed_at":"2026-08-07T00:51:47.165377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.744749Z","title":null,"venue":null,"work_id":"ba82d483-d02e-40ad-a47b-cf0e35d02ec7","year":2020},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.169173Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:f5b2e7535ab3f32e9db36a9782a18d7752aeae1671ece34a2c336f47e3500d30","observation_id":"a92184fa-c109-4484-af52-e2d653f3f284","resolution":{"observed_at":"2026-08-07T00:51:47.748867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11288","last_updated":"2025-02-17T02:00:52Z","snapshot_observed_at":"2026-08-19T11:36:40.940804Z","submitted_at":"2024-06-17T07:51:44Z","title":"MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11288","snapshot_observed_at":"2026-08-07T00:51:47.173316Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.173316Z"},"links":{"cited_paper":"/paper/2406.11288","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:8620e46c6437bb87239f62ca0a96445ee5708053ec26db3eacec8e732235f70f","observation_id":"37945801-953c-4c50-92af-5f990f8ff8f5","resolution":{"observed_at":"2026-08-07T00:51:47.173316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.732525Z","title":null,"venue":null,"work_id":"e201a7aa-5f95-4e09-98d0-ef93d24ca376","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.177142Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:5aa160f2f15d74e44b69e665893a2f7aa5136cc36bc414cf9aa585e036c0974a","observation_id":"4431c997-95cc-48d9-ae55-51ed4a4ee657","resolution":{"observed_at":"2026-08-07T00:51:47.736387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.718950Z","title":null,"venue":null,"work_id":"1d352c6e-0eb9-484b-a08f-ed779b02a0fa","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.180630Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:4395f79b44a764fbe99215648d0774d9ad9a9edb81b0a15e68e4173cc1f88f63","observation_id":"89bd2d61-5881-4935-b719-bf0f7a1b9c9d","resolution":{"observed_at":"2026-08-07T00:51:47.723399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.706498Z","title":null,"venue":null,"work_id":"6b9c070e-ba16-4008-833d-295a39e7388b","year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.189473Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:ad5e0a555062b787d589b30afbb70139dd1d3021273df54e20d041e662634ed9","observation_id":"1b197b68-f82b-41fa-9cc2-dac98002e09e","resolution":{"observed_at":"2026-08-07T00:51:47.710452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15135","last_updated":"2026-07-04T08:27:00Z","snapshot_observed_at":"2026-08-16T13:07:46.914882Z","submitted_at":"2024-10-19T15:25:19Z","title":"TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking","version":5},"cited_work":{"arxiv_id":"2410.15135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.15135","snapshot_observed_at":"2026-08-07T00:51:47.269232Z","title":"TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking","venue":"cs.CL","work_id":"d004495e-ae89-4c4f-94b3-c617c4352cd1","year":2024},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.193268Z"},"links":{"cited_paper":"/paper/2410.15135","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:fffe84d1a13e2cc7f12d3d90168dda485120657f9ed8fb17bee975e41d40ce74","observation_id":"1d85d0e5-e388-4c72-83fa-14526e3f3203","resolution":{"observed_at":"2026-08-07T00:51:47.274723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.693179Z","title":null,"venue":null,"work_id":"af8c4b08-684c-46fa-9c58-f6a0cc14c31e","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.197380Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:fe0b552a957fdb352373420bb43db0f1a0dd6df8ffb52aad751ce306ce5fac15","observation_id":"55b1da68-1329-4b2c-9e49-16c209071c30","resolution":{"observed_at":"2026-08-07T00:51:47.697284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18802","last_updated":"2024-11-07T03:14:38Z","snapshot_observed_at":"2026-08-19T15:09:21.692133Z","submitted_at":"2024-03-27T17:48:55Z","title":"Long-form factuality in large language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18802","snapshot_observed_at":"2026-08-07T00:51:47.184863Z","title":"arXiv:2403.18802 [cs.CL] https://arxiv.org/abs/2403.18802","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.184863Z"},"links":{"cited_paper":"/paper/2403.18802","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:76ad889d5b61140a35498f8d4f3293fa9e0fce40f64d6c5e8f0c76ed8146d2c3","observation_id":"c2dcf01b-4e35-4276-95f5-0e034b3270a4","resolution":{"observed_at":"2026-08-07T00:51:47.184863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.666994Z","title":"evidence","venue":null,"work_id":"8b89471a-94e3-4a6b-8954-84c75dc28f9a","year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.205571Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:da673ae5dcc09d1b1c8890913b52350b73917529cce172a2b7a36831c1581f18","observation_id":"18cbcaba-bdae-42d8-8590-20fcb4368dff","resolution":{"observed_at":"2026-08-07T00:51:47.670788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.652693Z","title":null,"venue":null,"work_id":"0a188e4c-a315-41a6-84a2-290b37421f27","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.209655Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:03d656d08ea69b4c33cab84885676758b261f685d9908af70b5f9d3b61db0651","observation_id":"e1b56da4-bb4f-4d8c-836d-13dca2e299f2","resolution":{"observed_at":"2026-08-07T00:51:47.657527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.639275Z","title":null,"venue":null,"work_id":"1329b037-249b-45d6-b53a-5864a4786dab","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.213694Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:0fbc21c9b5cb8427cdde85c2186ff7312a2b116a504d16b6c89eb79791778033","observation_id":"70b84f8e-3b88-40c4-9cc7-963e2c335519","resolution":{"observed_at":"2026-08-07T00:51:47.643427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.625376Z","title":"score\":","venue":null,"work_id":"ac31936a-1029-4447-b47a-57c3d64dc724","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.218026Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:cb2557bdcb570a8ede8177e4f654f5a8b4f6558a16ca6a42cea188c934a98200","observation_id":"1f61ce84-a089-40df-a453-a816ff074c51","resolution":{"observed_at":"2026-08-07T00:51:47.629772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05355","last_updated":"2018-12-18T10:58:20Z","snapshot_observed_at":"2026-08-20T03:41:32.061428Z","submitted_at":"2018-03-14T15:30:37Z","title":"FEVER: a large-scale dataset for Fact Extraction and VERification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05355","snapshot_observed_at":"2026-08-07T00:51:47.161514Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.161514Z"},"links":{"cited_paper":"/paper/1803.05355","citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:7fee66092bc3d3f21f0b8a5683a53e1d3035c140df163817d6d61f7453a17c5e","observation_id":"b8f259b8-967c-4317-8271-57f9938daa2a","resolution":{"observed_at":"2026-08-07T00:51:47.161514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.937864Z","title":null,"venue":null,"work_id":"c545aaa5-b6fc-4264-9c04-78a5f5d517c8","year":2022},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:45.872346Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:62236c1069e15615055370b5ffddc00fa82c1b8112b42500f09ac150b60537c1","observation_id":"224e85fe-de3e-4af1-85d4-b18479babf27","resolution":{"observed_at":"2026-08-07T00:51:47.941546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.680165Z","title":null,"venue":null,"work_id":"0d9c6124-7fa5-442f-bebb-665eadbe4283","year":2023},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.201906Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:b700cd54b7297f1cfa8b6e06c6d409016cdefaa76986a6535e2a5b6b0ffca9a6","observation_id":"4fd1cae4-7959-454d-ab18-00f0f4dc4a2a","resolution":{"observed_at":"2026-08-07T00:51:47.683974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:47.838168Z","title":null,"venue":null,"work_id":"ddc1d54b-6763-41da-95aa-baa9f29175bc","year":null},"citing_paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:47.107920Z"},"links":{"citing_paper":"/paper/2506.12538"},"observation_digest":"sha256:02bc9650f6a2302a167b2d0b0fc1058fe3bb3d9633632071f0a7ca7cb1ab2d32","observation_id":"60f0bdc5-daa9-4dd0-bb8a-309591832c35","resolution":{"observed_at":"2026-08-07T00:51:47.841853Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12538","last_updated":"2025-06-14T15:27:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T16:54:28.804697Z","submitted_at":"2025-06-14T15:27:44Z","title":"RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":43,"verified_exact":4,"verified_fuzzy":3},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2506.12538."}