{"as_of":"2026-08-18T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3945884667a9323fcf577ca8007f30832e756a1db0265bef0fce38e88719d18","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:44:36.534742Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:52:50.299350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T18:57:16.598004Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-06T10:52:50.299350Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23407","last_updated":"2025-07-31T10:27:48Z","snapshot_observed_at":"2026-08-16T08:30:32.806545Z","submitted_at":"2025-07-31T10:27:48Z","title":"Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T10:52:50.299350Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2507.23407"},"observation_digest":"sha256:2ebaa05b0da4dda99e23b38bb1985c6e5a9ca541c4f354c676ef14a403fd332b","observation_id":"f96d3bbd-0892-49ad-9c12-ce012dde8f0d","resolution":{"observed_at":"2026-08-06T10:52:50.299350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-05T10:39:03.113610Z","title":"The Hallucination Tax of Reinforcement Finetuning.arXiv preprint arXiv:2505.13988, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.113610Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:4b576216beea97ca5c66d1c9db8963d55f495841cbee9c6b1f4c89c02cdef17d","observation_id":"d1ed60c3-31ad-4d33-8b55-7c3267e55276","resolution":{"observed_at":"2026-08-05T10:39:03.113610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2601.21257","last_updated":"2026-04-19T21:04:27Z","snapshot_observed_at":"2026-08-11T02:55:47.386292Z","submitted_at":"2026-01-29T04:36:52Z","title":"MoCo: A One-Stop Shop for Model Collaboration Research","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T10:17:37.129753Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2601.21257"},"observation_digest":"sha256:5bc984fb5a81ad0d499d39d83357d3b0d29209e5a0bedc25ae99233ae4ff4af7","observation_id":"1d18fcaa-1364-4c4f-9724-4d6f3d7debac","resolution":{"observed_at":"2026-05-16T10:17:43.795988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-15T01:50:12.462125Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:a30d195321e03e0a3f15ab8f152d6c5fba7a2e730fef93f44d0195510cc38ec1","observation_id":"7a4542a9-ef81-404b-97c1-25a1b7813634","resolution":{"observed_at":"2026-05-12T10:21:29.704183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-15T01:50:12.462125Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:131724007eb64ceaef8b545aa68b6e20b45e704b7e8dc62f764ec3d1267046b0","observation_id":"92e46cd5-8b6e-4d71-83a9-2633117e1cc6","resolution":{"observed_at":"2026-05-11T22:11:16.560735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-15T01:50:12.462125Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:a261b07ec023897405e16f923acdd7864e8c7a71aeb78d2badf5c16909cab6e8","observation_id":"1686a16f-1bbe-407e-b0bd-10c6fe6c2dc3","resolution":{"observed_at":"2026-05-19T17:02:40.737194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2605.28070","last_updated":"2026-05-27T07:28:25Z","snapshot_observed_at":"2026-08-03T11:47:22.689668Z","submitted_at":"2026-05-27T07:28:25Z","title":"Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T12:37:16.138816Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2605.28070"},"observation_digest":"sha256:2ff231fe37d7b579fe56a11b3647b0c7dfc0293cdf432f3fc89d76daa06ee673","observation_id":"d9620be2-8cc6-45fd-88ce-ff858571b6e4","resolution":{"observed_at":"2026-06-29T12:43:25.821929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2606.07812","last_updated":"2026-06-05T19:39:35Z","snapshot_observed_at":"2026-08-16T00:44:28.545690Z","submitted_at":"2026-06-05T19:39:35Z","title":"Scaling Participation in Modular AI Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T21:49:27.042616Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2606.07812"},"observation_digest":"sha256:c200f3ead9c9121813548fd2b12cae221ff18594a32e593b1f0048058fd4c54e","observation_id":"74983e86-3310-4efc-aab7-7357ede6e45f","resolution":{"observed_at":"2026-07-02T18:57:16.599301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-01T17:30:40.711089Z","title":"The hallucination tax of reinforcement finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17621","last_updated":"2026-07-20T07:17:50Z","snapshot_observed_at":"2026-08-07T22:58:38.461590Z","submitted_at":"2026-07-20T07:17:50Z","title":"Mechanistic Attention Guidance for Agent Memory Refinement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:30:40.711089Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2607.17621"},"observation_digest":"sha256:794dce5b2bfc6877c596aff070db92ea31877712ce4bee045758482c180d7f31","observation_id":"a0a77b3d-b3f9-4a9d-8d75-9ebe41e5c81a","resolution":{"observed_at":"2026-08-01T17:30:40.711089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13988/citation-record","integrity":"/paper/2505.13988/integrity","json":"/paper/2505.13988/citation-record.json","paper":"/paper/2505.13988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:29.905006Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:29.905006Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:a0a80c5357f6d226ed8ff51abca6c8e14e385d16bf653285726698278110a6c1","observation_id":"ee8a17e6-6a68-4f1f-a790-a77f4d267511","resolution":{"observed_at":"2026-08-07T15:44:29.905006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:30.081158Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.081158Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:b88ea5b1c9a16c0e82d79c869ca0a62ec5a5bd1a90b452fc95cd3da1c0cec8f2","observation_id":"1bd65997-4777-4fe7-9e09-495e03bcfbc3","resolution":{"observed_at":"2026-08-07T15:44:30.081158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-12T04:56:27.232647Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T15:44:30.194934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.194934Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:55dc6d0df9209481b77973a0ba6db6c26af2b70dcbbbf78ced2b6744fdc9dc51","observation_id":"995a819f-5fbc-4bb5-90c7-4cf4c8a0ac33","resolution":{"observed_at":"2026-08-07T15:44:30.194934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17550","last_updated":"2025-04-24T13:40:27Z","snapshot_observed_at":"2026-08-16T10:35:07.542501Z","submitted_at":"2025-04-24T13:40:27Z","title":"HalluLens: LLM Hallucination Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17550","snapshot_observed_at":"2026-08-07T15:44:30.304843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.304843Z"},"links":{"cited_paper":"/paper/2504.17550","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:9b1a024f179bdadd7d15a3fc9c86f8fdd28de13762ad52f5d79a8e3c5cb39d5d","observation_id":"6c6d2e74-fa0b-4a8b-bb16-c419cb0eefa0","resolution":{"observed_at":"2026-08-07T15:44:30.304843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:30.416483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.416483Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:888052690727bde55edd86458b6fac2155d48e82f93bc003941e1507360a3338","observation_id":"24326b6b-640a-4b9a-abe6-962ebb645b7e","resolution":{"observed_at":"2026-08-07T15:44:30.416483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03631","last_updated":"2024-10-16T19:35:55Z","snapshot_observed_at":"2026-08-16T14:37:05.711864Z","submitted_at":"2023-12-06T17:28:03Z","title":"Mitigating Open-Vocabulary Caption Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03631","snapshot_observed_at":"2026-08-07T15:44:30.575619Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.575619Z"},"links":{"cited_paper":"/paper/2312.03631","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:a18171d456da80b29a93010882ed4a01c940bf327b625e1ec21dd913d953582b","observation_id":"5c1703b3-86d1-46ea-9da9-93516346b420","resolution":{"observed_at":"2026-08-07T15:44:30.575619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03368","last_updated":"2023-10-25T07:49:37Z","snapshot_observed_at":"2026-08-16T16:17:38.527206Z","submitted_at":"2023-10-05T07:57:09Z","title":"Evaluating Hallucinations in Chinese Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03368","snapshot_observed_at":"2026-08-07T15:44:30.675099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.675099Z"},"links":{"cited_paper":"/paper/2310.03368","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:2727668c14fa51e88dec4418dbeb0a77b8c1dc9dd4b525fcbbabe63525d703a3","observation_id":"e0c669cd-5eb0-4592-82c1-95bfa02b08bf","resolution":{"observed_at":"2026-08-07T15:44:30.675099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:44:30.756069Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.756069Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:339a6ec733fed9cf1fbea3525bae89f7c326d31c954c95d78c31b0f0efdb4d80","observation_id":"41939ca4-a260-4759-91f5-d40a2cfe6b20","resolution":{"observed_at":"2026-08-07T15:44:30.756069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:44:30.864841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.864841Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:d35f9348d5933d6d21e708fad3eb2e636ac270a1b6f78152c18d50a5131bea7c","observation_id":"3a56fac1-4f09-493f-ad1f-d88b1ad02e51","resolution":{"observed_at":"2026-08-07T15:44:30.864841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05904","last_updated":"2024-10-01T12:08:23Z","snapshot_observed_at":"2026-08-16T13:53:58.560866Z","submitted_at":"2024-05-09T17:00:22Z","title":"Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05904","snapshot_observed_at":"2026-08-07T15:44:30.995190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.995190Z"},"links":{"cited_paper":"/paper/2405.05904","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:56154f981ec17791a4e9f7cbf6b9cdcf0c1c1f4ad01221ac2b55cf8d64df918d","observation_id":"71483c38-9e7a-49ef-8260-ff5294e1f711","resolution":{"observed_at":"2026-08-07T15:44:30.995190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:44:31.106531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.106531Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:bc6e0672004f927cfecfdc78df7221e5cd4af9e995142768443945b343d3bcd0","observation_id":"854c0351-2a20-4b30-92cb-d939b26418a0","resolution":{"observed_at":"2026-08-07T15:44:31.106531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:44:31.222493Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.222493Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:224880b7958e719af7499ff6dec4f305c1fdc9b00e3522a4fd470c1513507621","observation_id":"ce49eb88-0866-4122-8767-c1fdbd6c4c21","resolution":{"observed_at":"2026-08-07T15:44:31.222493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T15:44:31.355068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.355068Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:98b18174b55e7d4f8f0e62750b2a34686010c3fc0db95fe77adb7573b498b11c","observation_id":"819102f4-c5fd-4cb0-b98d-60b315192ed4","resolution":{"observed_at":"2026-08-07T15:44:31.355068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:31.447643Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.447643Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:ccaee3d83dbf5c19c44d0e4fe8c8aaeed1e7b9e49e420118e6b32918fa6036de","observation_id":"f5f2b607-eb5a-428d-ac1d-fb36a23b78d3","resolution":{"observed_at":"2026-08-07T15:44:31.447643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T15:44:31.518305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.518305Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:01f4c9152d0437ea83b22f9f8cd5a4169317a2785c5c962ea2fe36601daee8ed","observation_id":"8f7481b6-dca4-4af9-aaed-449f5323eaa3","resolution":{"observed_at":"2026-08-07T15:44:31.518305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T15:44:31.690376Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.690376Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:2e09451cbc821366c29f10cb18395fc6f509215b5460f5958ea75fd215c7a878","observation_id":"84052823-48f1-4594-8298-fe0688dfcfe8","resolution":{"observed_at":"2026-08-07T15:44:31.690376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:43.294887Z","title":null,"venue":null,"work_id":"1bb96512-c5d9-4144-86b8-8aaa2a8de171","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.804578Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:6357205a23d0301233417bb50dd9e78d2b14e7b30f293fa9ce803d86d2a73187","observation_id":"2b37d6ff-c0f1-4c99-a109-81665178032f","resolution":{"observed_at":"2026-08-07T15:44:43.373694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-13T15:08:13.316080Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-07T15:44:32.005515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.005515Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:e96849fb13ae881cff822a125579c3e02f02d2faccac577afd9bccdb3b6e4742","observation_id":"25972b8f-464b-49e8-94e8-f8f5994bcaff","resolution":{"observed_at":"2026-08-07T15:44:32.005515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:32.124833Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.124833Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:fe10bb18ce8175d283d77615a91d32d3bd0c7d0ad7a409d4d5644b8557bf498b","observation_id":"5f1ffac1-a515-450a-8696-fd8c930e9a5e","resolution":{"observed_at":"2026-08-07T15:44:32.124833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03205","last_updated":"2024-01-06T12:40:45Z","snapshot_observed_at":"2026-08-17T06:58:36.640883Z","submitted_at":"2024-01-06T12:40:45Z","title":"The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03205","snapshot_observed_at":"2026-08-07T15:44:32.201925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.201925Z"},"links":{"cited_paper":"/paper/2401.03205","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:c537b6a36885e295ee13666b1511017e64050ffa79faafd8f833a85e65371d76","observation_id":"911ec246-e3ca-4ef7-a54b-253350311b84","resolution":{"observed_at":"2026-08-07T15:44:32.201925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06169","last_updated":"2025-03-17T08:11:52Z","snapshot_observed_at":"2026-08-17T14:07:57.009857Z","submitted_at":"2025-03-08T11:13:05Z","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","version":2},"cited_work":{"arxiv_id":"2503.06169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06169","snapshot_observed_at":"2026-08-07T15:44:37.625329Z","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","venue":"cs.CV","work_id":"97a07a55-32ae-4206-8bef-2f85d2e2fa47","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.260799Z"},"links":{"cited_paper":"/paper/2503.06169","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:5b104f8dd6295db6ca982bb2206274500db7d06b91c8befc9c840d67dd8751c4","observation_id":"27b411fc-cbc0-4d0d-9643-2eeee438d1af","resolution":{"observed_at":"2026-08-07T15:44:37.888022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-17T13:27:14.855105Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T15:44:32.385679Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.385679Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:a6c7b372141dcb1c76c2bb2367c2b3b9567de023d132465d6bd7acb426215f20","observation_id":"9418ddc7-8284-4590-81cc-d8bc205438cb","resolution":{"observed_at":"2026-08-07T15:44:32.385679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T15:44:32.534874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.534874Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:90b0a08ab91cc48d17f23a9a022f2f91cb88b1db86ee2163c0cb11554b6d1096","observation_id":"bc76dd61-de76-4e95-b56a-b6224cd025a2","resolution":{"observed_at":"2026-08-07T15:44:32.534874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:32.681966Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.681966Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:43767af403500c0741541d36449dc3e376096f542781d48d904f8be21de0a0e6","observation_id":"711946dc-cdd6-42db-a1c6-d3ed63c0ed2f","resolution":{"observed_at":"2026-08-07T15:44:32.681966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:42.895833Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"86873302-46d3-4d09-a732-d1fcffe2b38b","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.794896Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:469bd8dfda65079fcd73a7b2887ef31e03291a343c1105cf199acf262ed19921","observation_id":"152c4b32-31b7-4b31-b8a7-ce1516fce7a9","resolution":{"observed_at":"2026-08-07T15:44:43.042890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:32.954751Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.954751Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:915eb998eafc4eabc06149f54b85cfbe3d4465f3948803b0f48a9d9f1493fd2f","observation_id":"655dcc39-5a30-44d3-ab7d-6c4fd97b7cc5","resolution":{"observed_at":"2026-08-07T15:44:32.954751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:42.521336Z","title":null,"venue":null,"work_id":"82ab48fe-c9b2-4786-a690-0d3761184758","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.126414Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:beaefb88893654a347487b85a7e1a612aa9b99befb471fd00b920dc61fc53266","observation_id":"10c551ec-e18d-4b78-987f-de8e7b0ceff8","resolution":{"observed_at":"2026-08-07T15:44:42.634345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:42.244742Z","title":null,"venue":null,"work_id":"8a8ee3a8-9a81-4b32-9375-b7ecd7a338c9","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.324958Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:f9860ba50c1dc2d3dd90a3b0795739abcf859d9d8d5435150f4e0852f262f16b","observation_id":"2ee8666a-b3cf-42e7-b1d0-e4cff21c07ea","resolution":{"observed_at":"2026-08-07T15:44:42.366454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:33.545500Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.545500Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:ca985b8c5e696ea05c41605c6c05315433c69d1b573a7c48ebbedc6636d06fd4","observation_id":"e825bd42-c4fd-4479-9e05-a2f9c9a63638","resolution":{"observed_at":"2026-08-07T15:44:33.545500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:41.825308Z","title":null,"venue":null,"work_id":"302536cf-92d7-44b9-b9f0-e445417de093","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.628322Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:47d7ea9552754032765b79a2d87d5b7539e734b9961b948ec75d1540f45c9969","observation_id":"4e638485-7ee6-4076-8934-97bbd59cd17a","resolution":{"observed_at":"2026-08-07T15:44:41.964745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:44:33.782472Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.782472Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:aea769bdd02d12f3d2b690fbae19b4d8a1127b8b51e8f439d3872fb6728bb7ea","observation_id":"be302502-a318-4dc2-87ee-44644080a929","resolution":{"observed_at":"2026-08-07T15:44:33.782472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:44:33.894983Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.894983Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:35f5d018fe2abff24c234668d716f4e51876991f91d7dc88a7956cbc78fda15a","observation_id":"7c226e53-6050-4b90-b6c2-edf442f7a5d1","resolution":{"observed_at":"2026-08-07T15:44:33.894983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:34.007922Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.007922Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:60581b076e7e94c77a333ce7a54836035a357ae8e67c7ff47c42bb5e8bea452f","observation_id":"16abeb0e-4769-4dee-bee0-62ab852816d5","resolution":{"observed_at":"2026-08-07T15:44:34.007922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-16T12:43:12.912218Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-07T15:44:34.170709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.170709Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:dbb7e95e6f936d0e606c9cd86479202f110b152c40cae20b8082662ec5c3df39","observation_id":"b6932d08-7faf-4c4a-9d61-9ad113926933","resolution":{"observed_at":"2026-08-07T15:44:34.170709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:34.272336Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.272336Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:fde1a4f1b0030afe032b7506ccb803006f906ae4cfeaf25c97c7ec3244f0d447","observation_id":"d8527608-d5de-4952-b276-8553a0ab47df","resolution":{"observed_at":"2026-08-07T15:44:34.272336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:41.474022Z","title":null,"venue":null,"work_id":"9fab5b26-4ac8-4c16-b763-86e768d9d14b","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.448645Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:146daba5b240314dd35ff4359b6b41f01f640155f2dc266c3faf4fb21ea76c45","observation_id":"ed215d06-63d0-4e1a-96ed-001d416d4174","resolution":{"observed_at":"2026-08-07T15:44:41.595034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T15:44:34.610778Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.610778Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:95f28c6c7c5813d5ebdb7526046dfba869d968859bb2fcccf3b14282ef48ef1d","observation_id":"1e62e25e-fcd5-4aa5-9bbe-597e3bacba13","resolution":{"observed_at":"2026-08-07T15:44:34.610778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:41.144744Z","title":null,"venue":null,"work_id":"b3d5b738-2e81-4698-8714-863e00e4ceaa","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.775008Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:e59a7aa923a5152481d8f7f65866a9d1179ed111ee58c502b1c55a73d464f0ef","observation_id":"1e57963e-b949-4603-86b2-f160291ca989","resolution":{"observed_at":"2026-08-07T15:44:41.284869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01313","last_updated":"2024-01-08T16:19:17Z","snapshot_observed_at":"2026-08-15T22:25:16.598230Z","submitted_at":"2024-01-02T17:56:30Z","title":"A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01313","snapshot_observed_at":"2026-08-07T15:44:34.912984Z","title":"M Towhidul Islam Tonmoy, S M Mehedi Zaman, Vinija Jain, Anku Rani, Vipula Rawte, Aman Chadha, and Amitava Das","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.912984Z"},"links":{"cited_paper":"/paper/2401.01313","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:aa935e454d92c0f9e870a7cebbbfe1dcf0b765ef52475fe56bfdb3512c7afee9","observation_id":"fdd7360a-d90f-4de7-905a-48d9044a6cfb","resolution":{"observed_at":"2026-08-07T15:44:34.912984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-08-14T15:48:28.214119Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-07T15:44:35.037495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.037495Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:851c94eb5d94a14770b351b026b4eaf39c49cfd4b8a3bed6d7410ab2c9b4ffc7","observation_id":"1e86e968-b904-4aa8-af69-2222fd6b1be5","resolution":{"observed_at":"2026-08-07T15:44:35.037495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15777","last_updated":"2025-04-22T10:38:00Z","snapshot_observed_at":"2026-08-16T11:15:50.880840Z","submitted_at":"2025-04-22T10:38:00Z","title":"Tina: Tiny Reasoning Models via LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15777","snapshot_observed_at":"2026-08-07T15:44:35.167445Z","title":"O mer Faruk Akg \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.167445Z"},"links":{"cited_paper":"/paper/2504.15777","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:e179c69a16673aaa9d446e7fd8c5877505e342c9d783f4b0075b6c4137c7aa57","observation_id":"9e7e68fb-7fad-46bd-a097-8001bb4f84c5","resolution":{"observed_at":"2026-08-07T15:44:35.167445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T15:44:35.310902Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.310902Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:be5b6ef69d64b9aa95ab3af41a6590742f33eff8e2ac9aadc5808cbf97f4a904","observation_id":"ec9d1ffe-a12c-470d-9379-96f40be417bc","resolution":{"observed_at":"2026-08-07T15:44:35.310902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03958","last_updated":"2024-02-15T01:03:13Z","snapshot_observed_at":"2026-08-16T05:30:15.258663Z","submitted_at":"2023-08-07T23:48:36Z","title":"Simple synthetic data reduces sycophancy in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03958","snapshot_observed_at":"2026-08-07T15:44:35.430765Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.430765Z"},"links":{"cited_paper":"/paper/2308.03958","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:c7340cb5404b9655d0aa1bb345610ebfd1cc3e3fd8f89159c2008308ae545c4f","observation_id":"176734b8-7600-48fd-a725-72d93dc4c722","resolution":{"observed_at":"2026-08-07T15:44:35.430765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:40.872639Z","title":null,"venue":null,"work_id":"e7184901-b25f-447c-947d-76a15bb255de","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.515063Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:23869262495baa381c05467822f04ce742e982a82b2cf6c58eb356bdd7253b9c","observation_id":"9aebf6e4-c24a-47e1-9f0a-9503c9f6beb1","resolution":{"observed_at":"2026-08-07T15:44:40.994636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-16T12:40:48.744732Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T15:44:35.621729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.621729Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:6a73964b51097e405f513262b9355fda0d9d8c74ffe30ab687f4124924457ddd","observation_id":"007b1964-85c9-4886-b1c9-f9788c4ad213","resolution":{"observed_at":"2026-08-07T15:44:35.621729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:40.509514Z","title":null,"venue":null,"work_id":"8ba77bcf-b599-4b84-b885-a6f548b763cd","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.719317Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:0119f568b1d1379dacac98d0ad43b0e10fbabbed758b3835e5ef5196b564ee10","observation_id":"7be9aab1-c81d-42c3-9abd-b00308dcd272","resolution":{"observed_at":"2026-08-07T15:44:40.628475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18153","last_updated":"2023-05-30T15:14:06Z","snapshot_observed_at":"2026-08-16T15:28:38.296755Z","submitted_at":"2023-05-29T15:30:13Z","title":"Do Large Language Models Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18153","snapshot_observed_at":"2026-08-07T15:44:35.850344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.850344Z"},"links":{"cited_paper":"/paper/2305.18153","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:da0957dd45cf64d2bb3e128413fc065b60e355527f48a7965a02f7a9e6027ee1","observation_id":"16848e90-3df9-41b2-bccf-5254ad9f571f","resolution":{"observed_at":"2026-08-07T15:44:35.850344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:44:35.961914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.961914Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:34b852f6a12c684a6164193b0abfaf6c26ae6c1afad7fa9d9d7663801cd4e51e","observation_id":"b778e018-1636-4f23-891f-dbaaaa36b509","resolution":{"observed_at":"2026-08-07T15:44:35.961914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:40.325570Z","title":null,"venue":null,"work_id":"cc0d4ca7-5652-47fa-899f-d5cf514a6bca","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.094973Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:157a439b4274ee4dfd642bcc98adcc0d090d2f60e755694f81ae6d81080506b6","observation_id":"9a8df657-c924-449c-b6ab-22dd12a69bd1","resolution":{"observed_at":"2026-08-07T15:44:40.383837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13534","last_updated":"2023-05-22T23:14:28Z","snapshot_observed_at":"2026-08-16T15:30:53.024861Z","submitted_at":"2023-05-22T23:14:28Z","title":"How Language Model Hallucinations Can Snowball","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13534","snapshot_observed_at":"2026-08-07T15:44:36.213918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.213918Z"},"links":{"cited_paper":"/paper/2305.13534","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:ba4f1b6d70fdde5180378fbee9db3170041dcb04ccf6f2829bf2992064c1ca25","observation_id":"9268f459-e4da-4b2a-901c-79f32205026e","resolution":{"observed_at":"2026-08-07T15:44:36.213918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-17T08:18:18.529456Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T15:44:36.354899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.354899Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:e824499b4d98727efc785f38083f86e423e238d4af963a9451f0dfad105a3045","observation_id":"f32edaa0-bd51-4cb7-81a7-533956c446c1","resolution":{"observed_at":"2026-08-07T15:44:36.354899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-08-11T20:12:00.210052Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-07T15:44:36.534742Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.534742Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:40d92a7f8c3968d268ac16587ed753740ad8d6100635c02878c7aeb0f4c14e79","observation_id":"13000c1c-0526-4a67-bb6d-f74ffe031b72","resolution":{"observed_at":"2026-08-07T15:44:36.534742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 9 inbound Pith citation observations for arXiv:2505.13988."}