{"as_of":"2026-08-15T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fc5660782f854bea7af9e0a94f582be2a7fcaf5b22ad1bb281b857ed4b7782e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:50:38.778526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:02:33.817155Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-07T05:50:38.778526Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation.arXiv preprint arXiv:2503.12854, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07047","last_updated":"2025-06-08T09:04:14Z","snapshot_observed_at":"2026-08-14T00:18:26.324410Z","submitted_at":"2025-06-08T09:04:14Z","title":"Mathesis: Towards Formal Theorem Proving from Natural Languages","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:38.778526Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2506.07047"},"observation_digest":"sha256:1b84dafe2d39842480dd710497f8f917f671e698d0af54003ed98eadc1a44448","observation_id":"beacce03-b4a2-4061-b7a1-b2e2731349e0","resolution":{"observed_at":"2026-08-07T05:50:38.778526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-06T22:59:47.417741Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20241","last_updated":"2025-06-25T08:36:12Z","snapshot_observed_at":"2026-08-13T16:56:05.130404Z","submitted_at":"2025-06-25T08:36:12Z","title":"Enhancing Large Language Models through Structured Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:59:47.417741Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2506.20241"},"observation_digest":"sha256:aef3b74adfc6c4e160dec214dcbf24e5c782a57953745942d2adaa4394eb572b","observation_id":"450bebd0-af38-4ece-ac96-ebf204566c01","resolution":{"observed_at":"2026-08-06T22:59:47.417741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2508.06412","last_updated":"2026-05-07T07:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T15:56:49Z","title":"Sample-efficient LLM Optimization with Reset Replay","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T23:38:08.044450Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2508.06412"},"observation_digest":"sha256:4f255a61720086015991a7257e51f95b8b965a82cc7006d0c3b1cdcf47a0eda5","observation_id":"e2d8a1c9-c418-4448-bdfa-652d2a27dfff","resolution":{"observed_at":"2026-05-18T23:41:54.738087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-04T09:33:40.888746Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.888746Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:adb02f340ff5964213d0b394334a53b59e558e620b592a6daf36f5d0fdf3f473","observation_id":"62801cd4-ce5a-4f1e-abfb-8c526f5297b7","resolution":{"observed_at":"2026-08-04T09:33:40.888746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-03T23:33:49.468251Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05385","last_updated":"2026-07-23T06:36:18Z","snapshot_observed_at":"2026-08-12T21:15:48.076878Z","submitted_at":"2025-11-07T16:08:34Z","title":"TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:49.468251Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2511.05385"},"observation_digest":"sha256:4a5f788705837f6d630c81d247d246ecdd2f003bd5e1d71a69f9417a1e5ecbb1","observation_id":"921189dd-55a7-47c7-8c07-88391aa3e3ff","resolution":{"observed_at":"2026-08-03T23:33:49.468251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-03T05:49:25.124148Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation.arXiv preprint arXiv:2503.12854,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01357","last_updated":"2026-06-08T05:19:57Z","snapshot_observed_at":"2026-08-13T20:41:58.704846Z","submitted_at":"2026-02-01T17:50:59Z","title":"Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T05:49:25.124148Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2602.01357"},"observation_digest":"sha256:a9b0d5c5425e34c6ae4a28de8d4d35c4b389d325a09ea826b96977c555bf8ebe","observation_id":"ae29fb2c-7c16-4ba5-b2d9-2e85298977f4","resolution":{"observed_at":"2026-08-03T05:49:25.124148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2604.20933","last_updated":"2026-04-22T11:52:21Z","snapshot_observed_at":"2026-07-30T07:55:19.034385Z","submitted_at":"2026-04-22T11:52:21Z","title":"IRIS: Interpolative R\\'enyi Iterative Self-play for Large Language Model Fine-Tuning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T01:15:12.985803Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2604.20933"},"observation_digest":"sha256:7b23ce89ea75d233bd0cc08b8d56ba54e1f170f06d935de3d9249223f6f68c83","observation_id":"aa1fc4f7-5128-4fc3-9ee6-e1f725596d84","resolution":{"observed_at":"2026-05-11T13:41:05.074027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2604.23809","last_updated":"2026-04-26T17:13:17Z","snapshot_observed_at":"2026-08-14T02:36:47.655128Z","submitted_at":"2026-04-26T17:13:17Z","title":"LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T06:06:53.959061Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2604.23809"},"observation_digest":"sha256:373a2e01bc9edf27ca7d9d99bfb6a10b6cad3a7bfd45c11f0e492f8a43655b15","observation_id":"41a09afb-bd6c-4ae4-bfab-0ba069dbc723","resolution":{"observed_at":"2026-05-11T21:16:25.953549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2605.07353","last_updated":"2026-05-08T07:08:25Z","snapshot_observed_at":"2026-08-11T04:46:32.902221Z","submitted_at":"2026-05-08T07:08:25Z","title":"Confidence-Aware Alignment Makes Reasoning LLMs More Reliable","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:40.020460Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2605.07353"},"observation_digest":"sha256:ee3a25a0480ecdb3506943c1167fb2630dabd5de39c8f4702ff83ee0a2630923","observation_id":"fd439143-50f9-432f-86e7-ec30bd916e06","resolution":{"observed_at":"2026-05-11T03:55:53.895403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2605.21266","last_updated":"2026-05-20T14:53:43Z","snapshot_observed_at":"2026-08-13T17:32:49.724742Z","submitted_at":"2026-05-20T14:53:43Z","title":"How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T06:22:55.286281Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2605.21266"},"observation_digest":"sha256:dfd61e0eba183b6664fec89847b556b1de770cae4be54a6789a8c2431fd2941b","observation_id":"8c53353d-3041-44a5-9005-e0d8f5f1affb","resolution":{"observed_at":"2026-05-21T06:24:00.555652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2605.23398","last_updated":"2026-05-22T09:11:20Z","snapshot_observed_at":"2026-08-14T08:41:22.432537Z","submitted_at":"2026-05-22T09:11:20Z","title":"TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T03:41:52.859647Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2605.23398"},"observation_digest":"sha256:2c863fe738db0904867015490669de6687e274fa05bcfbee9320487920b164b7","observation_id":"173be850-c0a6-47df-9987-16f2e2589fb1","resolution":{"observed_at":"2026-05-25T03:45:17.528307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2606.00869","last_updated":"2026-05-30T19:53:19Z","snapshot_observed_at":"2026-08-13T00:36:06.236099Z","submitted_at":"2026-05-30T19:53:19Z","title":"Enhancing LLM Metacognition via Cognitive Pairwise Training","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T19:01:18.153145Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2606.00869"},"observation_digest":"sha256:c9eedcc40e66b30bd37b73ea6e2ca454bb195547769224817521076d0fffc225","observation_id":"a6ce62f4-2f0c-435d-9727-edc4d7977589","resolution":{"observed_at":"2026-06-28T19:02:33.820741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.12854/citation-record","integrity":"/paper/2503.12854/integrity","json":"/paper/2503.12854/citation-record.json","paper":"/paper/2503.12854"},"outbound":[],"paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2503.12854."}