{"as_of":"2026-08-09T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b96b0e8932f90d260e271b004ab6eba7fb4e23a9d06fa16a4105e823e634cc9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:10:53.436669Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-08T18:10:53.436669Z","title":"Offline reinforcement learning for llm multi-step reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.436669Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:752de6e93b4f1b7bd111798a3117a587fb3cea6d74ecbfb4b5f20d1289260b67","observation_id":"3b599f16-a305-4fc8-9721-66e3ce66ec3c","resolution":{"observed_at":"2026-08-08T18:10:53.436669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-07T11:32:30.615635Z","title":"Offline reinforcement learning for llm multi-step reasoning.arXiv preprint arXiv:2412.16145, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-09T00:47:31.746531Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.615635Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:13aea5cbe4e7545d367ff44cae86e59d4c79f8cc6064573c2ce38677a3cd2a7d","observation_id":"40d8a2c3-061f-4d2d-ab59-133b144a810e","resolution":{"observed_at":"2026-08-07T11:32:30.615635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T21:55:04.280984Z","title":"Offline reinforcement learning for LLM multi-step reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-09T05:53:21.859449Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.280984Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:023080d1d0c8dfb8cacdebf180a7219eecaeba7defd7691ada33460f18007a58","observation_id":"3c787b02-2301-4e54-b8de-08a800880ea4","resolution":{"observed_at":"2026-08-06T21:55:04.280984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T19:59:37.039893Z","title":"Offline reinforcement learning for llm multi-step reasoning.arXiv preprint arXiv:2412.16145, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-08T15:50:06.172618Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:37.039893Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.04136"},"observation_digest":"sha256:bdf3e08c27754feae0c44b269a7bda560245d7524a0b4af8688286a73b80a532","observation_id":"1ebdf16a-4c76-47fc-970b-4ff90b9ad66e","resolution":{"observed_at":"2026-08-06T19:59:37.039893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-07T00:23:18.742674Z","title":"arXiv preprint arXiv:2412.16145","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-08T13:44:26.014435Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.742674Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.08806"},"observation_digest":"sha256:f4b98a1b0b3befaa738bf85864f90e438c19e546be4db445c495026190737279","observation_id":"a9ca7058-d9b0-4a0d-ba6d-d67f668e1201","resolution":{"observed_at":"2026-08-07T00:23:18.742674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T15:24:27.704354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.704354Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:89713ad0728c1d9d5fee9001b2ad84581cd84846c6b6daf8e7aadaa1a182d268","observation_id":"7e0152b2-7e3e-4348-be31-8bd04f407e02","resolution":{"observed_at":"2026-08-06T15:24:27.704354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2510.08539","last_updated":"2026-05-07T17:44:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T17:53:41Z","title":"On the optimization dynamics of RLVR: Gradient gap and step size thresholds","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T08:34:36.543874Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2510.08539"},"observation_digest":"sha256:d722e8326ff3adde0a43279c5be651200435d4618f1d13833d66d8824c590200","observation_id":"a2612bc7-e4b2-45f7-82e7-425310cab47c","resolution":{"observed_at":"2026-05-18T08:36:07.334653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2604.04937","last_updated":"2026-02-14T23:45:29Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-02-14T23:45:29Z","title":"Pramana: Fine-Tuning Large Language Models for Epistemic Reasoning through Navya-Nyaya","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T21:58:40.973772Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2604.04937"},"observation_digest":"sha256:0f84b52ca20d12642e46d0101564d640af6de04c4cad31d7041b2224b3220be0","observation_id":"2c55574d-7af5-489b-80b5-00c7710b88e2","resolution":{"observed_at":"2026-05-15T22:00:21.063340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":257,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:599728b655b621bf743e1a5e643f042324d4e8331a574a3c4c5b6c90bbcc2cbb","observation_id":"6440f138-b617-4260-9f74-7f4622f8fb3b","resolution":{"observed_at":"2026-07-01T20:56:13.653343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":240,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:e40efb206676b647aff76823d10c5e8eeb83c6e72280832a45ed02de42762c48","observation_id":"6583c324-0b76-40b0-b47f-248c6f4e67b0","resolution":{"observed_at":"2026-06-27T13:00:56.038173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":212,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:5836fe199ca38495013f49c884b3fa398c6e512425f088838b1bef1dff1eb864","observation_id":"4f89117f-84fb-4cf7-b597-b2bc031fceba","resolution":{"observed_at":"2026-07-04T07:59:40.096925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-01T06:32:23.624774Z","title":"Offline reinforcement learning for LLM multi-step reasoning.arXiv preprint arXiv:2412.16145, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21856","last_updated":"2026-07-23T22:50:23Z","snapshot_observed_at":"2026-08-07T15:15:19.846490Z","submitted_at":"2026-07-23T22:50:23Z","title":"LeAct: Learning to Reason from Expert Actions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:23.624774Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2607.21856"},"observation_digest":"sha256:85380a50cb5a24a56531e6efb71c9d8a8b064ee6b41179c716c195d64c29b072","observation_id":"14a4ff1a-7006-4230-be33-2d08996d25f1","resolution":{"observed_at":"2026-08-01T06:32:23.624774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-02T10:18:39.144202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22642","last_updated":"2026-06-24T00:12:03Z","snapshot_observed_at":"2026-08-08T11:02:32.765828Z","submitted_at":"2026-06-24T00:12:03Z","title":"CRAFT: Learn the Schema, Execute the Plan","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T10:18:39.144202Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2607.22642"},"observation_digest":"sha256:85925a40be86272e90a3e9dcf73014fc17e53d71e26c2bc3c70b9e723d8860d4","observation_id":"8b8a284a-2592-458f-a08e-8596a8c151ca","resolution":{"observed_at":"2026-08-02T10:18:39.144202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16145/citation-record","integrity":"/paper/2412.16145/integrity","json":"/paper/2412.16145/citation-record.json","paper":"/paper/2412.16145"},"outbound":[],"paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2412.16145."}