{"as_of":"2026-08-10T03:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56c2d97072904760cfaab7c4832705b588a779be5b8a7462dc784cdb6a639fae","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:53:13.195296Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:47:41.755414Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T16:47:42.403064Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"cited_work":{"arxiv_id":"2608.03972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.03972","snapshot_observed_at":"2026-08-08T16:47:42.403064Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","venue":"cs.AI","work_id":"a0032dcf-bba0-4c7b-b225-5d5315f8c696","year":2026},"citing_paper":{"arxiv_id":"2608.05131","last_updated":"2026-08-06T08:22:41Z","snapshot_observed_at":"2026-08-09T23:10:11.010668Z","submitted_at":"2026-08-05T17:53:06Z","title":"OPD-V: Visual On-Policy Self-Distillation with Modality Balance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:47:41.755414Z"},"links":{"cited_paper":"/paper/2608.03972","citing_paper":"/paper/2608.05131"},"observation_digest":"sha256:3a6cd35c0a8738235d5ddfd0cc2ded59e76058cd1a4feac08d2b8776cb8ae702","observation_id":"ca766d31-089c-4d82-a559-29b1bcc5222c","resolution":{"observed_at":"2026-08-08T16:47:42.408371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.03972/citation-record","integrity":"/paper/2608.03972/integrity","json":"/paper/2608.03972/citation-record.json","paper":"/paper/2608.03972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.518258Z","title":null,"venue":null,"work_id":"7a3aaedf-0de0-4d27-aa75-47bb0aa7a8ee","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.932970Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:1de314261fdd2524fa6ba7653276e7790fa8c6916efed6e2682d8402a1a1de82","observation_id":"71316cb8-5dfe-4eca-aeb6-84068d6591a4","resolution":{"observed_at":"2026-08-05T04:53:14.524151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.496011Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":"c64f0ac1-70ae-4119-a497-106ff59b8e32","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.938125Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:b642a4684373f587dbeffad1a2aabbb9dd7fbff96f541faff3d0811ddedf6124","observation_id":"a6cd4b45-4225-435a-9331-cba37575e76f","resolution":{"observed_at":"2026-08-05T04:53:14.503525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13408","last_updated":"2025-05-19T17:44:26Z","snapshot_observed_at":"2026-08-07T15:43:00.197948Z","submitted_at":"2025-05-19T17:44:26Z","title":"CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13408","snapshot_observed_at":"2026-08-05T04:53:12.942968Z","title":"Cot-kinetics: A theoretical modeling assessing lrm reasoning process.ArXiv, abs/2505.13408, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.942968Z"},"links":{"cited_paper":"/paper/2505.13408","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:a2c00e04c464274b5c455133afb2029f121eced209817e2fe087ee19b3c2683e","observation_id":"8dd9ea9a-6b98-4d28-9433-78731f14513b","resolution":{"observed_at":"2026-08-05T04:53:12.942968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.479192Z","title":"Loong: Synthesize long chain-of-thoughts at scale through verifiers, 2025","venue":null,"work_id":"a87ed8b4-1004-4ef3-b6bf-dd0bda9f0c51","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.947974Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:51ac9d5f73c71dd8c4bceef901283d23d81b91df8883c2b33d74c13754b0b856","observation_id":"b9f173e5-5435-4412-8d60-8680b15edc49","resolution":{"observed_at":"2026-08-05T04:53:14.484558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24375","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.924062Z","title":"Reinforcement mid-training, 2025","venue":null,"work_id":"2eaff9cd-58fa-4d0a-a33b-97ba844a6a71","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.952698Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:7d23b3273277f400f72c6cc50ba126346a3ae64a28b536b0b0669473992854ec","observation_id":"676f668a-52ec-46bb-8205-8d92a83901b9","resolution":{"observed_at":"2026-08-05T04:53:13.931848Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-acl","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.264154Z","title":"Self-evolving multi-agent systems via textual backpropagation","venue":null,"work_id":"25ca6f9e-b785-42fa-90a7-9e69b1e518c1","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.957456Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:08e888dd9df4d0bd4698923a4c7a29b882a5b91286e1e66340fe6f9df3f29448","observation_id":"44f0d7fa-e63b-4d3f-95ab-b22290f112a8","resolution":{"observed_at":"2026-08-05T04:53:13.269181Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:12.967025Z","title":"On-policy distillation.Thinking Machines Lab: Connectionism,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.967025Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:62a879977c6bbb1970a2fdfc90fc302aac945a1e67ec9981b2fbc0fd0efdbcc3","observation_id":"67a31706-7647-441c-8dc1-7555dd841db5","resolution":{"observed_at":"2026-08-05T04:53:12.967025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.426092Z","title":"EchoRL: Reinforcement learning via rollout echoing","venue":null,"work_id":"13251cd3-3fcb-48e2-8d19-6a167fd47baa","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.977027Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:b7f4927365568c038796e0f5953c18e06cd11209b88527a8182b7364229658dd","observation_id":"08623710-4d5f-4471-9ed1-b85223d145b3","resolution":{"observed_at":"2026-08-05T04:53:14.431786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.397414Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":"49d5e19b-c846-41f0-bc9e-bc4f5b7843e6","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.981914Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3fcf68033379155fe69d13c381abeb0f9fecbf00f0f0d59c0c279476cafa474c","observation_id":"52a20fe1-d4db-4942-bd10-d5997539c958","resolution":{"observed_at":"2026-08-05T04:53:14.403651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.380452Z","title":"Ozdaglar","venue":null,"work_id":"0bbc9de7-88c4-4043-a11a-690715e482ec","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.986788Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:eb9e9f4227fab17fbd8e7d9f664c1b97577712a8c0a8247150451f1800cad408","observation_id":"b0ef0794-26c1-4934-9d36-ef04fc58c1de","resolution":{"observed_at":"2026-08-05T04:53:14.384926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-05T04:53:12.991139Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.991139Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3075312235d107faae41b0b2d119ab6722d6c34104852c6da3497244ee8af8ae","observation_id":"b85e76e7-0456-4d29-bc9a-c56812d5dcb0","resolution":{"observed_at":"2026-08-05T04:53:12.991139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-05T04:53:12.995759Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.995759Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:df09b52869a9e76f02ecf6c20b567e006f51e6efaaf1d5ddcee8b295cfc44ef6","observation_id":"3e10b2e6-8c8f-44a6-aa55-41da810147f7","resolution":{"observed_at":"2026-08-05T04:53:12.995759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.000441Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.000441Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3ce4aa2c8af11870f42540c287bb593baa070eb0f448dc942c4c69cccca69565","observation_id":"ed2e493a-78a5-41cf-b3d3-c6115491da56","resolution":{"observed_at":"2026-08-05T04:53:13.000441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.351960Z","title":"Solving quantitative reasoning problems with lan- guagemodels","venue":null,"work_id":"a251f37d-90fa-446c-848a-11d8a37b2111","year":2022},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.004741Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:e46ee96ab3e44bba99676796a3f767a959297b5ca31fc09f697dd4108cbf8b27","observation_id":"f3f5af37-516a-4256-a71d-ad4ed9033892","resolution":{"observed_at":"2026-08-05T04:53:14.356660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.009142Z","title":"OlympiadBench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.009142Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:be937bbe975d288205cd82f78ef4702b0af83eb10fd81ac6ac2593f381cd454e","observation_id":"9a4ab40e-1c4d-42b2-abc4-82df9bd4935a","resolution":{"observed_at":"2026-08-05T04:53:13.009142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T04:53:13.014357Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.014357Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:32e1bc96e4032a1fca959934d94fbc9c85d12d89d5952dd4914c9ee19bfb21a0","observation_id":"459ab9fd-1d12-4713-a675-b2c08aa7424b","resolution":{"observed_at":"2026-08-05T04:53:13.014357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.019460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.019460Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:4e23b19835ce7e1e6bfcf98385e7c07dec83e8728e27d3f12d64a9193d41812f","observation_id":"1112e77e-80b2-45ad-b511-b36b7e5fab67","resolution":{"observed_at":"2026-08-05T04:53:13.019460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.314470Z","title":"MMLU-pro: A more robust and challenging multi-task language understanding 12 benchmark","venue":null,"work_id":"c3b569d9-4fad-4b54-a2e9-011b13639eea","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.024162Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:a0285371e5ca623e4a875b5a7437dcef9ff17cb1a2f3cb925a0ae5498074944a","observation_id":"efe2d354-b221-4331-b963-3c3aa75c560c","resolution":{"observed_at":"2026-08-05T04:53:14.319942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.298256Z","title":"SimpleRL-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":"8ffb81ca-55c6-42b1-8c28-c05927ceae8e","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.028821Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:0320e4ca5acfa64d24ede0a88c7a7fb5a49766435b0e071cf8fc27ee4fc1fd8f","observation_id":"8f65f649-835a-4863-9ab0-ad4026eaee28","resolution":{"observed_at":"2026-08-05T04:53:14.303448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.281679Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":"c5a8bddf-3ece-4e04-9615-3fd307e7ca98","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.033764Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:504a5c66d8352350e52ad8030547566f65c87761a3ef89dde2d6221ddaa5557f","observation_id":"6ebc4b3a-56c6-45b5-84ad-3dcc8aa093ca","resolution":{"observed_at":"2026-08-05T04:53:14.286659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.264144Z","title":"Process reinforcement through implicit rewards.Transactions on Machine Learning Research,","venue":null,"work_id":"08acc090-d99d-4f85-b136-29bf204a0c99","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.038050Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:b08c5347207a7ab8bbe0c6c40362c1773b3685f25dcb735cf8c8aaa447dc61d4","observation_id":"b6cf11d9-1ffb-4e6d-b7ca-4fd5826cd031","resolution":{"observed_at":"2026-08-05T04:53:14.268959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T04:53:13.046874Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.046874Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:1c4cd784dd702fff8a610d2d0f825fc23fd8bef17ce8efa9f234d749a9ebfa8e","observation_id":"db9f4ef3-9ecd-428d-9fed-a5df98748910","resolution":{"observed_at":"2026-08-05T04:53:13.046874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T04:53:13.051552Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.051552Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:0a9b40679bf2893bcd8f2de2535244c12b8eabcb15ebaa80faf3bfae60977e8f","observation_id":"8e59e571-48aa-4a9a-8545-fbb844e7488b","resolution":{"observed_at":"2026-08-05T04:53:13.051552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.232407Z","title":"Think outside the policy: In-context steered policy optimization","venue":null,"work_id":"6add68af-f4d1-4e9a-ada4-a73adf9eabd5","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.057291Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3ecd863b229664bccea1180dbfbbf39036146b0320b5f4f695d2ffb346ea5db4","observation_id":"c97db0fe-842d-4390-928a-c1a0eee4a97a","resolution":{"observed_at":"2026-08-05T04:53:14.237674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23747","last_updated":"2026-04-26T14:53:48Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T14:53:48Z","title":"SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23747","snapshot_observed_at":"2026-08-05T04:53:13.062069Z","title":"SFT-then-RL outperforms mixed-policy methods for LLM reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.062069Z"},"links":{"cited_paper":"/paper/2604.23747","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:123c83d1b2858673e9e3baf8ac26a70915f28ed33aa078d6df292c55d20833a9","observation_id":"f4754bd8-ebb5-4826-81cc-08f8df5b9e12","resolution":{"observed_at":"2026-08-05T04:53:13.062069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-08T13:14:58.702776Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-05T04:53:13.066820Z","title":"When more is less: Understanding chain-of-thought length in llms.ArXiv, abs/2502.07266, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.066820Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:0bff9893dc847cf4c18559ded1687b99d33dbf1edb40b57dcdddae0947aaeb1a","observation_id":"c6f71012-67b5-4f5f-8950-493008b635b8","resolution":{"observed_at":"2026-08-05T04:53:13.066820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.215530Z","title":"Don’t overthink it","venue":null,"work_id":"9dfddb7f-872d-4d97-aae9-c481259199fa","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.072079Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:29ae3975c2b1f7753954a4243e4d5714e60d1c346073b5557a946fd76ab6c996","observation_id":"4113cf82-1aa0-4f83-a1e1-30163a41d3b3","resolution":{"observed_at":"2026-08-05T04:53:14.220813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.193461Z","title":"LLaVA steering: Visual instruction tuning with 500x fewer parameters through modality linear representation- steering","venue":null,"work_id":"8087caae-cfa6-44a5-8737-9ed0415caf85","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.077044Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:20fde087c255c6ee4719a14da5f60e932b59c86122a2ea62cf77309bbe557a81","observation_id":"aa62ebab-5ecd-4e67-913b-e590d9786438","resolution":{"observed_at":"2026-08-05T04:53:14.199622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12119","last_updated":"2026-05-29T11:31:58Z","snapshot_observed_at":"2026-08-07T18:11:25.128924Z","submitted_at":"2025-02-17T18:43:41Z","title":"PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12119","snapshot_observed_at":"2026-08-05T04:53:13.081608Z","title":"Prism: Self- pruning intrinsic selection method for training-free multimodal data selection.ArXiv, abs/2502.12119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.081608Z"},"links":{"cited_paper":"/paper/2502.12119","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:cb64a27448fa65daec0954097c77f35447dc58f30a3216a0b28a0fcbf54bc201","observation_id":"00d862b3-3b99-465b-8966-3f520b032d86","resolution":{"observed_at":"2026-08-05T04:53:13.081608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.164627Z","title":"Beyond nl2code: A structured survey of multimodal code intelligence,","venue":null,"work_id":"4e05c022-178b-4226-a121-9faeea1e2154","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.091539Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:9b20aeed590e6744fe7b537fcb26ec7afab5c1704d90c916e3cd099e74f1f1d2","observation_id":"11290c47-93f1-4ba8-a121-b8c902397195","resolution":{"observed_at":"2026-08-05T04:53:14.169785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12919","last_updated":"2023-12-01T17:33:55Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T18:43:07Z","title":"SPOT! Revisiting Video-Language Models for Event Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12919","snapshot_observed_at":"2026-08-05T04:53:13.101410Z","title":"Spot! revisiting video-language models for event understanding.arXiv preprint arXiv:2311.12919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.101410Z"},"links":{"cited_paper":"/paper/2311.12919","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:143d4861578ac01cda09d02b60307bcc97613d744ce6efd0683412d2ea46a73b","observation_id":"3cf0b7a4-e5fd-4080-a050-efd75a89652f","resolution":{"observed_at":"2026-08-05T04:53:13.101410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01393","last_updated":"2026-05-31T18:35:30Z","snapshot_observed_at":"2026-07-06T23:41:58.121923Z","submitted_at":"2026-05-31T18:35:30Z","title":"Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing","version":1},"cited_work":{"arxiv_id":"2606.01393","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01393","snapshot_observed_at":"2026-08-05T04:53:13.641330Z","title":"Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing","venue":"cs.CL","work_id":"b70a9e14-97ce-4af5-a173-53ab55245c09","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.106954Z"},"links":{"cited_paper":"/paper/2606.01393","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c5dda100018b5b0bb22792abf236770d4c7db31eca1d787d7ac85e51ce28b1ea","observation_id":"d02da753-95da-47eb-86c2-22a74beb1c38","resolution":{"observed_at":"2026-08-05T04:53:13.646604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.086535Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.086535Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:13b55c07a9a4368c394f3e433bfffe3b03801c66022fc79151b7a349a5482d60","observation_id":"614957f0-49a5-4284-9ca1-8e36fb0678d9","resolution":{"observed_at":"2026-08-05T04:53:13.086535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19316","last_updated":"2026-05-07T10:32:29Z","snapshot_observed_at":"2026-08-04T19:02:12.420139Z","submitted_at":"2025-10-22T07:26:55Z","title":"KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.19316","snapshot_observed_at":"2026-08-05T04:53:13.116166Z","title":"Kore: Enhancing knowledge injection for large multimodal models via knowledge-oriented augmentations and constraints, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.116166Z"},"links":{"cited_paper":"/paper/2510.19316","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:277e1da2dfee93c30291fce3424620ff9b416bfdaedb26681350431c8c12aa3c","observation_id":"caefa43e-66b5-448b-9654-1b652cf39833","resolution":{"observed_at":"2026-08-05T04:53:13.116166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"cited_work":{"arxiv_id":"2606.15932","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.15932","snapshot_observed_at":"2026-08-05T04:53:13.685184Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","venue":"cs.CL","work_id":"b5ed27b9-07e6-4247-9f7e-e597a35f8ea0","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.095917Z"},"links":{"cited_paper":"/paper/2606.15932","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c0a43d654b38a8955c52e485565e929d86cd017c9a63002106745d04a978c625","observation_id":"641dc76e-2364-4908-a5ea-84cbcf94c2f3","resolution":{"observed_at":"2026-08-05T04:53:13.690777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.125098Z","title":"Aditya Prakash, Yizhou Sun, and Wei Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.125098Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:b65582b9a3d4bef4610f5b192226b501a3856772efe52891d47353016d5fa95c","observation_id":"f9a3aeed-c64c-4e64-a40c-744ce16e7669","resolution":{"observed_at":"2026-08-05T04:53:13.125098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.149893Z","title":"HYPERION: Fine-grained hypersphere alignment for robust federated graph learning","venue":null,"work_id":"15dd68b7-0fd1-4fff-b367-274344291761","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.129286Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3580f0896c700c41065ae50bb881628f4747b52313825dc33548aad273363f78","observation_id":"cd29fcac-7c1b-45c6-bf24-4b2c68e8208f","resolution":{"observed_at":"2026-08-05T04:53:14.154663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02004","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.601035Z","title":"Alignsae: Concept-aligned sparse autoencoders, 2026","venue":null,"work_id":"8dae3236-23c3-4652-bf24-3e84060ed355","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.111636Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:84728930ec6a2934fb151a866aabfe3d4a900c411aaa0b7ab740e70576c242e8","observation_id":"86e77089-5ef2-4b20-ad58-6bfb328ad5cc","resolution":{"observed_at":"2026-08-05T04:53:13.621870Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.138245Z","title":"Can visual input be compressed? a visual token compression benchmark for large multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.138245Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:008fbe9aaea4b3dd4f8c0ab724673e07cd1f6e34f4a03a98e172b81f450d2172","observation_id":"bf1166f2-560f-4ee7-86c6-b287bfd71e1e","resolution":{"observed_at":"2026-08-05T04:53:13.138245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i12.38000","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.231672Z","title":"Ascd: Attention-steerable contrastive decoding for reducing hallucination in mllm.Proceedings of the AAAI Conference on Artificial Intelligence, 40(12): 10306–10314, Mar","venue":null,"work_id":"79bff8b2-32d2-46bf-b4f8-2eeb48125739","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.120867Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:e7fd4b26b4c0e9a1714c209a9101e1c9aa6ffb9a8b1f6bf37e4f51ba79356f91","observation_id":"33ee0171-b0d2-45d6-a8c8-35bc4f89def1","resolution":{"observed_at":"2026-08-05T04:53:13.238886Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.117078Z","title":"Let’s verify step by step","venue":null,"work_id":"4d1bd1fd-a4e5-44fe-8832-05115f4897a4","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.148046Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:2fb6fe9903bb38d95d4954050f6f18ec0b6688077139340ef35f0e23804beda7","observation_id":"9f59fc7c-c5ff-4cb9-9a09-f4498dc40694","resolution":{"observed_at":"2026-08-05T04:53:14.121834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.152614Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.152614Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:800dc3f145a6dc8b864a28b6349233c53e0efbef46b9230d315d623084ddf4f3","observation_id":"7480c158-ceb8-4a12-b726-2534a5dde6e2","resolution":{"observed_at":"2026-08-05T04:53:13.152614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.133520Z","title":"Backdoor cleaning without external guidance in MLLM fine-tuning","venue":null,"work_id":"040e94f2-2c30-4f8c-99fe-4871e8b873d7","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.133448Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:9b6ff619d1bc568e7317bddf6a5d67e32e9044819f9be1fdeefe97b5d4811ce7","observation_id":"f23d5009-9e53-4424-922c-c96b54579004","resolution":{"observed_at":"2026-08-05T04:53:14.138677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.068957Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"5e956024-f44b-42b6-8695-c8f1f39a97b4","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.161276Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:69fafd7c24795ff29477f0e28d60aec5620b4833000a5699861b706fe63e2abf","observation_id":"d32c9b7a-0a3b-45a1-8917-2b78a3643fa0","resolution":{"observed_at":"2026-08-05T04:53:14.074366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19457","last_updated":"2026-04-07T03:23:13Z","snapshot_observed_at":"2026-07-06T22:33:48.680749Z","submitted_at":"2025-10-22T10:41:57Z","title":"MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.19457","snapshot_observed_at":"2026-08-05T04:53:13.142470Z","title":"Mined: Probing and updating with multimodal time-sensitive knowledge for large multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.142470Z"},"links":{"cited_paper":"/paper/2510.19457","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d10937a0eb3955deadd1338e8c35f2484d8c5be1c303f815cb2b3a811eae9ead","observation_id":"a51bb7c4-78cd-4b2f-99bc-40b975e53ee3","resolution":{"observed_at":"2026-08-05T04:53:13.142470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.087361Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning","venue":null,"work_id":"567f243c-dd72-4412-a565-27fe33c97377","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.156977Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:39b3aa55a46910fb8d73175c4a9423cf6b8ead043ab6da4aecc2a60e44039f17","observation_id":"74b080b8-944d-4d8a-a72b-534a39c68219","resolution":{"observed_at":"2026-08-05T04:53:14.092400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-07-06T14:12:45.730577Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-05T04:53:13.165423Z","title":"Generating sequences by learning to self-correct, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.165423Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c8195597101df6be5d33f3bc3e95d21c2d1df26d836a288468ea83c641e50dfa","observation_id":"76c6f394-d6e1-4557-8a99-8089f7dcf0cb","resolution":{"observed_at":"2026-08-05T04:53:13.165423Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.051860Z","title":null,"venue":null,"work_id":"03da5b6f-4154-4db7-8444-5ac473d9f5fb","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.170212Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:cb4decfaa19a85807052f53cfdef9c1a3fca05ce42a77f36f8f895e29c6d4e2d","observation_id":"4a368c62-a29d-4e6e-9f93-ecdb5d9c6a58","resolution":{"observed_at":"2026-08-05T04:53:14.057496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.034352Z","title":null,"venue":null,"work_id":"f6297529-50cc-441d-8b9d-c0d6ac0b5ecc","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.175101Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:caa57dbe28141cf11e370d1df3da9ca1f3793067abb0241341a3f363b33a1797","observation_id":"cc02cac2-914a-4afa-830f-3f0e1a453564","resolution":{"observed_at":"2026-08-05T04:53:14.039323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.015435Z","title":null,"venue":null,"work_id":"e340877d-049e-492a-9316-78830a1ac9be","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.179774Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:5703df757ee491e2bcc4799a0a65f4b42f540047093bb77a3fa5036b03f978cd","observation_id":"e82dd163-107b-494f-8a7d-0843a8f6677a","resolution":{"observed_at":"2026-08-05T04:53:14.021601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.997402Z","title":"17 Figure 10Case Study: Reflective Reasoning (Success)","venue":null,"work_id":"3cc9a0b0-4dc0-4d48-815e-d318e00a53da","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.184559Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:e2b6119ff0e245539bc06afcafe6fce9ad56cdc617487b498c093aeb4e6c1307","observation_id":"615e3fea-8876-41e4-b695-975684456f7a","resolution":{"observed_at":"2026-08-05T04:53:14.002582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.980536Z","title":null,"venue":null,"work_id":"acf5457c-d3cf-4275-8636-3d82dac01b1c","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.190617Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d7af648a6f5a86b59636ce58e303a5d87c9bc55c5ce28918bf7f8996a76400c6","observation_id":"165e5c50-9541-4901-b645-34bffda28b24","resolution":{"observed_at":"2026-08-05T04:53:13.985398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.963754Z","title":"The reference solution suggests there were some errors in the previous attempts. Recomputing:","venue":null,"work_id":"705efd24-3382-4ec8-8add-a3c9a1726c5b","year":2048},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.195296Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:266d54e9586a8773c7ec14acad6d111bbf7a7bc594be35d12f92b35a84e02e12","observation_id":"185dcd77-df9f-48aa-b89b-249267a1f57f","resolution":{"observed_at":"2026-08-05T04:53:13.968802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.456909Z","title":null,"venue":null,"work_id":"d7850cd8-4169-4d9b-a470-7a0d72102e80","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":483,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.962737Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:6d145ecd6680c1465871096731553a84bc64e5104accd4ae262c7778009ea933","observation_id":"c1872307-fff5-456f-8650-4dfb8e02e1e9","resolution":{"observed_at":"2026-08-05T04:53:14.461761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:12.971795Z","title":"https://thinkingmachines.ai/blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.971795Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:0a317af69d3367d937750e0caa4472ccbb96ea31c6d51593df892c33deecd7ca","observation_id":"edd914fa-d6f8-45f0-8048-8e58b2befa49","resolution":{"observed_at":"2026-08-05T04:53:12.971795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.248768Z","title":"URLhttps://openreview.net/forum?id=9SkkifLopZ","venue":null,"work_id":"28dce8ab-c5b4-488a-bf87-d8810cf57929","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.042559Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:4af61d7e72bf79fb652a87f2b0860f76a8df58ecc239307a010090cfb2a56ac8","observation_id":"3fa1c871-1e68-4fbe-a32c-6e00ee3212e2","resolution":{"observed_at":"2026-08-05T04:53:14.253295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T20:31:36.297460Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":6,"verified_fuzzy":22},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2608.03972."}