{"as_of":"2026-08-09T19:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a00791ca79ed5f24b5b10e436198e671d28e28c77ec61510c43448722f377e7e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:17:46.033521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.922599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:44960e2dfcbb69d5f52091cfa9d7e2ed1e52ace927106cd6092f74853cab6ebd","observation_id":"751ebca6-97a9-4d89-845a-c0bddda875f0","resolution":{"observed_at":"2026-05-17T16:18:01.688186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2412.21139","last_updated":"2025-06-06T07:53:20Z","snapshot_observed_at":"2026-07-06T20:14:49.976782Z","submitted_at":"2024-12-30T18:15:39Z","title":"Training Software Engineering Agents and Verifiers with SWE-Gym","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:20:40.483057Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2412.21139"},"observation_digest":"sha256:00eccfc331e1040f8fb6b80360d7ed67fda16bf509bbc362b3f2000efd795a49","observation_id":"fe2c7e9f-6eeb-4093-b116-adbf38238b95","resolution":{"observed_at":"2026-05-18T05:20:40.532699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:5935952b0a76182c60735992d0b587dfab5ce0e1fdb2b2e369e29f0921af62c7","observation_id":"bbb07ed4-5c56-43c8-9149-8d4d764f1977","resolution":{"observed_at":"2026-05-13T17:30:03.070601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-08T12:17:46.033521Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-09T02:47:59.381934Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:46.033521Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.07599"},"observation_digest":"sha256:2f2be06dc0fa6eab081dd5ee3db823ab6721c865eaf3c7696a5ff4dbe24d0ec1","observation_id":"1403d4b0-07a5-4db9-9c9d-63e497ddc699","resolution":{"observed_at":"2026-08-08T12:17:46.033521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-08T04:54:50.972531Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-09T13:56:26.887562Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.972531Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:57615be5b1db1aedf6b1191131a2649ad1287cdc21a6489cdb7a0beb487a1a67","observation_id":"165f613f-8b50-463b-87c7-d8edfa19b879","resolution":{"observed_at":"2026-08-08T04:54:50.972531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:13f6d4226223cf24f8c3f8b35128158e1eb4f86a9c43f22dabe5405a747b0bf4","observation_id":"97156b06-e60e-412f-bc12-c2c7951d7809","resolution":{"observed_at":"2026-05-12T09:43:00.303113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-07T14:29:33.431718Z","title":"Advancing llm reasoning generalists with preference trees.arXiv preprint arXiv:2404.02078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.431718Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:5c598761ef2e0d423118c35846c9b78e1d0d0f14d8b1f60ce3055e36753966fc","observation_id":"5bab72b9-5519-4cfb-8f12-b78c64860908","resolution":{"observed_at":"2026-08-07T14:29:33.431718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-06T15:40:17.967384Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-08T08:50:14.371298Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.967384Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ee0137cb4f4c0c561bba9c852a8d60cef9d202238cdbe2f47b8bf8a43e2ed7a5","observation_id":"a0780e28-bddc-4838-9500-e3b1140c06a7","resolution":{"observed_at":"2026-08-06T15:40:17.967384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-05T20:30:30.162000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:30.162000Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:6f7faa1bee3617b1b0a531d7b7e52bb3abff7f638bc3d046753719542c5e6597","observation_id":"7053f5d5-dea0-40bc-9503-8717edc46fbd","resolution":{"observed_at":"2026-08-05T20:30:30.162000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-04T23:10:21.344039Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.344039Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:ce1eb88b57618611a61414cbb7e00f7cd192da0876cc3787333d1aeb285ead0d","observation_id":"de9fd7fd-02f4-48a6-90e0-a0ae86389acd","resolution":{"observed_at":"2026-08-04T23:10:21.344039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-04T23:09:41.578345Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.578345Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:383a977f3f84b3f6d655c940caf9d260cbdb48869506c97189f9d7d3a5937668","observation_id":"66f4bc15-23dc-4d73-aba2-5d4f2540df54","resolution":{"observed_at":"2026-08-04T23:09:41.578345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-03T23:17:37.743021Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:d0204371b229f7aa99bb95ea3024b0aab489f56018f22253eec41cd36bd273b6","observation_id":"b03affbf-8748-48a8-b01b-0021ec3c3e58","resolution":{"observed_at":"2026-05-18T03:20:49.262191Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2604.12312","last_updated":"2026-04-14T05:42:41Z","snapshot_observed_at":"2026-08-02T05:56:57.097541Z","submitted_at":"2026-04-14T05:42:41Z","title":"CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:00.449776Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2604.12312"},"observation_digest":"sha256:f95229853855d44ad4e7ee7e7c1877260ffd07ff1dce85baf1dfb6a913a2ac04","observation_id":"c93977e0-94bb-4c22-9f53-e65977d49b3d","resolution":{"observed_at":"2026-05-11T11:26:02.393606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T03:51:52.375703Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:b5c7f385a223d0fe7416a3cecd84de448cf9519d572e0b5344e021c1c8137380","observation_id":"af10dbf6-ac5e-4141-b505-c0e394271f2b","resolution":{"observed_at":"2026-05-12T06:51:30.256032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T05:11:32.053440Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:fd54d47d13037ff2f1f8305d11a26c9fe9d5c0f0694a6c887b3cc9cdfe4e9e69","observation_id":"afbbf399-40d4-47e1-8cc6-6f4a444e99ce","resolution":{"observed_at":"2026-05-15T05:15:03.285300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:d99dcdc630fc23e6960c4dc9338f5b790655f152e5bae9dca87426b4e3e70dde","observation_id":"c197a95d-51d7-4132-993a-48c8947a0adb","resolution":{"observed_at":"2026-05-13T06:12:22.771833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:c8562bd216a72265fe9baa435998aa02fd4d0a7ed2fefd4dec96ff90e8a0cd81","observation_id":"cdafa392-70f2-41ba-b055-d46aef9d1d2e","resolution":{"observed_at":"2026-05-22T10:01:23.055182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2606.05434","last_updated":"2026-06-03T20:57:57Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T20:57:57Z","title":"Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T06:56:01.601701Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2606.05434"},"observation_digest":"sha256:a21bc0269257a2cba3acf433b0cc96ffc55e7c9da16be4c641fa4496af236482","observation_id":"0d72bc2b-36a2-4861-a354-1bc2b1e43cf5","resolution":{"observed_at":"2026-07-02T07:26:46.066822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:5347066c4285582445c1301c86a53633f1e06463bcadafe9dea5e353a6df5054","observation_id":"0a1dc478-abb7-42a0-b754-eaed8449afc6","resolution":{"observed_at":"2026-07-03T04:47:38.255909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":"2404.02078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-03T09:47:59.922599Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":"69390582-e713-4ce6-b7c3-ff761a90a8d3","year":2024},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:54198bdcff694bc494fdbb2d4b6421c5b4f832e6a3cce3d8513c5391c5cf6247","observation_id":"35613fd2-39ca-4567-9df6-1dd09537c8c0","resolution":{"observed_at":"2026-07-03T09:47:59.923933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3df6b751ab6d3c92b6b00ad90b1408ea8fe7c4188c5317cdfb27af11871c4de5","observation_id":"cf321595-60bd-4b5a-a8f3-66f03fa2802c","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-02T08:40:39.023948Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.023948Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:22fc84c796c3ca8f612fff945f15d12c6f3302a8406723b11cc9dd347e051f60","observation_id":"350e3b83-e95c-497e-96fa-f4c9f3db9a24","resolution":{"observed_at":"2026-08-02T08:40:39.023948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.02078/citation-record","integrity":"/paper/2404.02078/integrity","json":"/paper/2404.02078/citation-record.json","paper":"/paper/2404.02078"},"outbound":[],"paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2404.02078."}