{"as_of":"2026-08-17T00:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cced77ad6e4dee6b495be73f2a28deb86cd80371a61d4924bf664951b76e0d8e","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:16:03.097264Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:58.173572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.036901Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-15T15:49:58.173572Z","title":"Bread: Branched rollouts from expert anchors bridge sft & rl for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.173572Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:e7e3a7bd32f8bbf3bbb7f85336b914b83b44a35d4eafbc474aa17a382dd7bd54","observation_id":"8858a5b0-372f-42e1-a199-4c9d910cbcb6","resolution":{"observed_at":"2026-08-15T15:49:58.173572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-04T10:39:29.735455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-15T14:38:03.694568Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:29.735455Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:99efc38ed5f5563755f54f514cc9c0d0b3f4695a8a30293d8e99dbbfac33f98a","observation_id":"ce6002ff-3b9b-4330-81cc-1e7f8f8433b4","resolution":{"observed_at":"2026-08-04T10:39:29.735455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2512.18857","last_updated":"2026-05-07T11:50:40Z","snapshot_observed_at":"2026-08-11T16:17:51.317812Z","submitted_at":"2025-12-21T19:01:35Z","title":"CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T20:25:35.573805Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2512.18857"},"observation_digest":"sha256:d36ed06328616a21ee61e867f9d56b5628c00eb10585d4cc58f45bdca0762b53","observation_id":"5f7d246d-fdc6-4496-bda4-305a41ec8b45","resolution":{"observed_at":"2026-05-16T20:28:24.110253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2601.14249","last_updated":"2026-05-25T10:44:31Z","snapshot_observed_at":"2026-08-14T13:01:24.034567Z","submitted_at":"2026-01-20T18:58:10Z","title":"Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T12:23:56.318846Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2601.14249"},"observation_digest":"sha256:e0530e4d78a40404caa53355b2e98385bf6c0f5fe75a732abdd5c0ebe7c50695","observation_id":"1f90e798-f156-4265-bbf2-6bb762263edc","resolution":{"observed_at":"2026-05-16T12:27:52.342148Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-03T09:22:48.248328Z","title":"BREAD: branched rollouts from expert anchors bridge SFT & RL for reasoning.CoRR, abs/2506.17211, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14249","last_updated":"2026-05-25T10:44:31Z","snapshot_observed_at":"2026-08-14T13:01:24.034567Z","submitted_at":"2026-01-20T18:58:10Z","title":"Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T09:22:48.248328Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2601.14249"},"observation_digest":"sha256:b816930317c27a8a152d547e4b7b6527ad22f563c5fd851e2ab6d837d8af41e0","observation_id":"cfa911e6-f72e-4014-9b58-18e0a0cdc9d4","resolution":{"observed_at":"2026-08-03T09:22:48.248328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2601.20829","last_updated":"2026-05-09T10:47:17Z","snapshot_observed_at":"2026-08-16T03:14:48.033073Z","submitted_at":"2026-01-28T18:29:21Z","title":"Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T10:26:45.961575Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2601.20829"},"observation_digest":"sha256:7370dd866d33fbc40412300c3a2e9d6459464b95a06eef89efd6cac433e2111a","observation_id":"ac947f1f-e450-4296-bbf3-914c59795de6","resolution":{"observed_at":"2026-05-16T10:27:44.472349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":176,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:491b7698d64c7d1b38221b181674acc7755b5a01357b1067e278dbb1891a2b66","observation_id":"4868544b-4871-43fe-87d0-83e5fc4872bf","resolution":{"observed_at":"2026-05-10T23:15:49.398090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-08T09:54:59.992034Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:c8db1fcb03866f45b09efe70609fdb748316c5df336d1a9aa1bb562704200b97","observation_id":"c3895e82-69c5-49c9-b926-1d6b03232eeb","resolution":{"observed_at":"2026-05-19T18:02:42.454864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2605.15726","last_updated":"2026-05-15T08:22:59Z","snapshot_observed_at":"2026-08-15T14:05:20.816227Z","submitted_at":"2026-05-15T08:22:59Z","title":"Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T19:18:52.845177Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2605.15726"},"observation_digest":"sha256:5fe50ec8edfae5e0b475f35365411a472015e3b7e93a07abbe359298648585ec","observation_id":"75445301-2356-42f7-b965-df56af58a95b","resolution":{"observed_at":"2026-05-20T19:18:54.388644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:9bdfeb335a92d3fb97f5dc45b8a2b7f22f4f10ce60c4650c5af22b008a601427","observation_id":"6a6d3607-e3c6-4c8e-bcca-e0ce1ebe180d","resolution":{"observed_at":"2026-07-03T20:48:56.194931Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.17211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-04T16:29:57.036901Z","title":"Ceva’s theorem","venue":null,"work_id":"cb32cd66-e7f9-4795-bb6b-7dad403f73da","year":2025},"citing_paper":{"arxiv_id":"2606.24064","last_updated":"2026-06-23T02:14:12Z","snapshot_observed_at":"2026-08-12T14:22:41.219698Z","submitted_at":"2026-06-23T02:14:12Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T00:39:29.703711Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2606.24064"},"observation_digest":"sha256:c12e8311bc3fe6e45d28b0e91d41dc8f5495190af05290d262fcd6254c3e1fe9","observation_id":"8a73fa41-b0de-4b66-9516-1b598333ed61","resolution":{"observed_at":"2026-07-04T16:29:57.038563Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-02T14:45:21.888557Z","title":"arXiv preprint arXiv:2506.17211 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16205","last_updated":"2026-05-07T13:16:09Z","snapshot_observed_at":"2026-08-05T18:20:48.142001Z","submitted_at":"2026-05-07T13:16:09Z","title":"It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T14:45:21.888557Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2607.16205"},"observation_digest":"sha256:33d59851bc85ca12a75e4336b4610843235916ef2c3e77a12adf0cc675262516","observation_id":"f74b1d37-d4a9-4f65-a79e-667f30daddb4","resolution":{"observed_at":"2026-08-02T14:45:21.888557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-01T12:54:36.704591Z","title":"Bread: Branched rollouts from expert anchors bridge sft & rl for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-12T20:21:39.140409Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:36.704591Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:821372adaa17bf22f7bd0eca99f512e485369567bb0e36b84c74433f10b28992","observation_id":"4499d63a-74c1-46f9-9299-604148447797","resolution":{"observed_at":"2026-08-01T12:54:36.704591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-07-31T21:13:06.807478Z","title":"Zhuosheng Zhang, Aston Zhang, Mu Li, and Alex Smola","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24199","last_updated":"2026-07-27T09:24:41Z","snapshot_observed_at":"2026-08-14T07:25:50.453765Z","submitted_at":"2026-07-27T09:24:41Z","title":"Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T21:13:06.807478Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2607.24199"},"observation_digest":"sha256:f9693f0eb1e47dcbcf44c85ec3443cb9f6e8d12fd4d3d0fa38e2ff00996c7c5a","observation_id":"cabe3706-fffd-4c42-8540-0b7c87b376a6","resolution":{"observed_at":"2026-07-31T21:13:06.807478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17211/citation-record","integrity":"/paper/2506.17211/integrity","json":"/paper/2506.17211/citation-record.json","paper":"/paper/2506.17211"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-15T19:16:02.866049Z","title":"Phi-4 technical report.arXiv preprint arXiv:2412.08905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.866049Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:7d4b0fc6e98e06bd4214f70b755e406f0e8d25ab195c38f9c92109e3ead2cf1b","observation_id":"8b615c96-ca91-46e9-918f-b020b315d4df","resolution":{"observed_at":"2026-08-15T19:16:02.866049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-15T06:09:25.789897Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-15T19:16:02.871865Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.871865Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:565cbcf08d739e6dc3217460bf71379041e3475b0ec7f64fdf05ab43b35c4963","observation_id":"bff033ec-fa38-4fdf-be7e-a22e310e3686","resolution":{"observed_at":"2026-08-15T19:16:02.871865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.876897Z","title":"Hindsight experience replay.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.876897Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a1e041a95ec51da6e7d7185ed7fb3005cd309f79800923d58e127ec8da1b0be8","observation_id":"3ec446cf-31e8-43e2-9d83-7930ac67c78b","resolution":{"observed_at":"2026-08-15T19:16:02.876897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:04.066537Z","title":"Thinking fast and slow with deep learning and tree search.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"d68daf9e-5fd8-45b6-9d66-3364e2afcad3","year":2017},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.881939Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:2473e200f58a538cac201c233776fc3651a3e6505c88ea5df6e98be633380878","observation_id":"40101499-a613-40ac-80cf-f556f124128c","resolution":{"observed_at":"2026-08-15T19:16:04.072720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-08-10T11:59:11.481480Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-15T19:16:02.886610Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance.arXiv preprint arXiv:2305.05176, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.886610Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:3228082c0217b3654c747e09d12418a235b0b4ab7ffdf2c4f8f5f154e015ccb2","observation_id":"53069f5d-a754-4445-a10c-53637e29997d","resolution":{"observed_at":"2026-08-15T19:16:02.886610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-15T19:16:02.891209Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training.arXiv preprint arXiv:2501.17161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.891209Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:ee755f24a63a966cca19a1fd1be3c7902aa9c67ec013d3f68fbd36ece64172c4","observation_id":"90e7283d-54d3-4a8e-a0c5-0a7f978140b2","resolution":{"observed_at":"2026-08-15T19:16:02.891209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.896490Z","title":"Cambridge university press, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.896490Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:c0da9df7e117a769647524eea8f951e5500612687aa967d4627c082b407ffe90","observation_id":"46184443-4e7b-44fa-b5d6-6cb689cf7460","resolution":{"observed_at":"2026-08-15T19:16:02.896490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.900845Z","title":"First return, then explore.Nature, 590(7847):580–586, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.900845Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:c40fe00fd140e8c631cc0e1286edfac519436a4a912f2d01476ed1d89d359016","observation_id":"b16e010d-9345-4da8-8280-419adc28b9b7","resolution":{"observed_at":"2026-08-15T19:16:02.900845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.905412Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.905412Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:0c7b129331db7f48d9cc4d4e3328fecc3490f650626bf4b8e221c483d853ce67","observation_id":"bb6da3df-2c18-4ef9-b9d3-fb78a3111f55","resolution":{"observed_at":"2026-08-15T19:16:02.905412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.909702Z","title":"John Wiley & Sons, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.909702Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:2bf69aaf963986353934560a61ec78f9afc364f07f5d25bbe7c0c4a0101c88d9","observation_id":"95f2eeb4-fba4-4c28-b47d-64dbf3543f6e","resolution":{"observed_at":"2026-08-15T19:16:02.909702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:04.011346Z","title":"Gemini 2.0 flash thinking mode (gemini-2.0f lash-thinking-exp-1219), 2024","venue":null,"work_id":"3dddcd5d-b6c6-45d9-b386-e210be5c6c8b","year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.913842Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:e1f6f4374cac7a83ea72adb80263fa7bb6d44d201c1fa8ebc47114ad6fcc4884","observation_id":"5dffc416-524d-4e91-abcb-c34974ad2785","resolution":{"observed_at":"2026-08-15T19:16:04.016087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.994574Z","title":"Last updated 14 May 2025","venue":null,"work_id":"5a42edbc-cf8a-48f3-8f3f-a2d1998342ff","year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.918543Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:7142b8f9576392e605dc31f94dffc42177b9f85d88241e4ce56ce01eb7d65206","observation_id":"c63d430d-3448-4853-9228-fb9d71aa8f35","resolution":{"observed_at":"2026-08-15T19:16:04.000613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:16:02.923811Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.923811Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a6c2da695b0673c4bedcbda5e71d9128080e7d49ff85f06cb54e3d8a60dcc214","observation_id":"60bd52a3-f3e7-4bf1-b07b-3ae0b83e56ce","resolution":{"observed_at":"2026-08-15T19:16:02.923811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.975576Z","title":"Language model cascades: Token-level uncertainty and beyond","venue":null,"work_id":"57bf5b60-eb8a-46e1-ade0-431815be09de","year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.929119Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:20df1629ca50dd60c80153e44ad517d4fd254489808f48f823028c0c42c6b81d","observation_id":"887f31d0-d506-47fd-872b-fb9905231a5a","resolution":{"observed_at":"2026-08-15T19:16:03.981982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T19:16:02.934244Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.934244Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a6df1a0a36a5cef5cc19dad5f2c19d64c9c764a9da62e1edd474a926a696b83b","observation_id":"8b12159c-15aa-4e5f-9e03-c6baea6a4a4a","resolution":{"observed_at":"2026-08-15T19:16:02.934244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-15T19:16:02.939368Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.939368Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:74f856c0df2c0b7e6f42e09ee517cf25220c44d4daaeb027cae788cd56718723","observation_id":"64f3349c-3e61-4df2-9aab-ae5b96d69797","resolution":{"observed_at":"2026-08-15T19:16:02.939368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T19:16:02.944860Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.944860Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:ad57d68bdef3cb37102915e2e6dcca0597aa839038cb4413c0f5f0b7ff31caa5","observation_id":"593e18c5-091f-4cbc-bda4-82ccc16f7fdc","resolution":{"observed_at":"2026-08-15T19:16:02.944860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.949516Z","title":"When to trust your model: Model-based policy optimization.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.949516Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:e631be4b48b78bcebe087d7f8e8bd7850ffc5087f2a490619ad0fb7f31dbfcb7","observation_id":"1ecc5a44-9a45-40c7-8ef7-f3a14d1e6ffd","resolution":{"observed_at":"2026-08-15T19:16:02.949516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.948720Z","title":"Gemini 2.5: Our most intelligent ai model","venue":null,"work_id":"7831a9c3-779c-4488-91ee-dbad9f2566c1","year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.953808Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:e9315acbc1779a203767f6b3442d173dd029dc9e827779a5c03386b83f14fe2e","observation_id":"db10e8a0-6ee5-4b4d-9b18-f884620abb2d","resolution":{"observed_at":"2026-08-15T19:16:03.955605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T19:16:02.959368Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.959368Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a716750e4c370b1bff553f29f9735e82201dd6ce7df15f25352035516def27bb","observation_id":"561abd4e-f2d3-4c36-ba0e-16811971c35b","resolution":{"observed_at":"2026-08-15T19:16:02.959368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.963817Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.963817Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:39f56c0f55b1822131ede69eb332bf590df8b30e75305f82a998948d310601b2","observation_id":"b8ebe66f-f197-404e-81f2-68354b35d613","resolution":{"observed_at":"2026-08-15T19:16:02.963817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.968436Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.968436Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:5d906aea10bc626cd8d2bb3570f62ce72a7003e3c9c92b3c54e85ef09a0f69d8","observation_id":"8a63cfc0-16ac-42ff-a5f1-6966c7208a85","resolution":{"observed_at":"2026-08-15T19:16:02.968436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.974542Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models.arXiv preprint arXiv:2503.22342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.974542Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:c4f1a714a2d7e9cedfb60889b86125d81f0d8a09776eeb3ed2cc9a6306d4cbb0","observation_id":"31d7cf98-6696-4645-9e55-af9e5cc7b8fa","resolution":{"observed_at":"2026-08-15T19:16:02.974542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-14T11:38:51.383664Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T19:16:02.979296Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.979296Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:1710ead9bc0b8215a0e9533a3770c490ff0431b78ca71701c8ab9cb05b47cf6f","observation_id":"750e1d5a-a226-47c7-9ccd-5fb331ba6c16","resolution":{"observed_at":"2026-08-15T19:16:02.979296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.983665Z","title":"Policy invariance under reward transforma- tions: Theory and application to reward shaping","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.983665Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:56ead4b9b3c4e154976a6e9b1de44590210bd7f53cc92b5296cf63aaa69b7cf2","observation_id":"79ecc836-e87b-44cc-95b4-944d64316795","resolution":{"observed_at":"2026-08-15T19:16:02.983665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-16T12:51:25.160206Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-15T19:16:02.987946Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.987946Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:f737810b5bc5796cbf0dec4bd56c10e28d268af34a9de9f2a6fb5ab3b655d6f3","observation_id":"e71d2799-3c7c-4413-bd60-515ceabb671f","resolution":{"observed_at":"2026-08-15T19:16:02.987946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.993576Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.993576Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:d4f6415e526aeaca4114e6321c2cff3d19a871710358b3de1874b584a2ad9264","observation_id":"90f601ef-e550-4ff5-9a70-5cd29c1831fc","resolution":{"observed_at":"2026-08-15T19:16:02.993576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:02.998282Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:02.998282Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:89deb5bd6e1c0705701c19e4b4c5e74a30cca6ee080aa81a97d89a728c342e8f","observation_id":"0b12fe50-36a1-4ed4-a833-24583098b27d","resolution":{"observed_at":"2026-08-15T19:16:02.998282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.002579Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.002579Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:9bb813d41dc16631aa2a8304e407ba42d5fba9176637da5520d6ad30c894829d","observation_id":"bfce9b3b-e663-4831-87a3-f3aa9ae05b31","resolution":{"observed_at":"2026-08-15T19:16:03.002579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-08-16T14:30:39.251880Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-08-15T19:16:03.007339Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws.arXiv preprint arXiv:2401.00448, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.007339Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a22e03086155071a9de762d92f91ae3507b1d4ba17e0bbff1cc15f8dc9f52a8d","observation_id":"5a39a7a7-8e3e-4c8f-a3e2-68d6bea889d8","resolution":{"observed_at":"2026-08-15T19:16:03.007339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17416","last_updated":"2025-02-24T18:49:05Z","snapshot_observed_at":"2026-08-16T12:55:37.745518Z","submitted_at":"2025-02-24T18:49:05Z","title":"Reasoning with Latent Thoughts: On the Power of Looped Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17416","snapshot_observed_at":"2026-08-15T19:16:03.012015Z","title":"Reasoning with latent thoughts: On the power of looped transformers.arXiv preprint arXiv:2502.17416, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.012015Z"},"links":{"cited_paper":"/paper/2502.17416","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:c460ad4183bc3418f14d34946afdcb50b054908ca6ab6de06fd30cc74b49be71","observation_id":"9ac2be1a-098e-4b41-9f47-060728cf6955","resolution":{"observed_at":"2026-08-15T19:16:03.012015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-08-14T19:37:32.915923Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-15T19:16:03.017958Z","title":"Kickstarting deep reinforcement learning.arXiv preprint arXiv:1803.03835, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.017958Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:e6601c08f8265250a7539b8cc802ebdf2554def810d5fe623856b92eded9fafb","observation_id":"d093823e-5fac-45d9-906e-229a3be8aed3","resolution":{"observed_at":"2026-08-15T19:16:03.017958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T19:16:03.024037Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.024037Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:0d26714c796a5a28b61bbdd22265a4b17b83ed989d4498dd16ddde3353b0c844","observation_id":"2e4a7f8f-8989-4f57-8d08-2f8206a9bb91","resolution":{"observed_at":"2026-08-15T19:16:03.024037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-15T19:16:03.029744Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.029744Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:1a92e47a2cfac89e2b49e6a1fb5a96a703680af23b2a909e6f71254315afba7e","observation_id":"f6081e96-a962-48bf-a4ab-1701783111e6","resolution":{"observed_at":"2026-08-15T19:16:03.029744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T19:16:03.034557Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.034557Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:3cee5283c6087b53bc79970627a944c49ea19677ab8c03f8f42af9acbcd1e098","observation_id":"ebe15589-435c-4504-918b-7ce1d9456038","resolution":{"observed_at":"2026-08-15T19:16:03.034557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T19:16:03.039661Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.039661Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a7a8362c201911216ef6842982e055ce829fe400d5428e2a421994f9e326ea6c","observation_id":"b70788f5-3f86-4eb3-9235-0ec5698f3ca6","resolution":{"observed_at":"2026-08-15T19:16:03.039661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-14T20:44:55.096659Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-15T19:16:03.044142Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards.arXiv preprint arXiv:1707.08817, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.044142Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:787703a80b4f168765566cabd0a03286024faf97f75f04a7dbd4282d7007579f","observation_id":"10649a21-2386-426a-b0e4-a1094e740573","resolution":{"observed_at":"2026-08-15T19:16:03.044142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.049112Z","title":"Dump: Automated distribution- level curriculum learning for rl-based llm post-training.arXiv preprint arXiv:2504.09710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.049112Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:43e5722148a66a7924ed6b903f76a73185162ba8f75866a995fb722fe94aa27e","observation_id":"5469da06-763c-47c3-8758-f199384891e6","resolution":{"observed_at":"2026-08-15T19:16:03.049112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.058965Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.058965Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:b56ef0b0261bb3646f8b03dfe4be514b2d023dfab0241b970b78a62254d3c105","observation_id":"0876de9d-3300-4349-b82f-43b06698d209","resolution":{"observed_at":"2026-08-15T19:16:03.058965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-15T19:16:03.063494Z","title":"Not all rollouts are useful: Down- sampling rollouts in llm reinforcement learning.arXiv preprint arXiv:2504.13818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.063494Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:e65f58ccddd0c431c9c6711284b99731e4b7293a9c55e78424dc3a3c94dc3194","observation_id":"18c17d81-78aa-4fc5-9c1d-c31bce1bb703","resolution":{"observed_at":"2026-08-15T19:16:03.063494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T19:16:03.068079Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.068079Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:a2e44ff27605a03612a2fcb065631249c08f74692da442c9ba10d5ebdd0d49cf","observation_id":"f67e7e05-8d2a-4de4-942c-4630b9cd4e06","resolution":{"observed_at":"2026-08-15T19:16:03.068079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-15T19:16:03.072738Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.072738Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:67976856ae2154c72730fafcb161c80f04e11faf3a9e3bf9ec8ac1c1c7ba1d3e","observation_id":"1f9b2c27-53a9-4594-988e-304daa042a40","resolution":{"observed_at":"2026-08-15T19:16:03.072738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-16T20:48:14.262696Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-08-15T19:16:03.077573Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.077573Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:04c839af961d2e4ed833df60607dc4f9222938ce703ffd02a5f10a6af90fd171","observation_id":"6820098a-2d10-4b21-ae17-00996f34dbae","resolution":{"observed_at":"2026-08-15T19:16:03.077573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.875370Z","title":"” or“\\n","venue":null,"work_id":"5d8efcbe-2b21-422e-90f3-b82d5400cecb","year":2024},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.082278Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:4fa1ff0550ef1bb418f300e9e8de9258c45f809add85981836da8738339b8fbd","observation_id":"f0536afb-af6a-499c-8e9f-d05b9d33ac9d","resolution":{"observed_at":"2026-08-15T19:16:03.880067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.856343Z","title":null,"venue":null,"work_id":"96c41e3e-01e0-4801-869d-0dc5e0ecca84","year":null},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.087736Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:bb4fd67768aaf3910581f0bbc4827ee4af6fc17bf46f42fa2b1ecb32c943b203","observation_id":"c520faaf-ed47-4b73-bd70-c212a9150b9e","resolution":{"observed_at":"2026-08-15T19:16:03.861787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.838680Z","title":null,"venue":null,"work_id":"4528817b-4c25-4c65-95c0-c70d074f1f48","year":null},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.092614Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:3d791b7407c3bd3b745407afd87bac03092d6e2cff308ccd3d80a7f1f38bee8b","observation_id":"163ff7ed-6a39-4c59-a15b-3d761b97bdcb","resolution":{"observed_at":"2026-08-15T19:16:03.844225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:16:03.820817Z","title":null,"venue":null,"work_id":"80258d49-4b93-4cfe-aaba-f262b6e146b8","year":null},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.097264Z"},"links":{"citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:5c4288a1aa0f4878e19130e250b90936750270cf30562ae90d07bbbb01a62b4c","observation_id":"46d42dce-87aa-4f7d-9e79-b9470f81b9ae","resolution":{"observed_at":"2026-08-15T19:16:03.826514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 14 inbound Pith citation observations for arXiv:2506.17211."}