{"as_of":"2026-08-10T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae460fbb3cee883c32b6de5f5293c9924e2618abce480b2fb905478f10ff4b7a","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:20:13.916248Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T14:03:48.795572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:04:11.992913Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2501.18858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brite: Bootstrapping re- inforced thinking process to enhance language model reasoning","venue":null,"work_id":"6a3793b5-d05e-448d-a03a-fed4c26e511d","year":2025},"citing_paper":{"arxiv_id":"2602.08167","last_updated":"2026-05-16T05:42:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-09T00:10:17Z","title":"Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T14:03:48.795572Z"},"links":{"cited_paper":"/paper/2501.18858","citing_paper":"/paper/2602.08167"},"observation_digest":"sha256:a971aa40176ec578094196c2caee6013ffa5de8006243e119f3a399b4f9e209e","observation_id":"2db48d62-948b-4d88-9904-14bf4e78f52e","resolution":{"observed_at":"2026-05-21T14:04:11.994596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2501.18858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brite: Bootstrapping re- inforced thinking process to enhance language model reasoning","venue":null,"work_id":"6a3793b5-d05e-448d-a03a-fed4c26e511d","year":2025},"citing_paper":{"arxiv_id":"2604.10701","last_updated":"2026-04-12T15:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T15:54:11Z","title":"Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:29.657563Z"},"links":{"cited_paper":"/paper/2501.18858","citing_paper":"/paper/2604.10701"},"observation_digest":"sha256:be9beda028dff0904647aa501ddac90fda4418b2251d266caa6ba15315d1ac56","observation_id":"cbaa069c-3f96-4ae6-9091-b92dcfc68acc","resolution":{"observed_at":"2026-05-11T11:06:05.172360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18858/citation-record","integrity":"/paper/2501.18858/integrity","json":"/paper/2501.18858/citation-record.json","paper":"/paper/2501.18858"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:13.633401Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.633401Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:5779622fe8e8603e49d4f417fd6e2c2bb721c37103c069593d7e0d81906697b0","observation_id":"71fe9c34-df1e-4b17-9400-6858973e54b0","resolution":{"observed_at":"2026-08-09T22:20:13.633401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:13.638251Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.638251Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:f57356eba6990badbbf94ee541297953a2ff72bfe019c2119035861fe1da2de7","observation_id":"f088fb5a-aa32-4ba1-b6f6-40ddfa2d5c88","resolution":{"observed_at":"2026-08-09T22:20:13.638251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.713676Z","title":", Kakade, S","venue":null,"work_id":"86db1627-8578-4c1e-b12f-92dedca10bef","year":2021},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.642400Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:0eb06060fdc1dea8a1a3a58eabfd926ca31eff71487d45643b55b110c2ece19d","observation_id":"e195ca26-6f57-4561-a9e6-10b2291ecac7","resolution":{"observed_at":"2026-08-09T22:20:14.717422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.703023Z","title":"Introducing claude","venue":null,"work_id":"60bd318d-f464-4f3c-a87c-81689db69715","year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.646165Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:3dc83ec32fb561d3270f443ead3594babc0fa9f8a5785ae120c4f5ec9cdff55c","observation_id":"cc7719bf-d893-4b2c-9b03-bb40bf57eeff","resolution":{"observed_at":"2026-08-09T22:20:14.706690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.692792Z","title":null,"venue":null,"work_id":"d5526701-32a9-49dc-971f-a6ccdc1bbd82","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.649958Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:144d7e33555693ee524c271f95ebf593afa3542b1114836835c29a56f8d3bf91","observation_id":"076e2db7-4171-4cf5-828f-5616832b49de","resolution":{"observed_at":"2026-08-09T22:20:14.696409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.683154Z","title":null,"venue":null,"work_id":"c9bb3122-77d4-43f9-9c50-06d83dc8cc9e","year":1952},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.653870Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:abcbc97a3a3a9b3df2f55ffe73d0ba6e8535b714ae3111c662707e9faaab3c7f","observation_id":"c2fe5741-70da-4570-9461-16546785e7d0","resolution":{"observed_at":"2026-08-09T22:20:14.686335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.673386Z","title":null,"venue":null,"work_id":"47fd6825-8d7b-471a-ac3a-07155394f750","year":2015},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.657733Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:2ec6eb4b05470c92e81b6f9e21ac5cf9e3ba602f3aeeadf1d7cc4b698c14eaa6","observation_id":"5be4c4d4-88dd-4f67-810a-34f71bdeafaf","resolution":{"observed_at":"2026-08-09T22:20:14.676919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.663230Z","title":", Yang, Z","venue":null,"work_id":"7e6108a9-c47b-45af-b32b-9205899f5367","year":2020},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.661470Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:7e1fc6765b3113d368166a3b5bb4d54639f85baaabdc46f960c14f4f1261d8b6","observation_id":"170f180c-bcc1-4a58-a02a-a38eebec5602","resolution":{"observed_at":"2026-08-09T22:20:14.666702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-09T22:20:13.665416Z","title":", Mei, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.665416Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:b05c6dff0b0ebfd45e7a7e4b5ace9c78303eb036f1e9252a4f53fa0921076cb3","observation_id":"f9fc7748-358f-4432-9874-7940b231297f","resolution":{"observed_at":"2026-08-09T22:20:13.665416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-07-06T19:46:24.121362Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-08-09T22:20:13.669361Z","title":", Feng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.669361Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:76bb7b2ac8b64e4b8d055f89fd74d09b78bda647ad84e51a61ebc88711986338","observation_id":"28fc5344-66f0-4006-81e0-516a0875b960","resolution":{"observed_at":"2026-08-09T22:20:13.669361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.652782Z","title":", Zhong, H","venue":null,"work_id":"ae5e22ce-1708-48f8-bdc2-46039b5c51b8","year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.673021Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:41c96188062007a9a86e570b2560b504081e887f67efea2217f9122160f7aaf9","observation_id":"b907da4b-ebc8-4c88-ba8f-7e61c58abe4c","resolution":{"observed_at":"2026-08-09T22:20:14.656454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.641988Z","title":null,"venue":null,"work_id":"2ddccb0a-6cdc-4782-a515-66261d5bee2f","year":2017},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.677216Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:3b33a6b4450b3cafbe1e0086de3c28ad684c77e7218ef4d97a9c3e2f78d753e7","observation_id":"151f09de-fc19-4add-b169-4ab3a373d826","resolution":{"observed_at":"2026-08-09T22:20:14.645632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-09T22:20:13.680732Z","title":", Kosaraju, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.680732Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:23374995694e7ab414baebaa4bee35381116d9af4b8626403facd3437688ba06","observation_id":"99a9f4d3-1a24-4259-bb1a-f77dd1726b1d","resolution":{"observed_at":"2026-08-09T22:20:13.680732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.631876Z","title":null,"venue":null,"work_id":"0ea8ddf6-ccaf-42e5-af94-70e7c39b0b2c","year":1977},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.684721Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:b5b79717b945a8c33819adcce6d8e7045638e49f3c8782a3c9ed57e8706804d0","observation_id":"cee18fd6-77cc-417c-9f2d-271f43a01737","resolution":{"observed_at":"2026-08-09T22:20:14.635329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-09T22:20:13.687997Z","title":", Xiong, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.687997Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:8ee296b76fcd4e5c3be1bf9de5871d1fedf29eefb32c6fd95ce6057212168980","observation_id":"9c860370-c1f9-429c-8617-95cc1eab5d8a","resolution":{"observed_at":"2026-08-09T22:20:13.687997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05344","last_updated":"2023-10-09T02:11:21Z","snapshot_observed_at":"2026-08-04T14:32:30.985858Z","submitted_at":"2023-10-09T02:11:21Z","title":"SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05344","snapshot_observed_at":"2026-08-09T22:20:13.691866Z","title":", Wang, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.691866Z"},"links":{"cited_paper":"/paper/2310.05344","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:d0c3538d1a9730fbdacd07f24a96d9a199e34cf00f7f96efca06d0534e878b3b","observation_id":"6eac74c1-acf7-456a-abaf-aaef16daf23b","resolution":{"observed_at":"2026-08-09T22:20:13.691866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-09T22:20:13.695913Z","title":", Paine, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.695913Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:46dbf9dec44e87f5a36c67ed8144b429f86d562b1b731849d8fb725a87afd410","observation_id":"b9e83fa6-3446-46d5-9f24-12ff698aa7ba","resolution":{"observed_at":"2026-08-09T22:20:13.695913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07704","last_updated":"2022-10-22T13:32:13Z","snapshot_observed_at":"2026-07-06T11:19:14.191458Z","submitted_at":"2021-06-14T18:48:40Z","title":"Efficient (Soft) Q-Learning for Text Generation with Limited Good Data","version":4},"cited_work":{"arxiv_id":"2106.07704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07704","snapshot_observed_at":"2026-08-09T22:20:14.313913Z","title":"Efficient (Soft) Q-Learning for Text Generation with Limited Good Data","venue":"cs.CL","work_id":"e26d86e9-f978-4654-a1f3-8b55f8e86bc9","year":2021},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.699639Z"},"links":{"cited_paper":"/paper/2106.07704","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:fd748eb73368abf6141ed8ac574ccd7bb1cfe07244665a76589ea56fcbbddbfb","observation_id":"1a1b9781-fcba-44e3-9fae-0bc47470c146","resolution":{"observed_at":"2026-08-09T22:20:14.320291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.622163Z","title":", Luo, R","venue":null,"work_id":"1d6b3886-65e6-438f-8ef6-5afa47a0e75b","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.703511Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:fa9885ef3944a388dffc03e62ca4aeb7afd6959ff3c8756190ffb21915b2cd9c","observation_id":"ce2ba8c8-db78-404f-8dd7-5ee390bc2fc5","resolution":{"observed_at":"2026-08-09T22:20:14.625702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-09T22:20:13.707110Z","title":", Burns, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.707110Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:b7f1a3eea19dcb9276113de65c6dc9128c9f60f233624e2e2e7023fbb885809c","observation_id":"e8e0d51b-a1a0-47f0-aea8-e03856666c41","resolution":{"observed_at":"2026-08-09T22:20:13.707110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.612244Z","title":null,"venue":null,"work_id":"e3404e0e-5563-4cf7-9af7-55522e9e163f","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.710609Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:5738dee9947be2b78f1e84e55fc90afafc93e51005e02e61f16dcf5a3f23c5d0","observation_id":"6a29718f-ea22-443e-b189-5f8fbc076a78","resolution":{"observed_at":"2026-08-09T22:20:14.615720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04363","last_updated":"2024-03-13T22:48:14Z","snapshot_observed_at":"2026-08-08T05:02:43.473755Z","submitted_at":"2023-10-06T16:36:08Z","title":"Amortizing intractable inference in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04363","snapshot_observed_at":"2026-08-09T22:20:13.714127Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.714127Z"},"links":{"cited_paper":"/paper/2310.04363","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:fdfdad0be694ed61eb356dedfea09cc95ac672c6e9e0385e5f9fc0c3080300f9","observation_id":"eaa27419-dfab-48d9-b8e1-6d3854144ef1","resolution":{"observed_at":"2026-08-09T22:20:13.714127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T22:20:13.717907Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.717907Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:bb4fd0de9af2e4c45270377ab9c13b3416df8079c7ba0602e0ac453f60e48ab6","observation_id":"ff84e239-6f43-4fc3-b2a0-022f6d2f7eba","resolution":{"observed_at":"2026-08-09T22:20:13.717907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-08T14:21:42.036023Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-09T22:20:13.721525Z","title":", Cheng, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.721525Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:59fde1864b1ebd24fdb20141a89cb8c87c06fcb82dc7b431d393b45b4e5977f4","observation_id":"4eb03066-89ec-4e72-aa4b-7c294afddd0e","resolution":{"observed_at":"2026-08-09T22:20:13.721525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T22:20:13.725354Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.725354Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:08d76423f4c5c1d94a0e56d8f122690270e8be72768c1cb731028dc2601315ef","observation_id":"44582844-d450-4503-8a37-055ec5a81c52","resolution":{"observed_at":"2026-08-09T22:20:13.725354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-09T22:20:13.729025Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.729025Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:5670b599e49c7908c30b26b6e8ee5fff40e53ebab8180a1bcd6fe3b830c1a411","observation_id":"4a724be0-ae5f-4b59-910e-f24b32fe265d","resolution":{"observed_at":"2026-08-09T22:20:13.729025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.602616Z","title":", Andreassen, A","venue":null,"work_id":"4d271ccc-3c80-4f7b-9220-aa02d70a13c4","year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.732483Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:c3afe7ca0cd586d57fbdf5a41fb61c5818199d26cbce3e3b7da4f2115ffdd1ac","observation_id":"36a3b135-0549-4268-8b52-487fbe993c53","resolution":{"observed_at":"2026-08-09T22:20:14.605799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09302","last_updated":"2025-02-11T01:46:35Z","snapshot_observed_at":"2026-07-06T19:32:10.826706Z","submitted_at":"2024-10-11T23:29:20Z","title":"Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09302","snapshot_observed_at":"2026-08-09T22:20:13.735791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.735791Z"},"links":{"cited_paper":"/paper/2410.09302","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:19fdc3cafcd7d0d42d0a2c8c10aa9fbebe0c18f7e41ebbdbbced2475dfc796df","observation_id":"929b64d2-b666-48b7-907c-3b72e02f23cc","resolution":{"observed_at":"2026-08-09T22:20:13.735791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.592588Z","title":", Xia, C","venue":null,"work_id":"621b443a-4f6e-48aa-a13c-0d004f20046a","year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.739386Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:c9fbfafb4e2966e011f6a5283a701fc40b3a7f0ee9b5b8eda56be818a9f0149e","observation_id":"b8548978-17ef-4388-974f-449abcdc1b19","resolution":{"observed_at":"2026-08-09T22:20:14.596306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-09T22:20:13.742905Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.742905Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:35a801dbae71b8c3e339098dd5ac4d2251f40b2db41c049ca77af56c4ce1f59e","observation_id":"9bef8d91-24eb-4dc5-ba50-9ed4ec2f475a","resolution":{"observed_at":"2026-08-09T22:20:13.742905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.582894Z","title":", Welleck, S","venue":null,"work_id":"59297226-f70b-4ca3-8efd-8cf59ff1f80d","year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.746900Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:bfd9fb78452b7c878ba90afff60788f694cbde4c80bdc94cb954e6aa602818df","observation_id":"d572741f-2b18-400f-a600-756f41ebd414","resolution":{"observed_at":"2026-08-09T22:20:14.586300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.573290Z","title":"American mathematics competitions amc 12, 2023","venue":null,"work_id":"47fbd36c-33f1-4b02-acbc-3142ceecd23c","year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.750668Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:bea3a5c5ccd835502707ac3dd747a74e3f873fef1b247db599ae922a76233ab9","observation_id":"13d63a5c-4fc6-4abb-bc32-cac1fb86f9fc","resolution":{"observed_at":"2026-08-09T22:20:14.576757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.562695Z","title":"American invitational mathematics examination aime i & ii, 2024","venue":null,"work_id":"2a2d5e0d-b7a3-43d5-9c37-144fcc030242","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.754406Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:848acd6b4938ecf9c971fb8d3ee580924eab4159b4c7235c083aa802021e7d91","observation_id":"ce58649c-b0fe-470a-9320-6ea26684665d","resolution":{"observed_at":"2026-08-09T22:20:14.566487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T22:20:13.758075Z","title":", Xia, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.758075Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:4902fb1b32dd617784b4edcffe0a8ef14a4745223a947884b49547f1da61ba07","observation_id":"458f3f4d-8e64-4e03-a712-f8cf3b0258cb","resolution":{"observed_at":"2026-08-09T22:20:13.758075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.552217Z","title":null,"venue":null,"work_id":"b0f43408-f6ee-432a-91c4-8a79ac841f62","year":1998},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.762198Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:410faf15838fc2cac12a935864adad7dc7481edc6434135c1743527f399f479e","observation_id":"42f46a88-af47-4f23-bb01-2739bb19f89f","resolution":{"observed_at":"2026-08-09T22:20:14.555846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.541567Z","title":null,"venue":null,"work_id":"02f55df5-f532-4e21-ac36-4675f12696d3","year":1983},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.765945Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:ac015ae5ab44d3a6809fc7471faa4c34346987f07c73863c462234c9db8f0964","observation_id":"9658b0a5-77e1-41f9-a48d-c7eb74e19c51","resolution":{"observed_at":"2026-08-09T22:20:14.545400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T22:20:13.769921Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.769921Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:f64a3fa8566c06b5d69cae45de6dafee6a5e727b6969ca20aae4505a5cf5b1c7","observation_id":"a10dae46-7f57-4acc-8641-b3ce9b95d4b5","resolution":{"observed_at":"2026-08-09T22:20:13.769921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.530729Z","title":"Introducing openai o1","venue":null,"work_id":"544ce954-834b-45f6-a364-31da6eef80f7","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.773819Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:106728eb278bbe98e316f5c4be88596f31ca5443ebc36de1d3358f90c76aebe6","observation_id":"3c16a765-d8b0-4f94-8105-b30e3de67077","resolution":{"observed_at":"2026-08-09T22:20:14.534173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.520932Z","title":null,"venue":null,"work_id":"2f696cba-0df8-4b0c-8f30-b918146cd1da","year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.777649Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:2e73269a2c025333adda262eb4587c9a5f8650be38d720366c1415a6abd519ed","observation_id":"d211d0d1-ca8b-41ef-a3d7-0f54e36df2c1","resolution":{"observed_at":"2026-08-09T22:20:14.524244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.04850","last_updated":"2023-02-06T10:00:56Z","snapshot_observed_at":"2026-08-01T15:35:41.456637Z","submitted_at":"2021-11-08T22:17:36Z","title":"Dueling RL: Reinforcement Learning with Trajectory Preferences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.04850","snapshot_observed_at":"2026-08-09T22:20:13.781528Z","title":", Saha, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.781528Z"},"links":{"cited_paper":"/paper/2111.04850","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:a271d707eb6a72c45a742bf72b0461e2ac9b16df05f2c873462c1cc34dd27257","observation_id":"d4263822-9942-4e16-8e67-8b2d01b6219e","resolution":{"observed_at":"2026-08-09T22:20:13.781528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-09T22:20:13.785735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.785735Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:564ecfe793bc74d6ced51441a6a15a2df00e5153bc30f2eb886344c046b3d274","observation_id":"a61768a3-3504-445c-926e-4a5e1debd6ff","resolution":{"observed_at":"2026-08-09T22:20:13.785735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.510342Z","title":", Sharma, A","venue":null,"work_id":"b285985d-3e4d-49ac-9060-4542dea62424","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.789876Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:c97ed57ca162ac979682f468ad5c7df83abd27d12cc52a05298a5268ca4edc1b","observation_id":"431f54c2-b983-4d6d-8d7d-9f937680a2a5","resolution":{"observed_at":"2026-08-09T22:20:14.514047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.499937Z","title":", Hou, B","venue":null,"work_id":"6d191253-460b-4078-9a98-a1f5c6d7b3c0","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.793488Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:1e8e8e3301c90f183b5c47ac3fe178516f7945e55bff0e1ed2f48962b874ba46","observation_id":"3744cd2a-5353-45e9-8a3d-3be015f6689a","resolution":{"observed_at":"2026-08-09T22:20:14.503355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.489212Z","title":"and Ritter, D","venue":null,"work_id":"40abc4dc-4e4b-4b57-944b-b636e916e755","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.797176Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:0fe44234eef6444e55ed4ea7540b69fb2b338bdb4f86f50993bdbc3014721d20","observation_id":"c97db65f-60d2-4741-8838-efd8c12fa671","resolution":{"observed_at":"2026-08-09T22:20:14.492894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T22:20:13.800921Z","title":", Wolski, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.800921Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:b5558cd0f60b2fdfb4eb67247834e453d749a9fac68dfde8ed2538192b5e51e2","observation_id":"8257da74-90e2-406d-bb78-062204fe394b","resolution":{"observed_at":"2026-08-09T22:20:13.800921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-09T22:20:13.804411Z","title":", Wang, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.804411Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:7e6d0296257e1ccbfe68ec5fa8b880b11cbc8b7c48e852bc8a35beb91b3ddff0","observation_id":"9e171bc6-a046-41e4-8d1b-7dd9151dacf6","resolution":{"observed_at":"2026-08-09T22:20:13.804411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-09T22:20:13.808058Z","title":", Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.808058Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:9600d26cc7e4bff01d7a5d9e1e6d98df99a064ff8cd45aeb83fe5d08df0e08c1","observation_id":"25cc60a7-c4c1-42d8-b73c-5dae2eff1877","resolution":{"observed_at":"2026-08-09T22:20:13.808058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T22:20:13.811949Z","title":", Co-Reyes, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.811949Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:72c2d7e02f28b802d361aa29933121509dd3d6bd9d1dcc1cd9b9220cb6e8d442","observation_id":"faeffd8c-00fd-4ec4-83ba-5d5f2b921b3e","resolution":{"observed_at":"2026-08-09T22:20:13.811949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-09T22:20:13.815878Z","title":", Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.815878Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:a5c18ceaea24b49b3c69c9b11d684e7dae131507025d2d8b93a166b0637aa4d4","observation_id":"4c74fd54-2b9a-4647-92cc-30d5b6ce3259","resolution":{"observed_at":"2026-08-09T22:20:13.815878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-10T05:17:53.947932Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-09T22:20:13.819384Z","title":", Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.819384Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:fdcf529770543f8fd39b31c229c4f7af188dc92d09041b9b0f207a62f23c499c","observation_id":"57ef5985-b31d-4716-bd89-10a02249b3a5","resolution":{"observed_at":"2026-08-09T22:20:13.819384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-09T22:20:13.822920Z","title":", Mesnard, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.822920Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:5fa9bed3ba04cf2c49ca574b18108c6100dd1c37898c61cb8da4512bf3aaf0de","observation_id":"371b0358-3e5e-47bf-b084-665a4e7d832a","resolution":{"observed_at":"2026-08-09T22:20:13.822920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-09T22:20:13.826434Z","title":", Riviere, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.826434Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:6897f3382b8e03ffa63c1f755ce62f60e3624c58d93439f8112de3ea3117ec8d","observation_id":"778fdd76-1f49-48ed-a34c-9bd0cda5bd47","resolution":{"observed_at":"2026-08-09T22:20:13.826434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.477520Z","title":null,"venue":null,"work_id":"f51870ed-56e7-4df5-a721-e2274b7531b7","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.830168Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:7a7be354205b25a1e42b63ef06f0506c84dece03b6664feb8002d87a973c8a8f","observation_id":"58af0572-2bab-4f77-bac4-e589513b151e","resolution":{"observed_at":"2026-08-09T22:20:14.481196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T22:20:13.833736Z","title":", Lavril, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.833736Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:849cba3948eb36090ad3e901c88f4fbf3343128317efa77576b277275e18477d","observation_id":"e6f7e4bb-c600-4fb4-ac47-f7579670accf","resolution":{"observed_at":"2026-08-09T22:20:13.833736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-09T22:20:13.837391Z","title":", Hao, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.837391Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:a7492fa604188251d8f7279d87806c2b306a964eea4ac2c3bbcd130626ec9c7c","observation_id":"5f1be69d-e707-456a-8242-d80ec7109be4","resolution":{"observed_at":"2026-08-09T22:20:13.837391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-09T22:20:13.841385Z","title":", Wei, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.841385Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:8f22fa44d3d627d7a9af946909e042760650c9cd1fdf78b724362c5ab42dcbe4","observation_id":"a46f973f-e86c-4b9f-b8a9-760a270f4d53","resolution":{"observed_at":"2026-08-09T22:20:13.841385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.467068Z","title":", Wang, X","venue":null,"work_id":"f451a83c-65b3-454f-a91e-d3fdfa44623a","year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.846136Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:7c19ea84c251ff9e182b4963bf20c530ff2778b7e9eaab3f8bc1ecb0f8301a7a","observation_id":"193390f8-8d51-4a20-b2b2-95fd9b87b584","resolution":{"observed_at":"2026-08-09T22:20:14.470547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.456441Z","title":", Akrour, R","venue":null,"work_id":"67dc0dac-e6b7-49ea-80f8-5197a9f1a140","year":2017},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.849639Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:46ea972294897cc222bffbb8d78967cee60b37db163171a4edfbaa1dc756ccfe","observation_id":"0f224f9f-de6e-4098-9ee6-b6eaf20ae96a","resolution":{"observed_at":"2026-08-09T22:20:14.460082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10630","last_updated":"2024-10-14T15:38:56Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:38:56Z","title":"Thinking LLMs: General Instruction Following with Thought Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10630","snapshot_observed_at":"2026-08-09T22:20:13.853182Z","title":", Lan, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.853182Z"},"links":{"cited_paper":"/paper/2410.10630","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:bd380fe6963237984abe8e99d51f56dbcb123c56181ec05191e773cfbc89318a","observation_id":"6ac8b3d7-f922-475c-90a3-b515381819d9","resolution":{"observed_at":"2026-08-09T22:20:13.853182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-07-31T03:29:04.443362Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-09T22:20:13.857312Z","title":", Foster, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.857312Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:1ba3386603953dd003355d4ceb93d4a0939704b5b9b2898d30f2f8221350464e","observation_id":"a5176a8b-2654-404c-8c7e-8d5dffea658c","resolution":{"observed_at":"2026-08-09T22:20:13.857312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.444975Z","title":", Dong, H","venue":null,"work_id":"348644e6-c3b1-44e9-8735-9dd818554b62","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.860987Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:26392480c7ba6eab5dcf773e5b3f1816adfb0ebc4ddc7973fcc7c80807639dfd","observation_id":"e6eaa9e3-9d0c-49ee-8e68-723767c6d4ed","resolution":{"observed_at":"2026-08-09T22:20:14.448888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10207","last_updated":"2024-10-16T03:24:02Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:58:31Z","title":"Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10207","snapshot_observed_at":"2026-08-09T22:20:13.864753Z","title":", Pan, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.864753Z"},"links":{"cited_paper":"/paper/2402.10207","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:1f77f03118b42313b04436f10114404f23c90aa5d08e03585a3779a809d20563","observation_id":"c1bbd0eb-be0a-4ae8-a025-c575ab95b5a9","resolution":{"observed_at":"2026-08-09T22:20:13.864753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.433811Z","title":null,"venue":null,"work_id":"5b050ece-a33f-4937-8b77-d66c5df84157","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.868820Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:a3dead2e54d738a8620b60a067b0b53cf295a0c76686ce698f62b4927a16e3e8","observation_id":"97d25e46-9135-4172-abc4-086e621ded5e","resolution":{"observed_at":"2026-08-09T22:20:14.437483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.422788Z","title":", Yuan, Z","venue":null,"work_id":"7442ef21-0e51-47db-9ca7-ae1e2a74e5b4","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.872491Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:4051c186cee336eb015831d9b35136b690613f06302ceea97d03467ea8c933f8","observation_id":"fb8064e9-6ee5-4253-b617-d46507295611","resolution":{"observed_at":"2026-08-09T22:20:14.426606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-09T22:20:13.876480Z","title":", Yuan, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.876480Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:d8738c25ec64e1bd88245ea5be0966123a335f6a9ef3887c4a192d1d934697a3","observation_id":"df65259c-c2ad-4ef7-82ad-33f70ca13d76","resolution":{"observed_at":"2026-08-09T22:20:13.876480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.410759Z","title":", Broder, J","venue":null,"work_id":"296ddd65-d68f-4f83-83d0-9201972be6d4","year":2012},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.880535Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:206bb5bf8e181ed440fa236649a624b27bb181def47f0395971352d20f47d6ff","observation_id":"ca3a54d8-a7a4-4565-a00f-50fe56e15759","resolution":{"observed_at":"2026-08-09T22:20:14.414787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-09T22:20:13.884354Z","title":", Harik, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.884354Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:ab19ea832ee46b0f429830797f47f8f143e15c7d445fd96bfacd79eda3522bed","observation_id":"1b78eb62-5aa6-4a1f-8fa7-1a7b1656599a","resolution":{"observed_at":"2026-08-09T22:20:13.884354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.399999Z","title":null,"venue":null,"work_id":"9d20a22e-dbad-4223-84df-1edddd7b8fc9","year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.888368Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:9beb2a12dc96664e81e282fb93af4635524c4b5efc0abd2ee066c479e78adc66","observation_id":"55d621d8-cd0b-4354-bb79-c27b975fce8e","resolution":{"observed_at":"2026-08-09T22:20:14.403647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-09T22:20:13.892177Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.892177Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:7f723879478e3af51b6583f6c303883570ee67542657dbe945771549eb3e4a67","observation_id":"6626d737-9273-44dd-8a96-e0c78418a57c","resolution":{"observed_at":"2026-08-09T22:20:13.892177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T22:20:13.896255Z","title":", Joshi, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.896255Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:78ae7c0effc418669f7b235c3f2b8c6dee18b597f347c29842022348fadebced","observation_id":"fb60df69-5da4-4d2d-bc3d-6c928af3da1a","resolution":{"observed_at":"2026-08-09T22:20:13.896255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-09T22:20:13.900296Z","title":", Feng, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.900296Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:b9bc7385f33bbac0ba34ea13a367ce74144d2308ffb691693c8fd97261e252b2","observation_id":"63bb8363-8867-4ca0-aea9-6a5f3b3bc8d3","resolution":{"observed_at":"2026-08-09T22:20:13.900296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:14.389080Z","title":"and Zhang, T","venue":null,"work_id":"c5ec7d8f-864f-431f-984a-6bbfc67988e3","year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.904125Z"},"links":{"citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:3979b1ddae519273ab688054f7f9c7486aa291b42986e93a8eb0bbbb070d58e2","observation_id":"382c6597-fd53-485d-a35b-5538f21be0c6","resolution":{"observed_at":"2026-08-09T22:20:14.392595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-09T22:20:13.908011Z","title":", Sch \\\"a rli, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.908011Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:c77bda5d209f9a59345ccd0e4907091f571588ebd36a6031f37a2c2459d2f5da","observation_id":"532a7815-7590-4e2e-a506-67d220f9bc43","resolution":{"observed_at":"2026-08-09T22:20:13.908011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-09T22:20:13.912444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.912444Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:4c4d4c16dfea58f0acb7436b7c5e8754325dca441a46c2aaa6ae9627a0155295","observation_id":"78233f4f-7b02-42c5-beef-72e651f43288","resolution":{"observed_at":"2026-08-09T22:20:13.912444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-09T22:20:13.916248Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.916248Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:c2a74d1da6f12afb075895ee7fd9bbea9fa56dc3e87eabd4c0a6df4ac1cfe359","observation_id":"a2f2438e-2787-4bec-9c2a-07bbaa81917b","resolution":{"observed_at":"2026-08-09T22:20:13.916248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 2 inbound Pith citation observations for arXiv:2501.18858."}