{"as_of":"2026-08-12T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:641677a168ec6f4edca9626e146c99eace18e4adb122d9f51651b2370003e53b","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:57:49.117837Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:40:36.038438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:57:41.429120Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-08T14:40:36.038438Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T18:40:06.157350Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.038438Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:085b1ab8b1a47e170ee6855076985645a49d9363c09196638372af9a21e3799d","observation_id":"3dce8e4f-0f9d-4d11-a579-5c0aabe028d2","resolution":{"observed_at":"2026-08-08T14:40:36.038438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:da431f259e57ac581c0980ca31fc869af4f0d882a876e3c5efcde61d97bee03e","observation_id":"f9a615c3-b6df-4fb9-b809-2dc43c1778f4","resolution":{"observed_at":"2026-05-13T01:36:24.423192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-07T15:07:04.324930Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16401","last_updated":"2025-06-12T15:02:59Z","snapshot_observed_at":"2026-08-11T11:34:56.742599Z","submitted_at":"2025-05-22T08:52:21Z","title":"Divide-Fuse-Conquer: Eliciting \"Aha Moments\" in Multi-Scenario Games","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:04.324930Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2505.16401"},"observation_digest":"sha256:5c825b6423b663fd3cc5bad8d0ba2886906ac3ceda1b9ea72bfdcc6d2c8b9962","observation_id":"44ac4dce-7654-4d1a-88b3-5134cc8e77f0","resolution":{"observed_at":"2026-08-07T15:07:04.324930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-07T12:47:22.078456Z","title":"Satori: Reinforcement learning with Chain-of-Action-Thought enhances llm reasoning via autoregressive search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23604","last_updated":"2025-05-29T16:15:36Z","snapshot_observed_at":"2026-08-09T05:03:49.842579Z","submitted_at":"2025-05-29T16:15:36Z","title":"Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:22.078456Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2505.23604"},"observation_digest":"sha256:9318a315de120090e1bdf2d685e6a381f3c7ac79489d977c49ad53439a7aff2d","observation_id":"e4ecac6f-8fb3-4663-a6a9-f731e82367d8","resolution":{"observed_at":"2026-08-07T12:47:22.078456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-07T05:14:47.425928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.425928Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:7a7e9487ece942cbc6023a1dbd41192e2e897ea98a7ffd535ca7a41ba348a623","observation_id":"9fce8929-7c3b-4dd7-9c7f-21a23129442c","resolution":{"observed_at":"2026-08-07T05:14:47.425928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-06T23:28:39.674751Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18237","last_updated":"2025-06-23T02:06:04Z","snapshot_observed_at":"2026-08-08T19:39:45.470566Z","submitted_at":"2025-06-23T02:06:04Z","title":"AdapThink: Adaptive Thinking Preferences for Reasoning Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:39.674751Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2506.18237"},"observation_digest":"sha256:9d75cd3e61046ee4d1a3156621ddb0f05332164eef9c0538ff7cc6ff7440377b","observation_id":"f604a5e2-42d6-4142-893b-39539c96e298","resolution":{"observed_at":"2026-08-06T23:28:39.674751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-05T04:42:06.395257Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-11T08:07:11.004639Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.395257Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:0f8078f60915ea07af5f3fc0d25e1180909961c3b6c830edfb89f618127973ae","observation_id":"d3877bd5-b1fc-4b05-8349-1711b53a8446","resolution":{"observed_at":"2026-08-05T04:42:06.395257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-03T00:13:28.211988Z","title":"Satori: Reinforcement learning with chain-of-action-thought en- hances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11351","last_updated":"2026-06-28T23:49:44Z","snapshot_observed_at":"2026-08-08T10:00:22.672311Z","submitted_at":"2026-02-11T20:40:43Z","title":"Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:13:28.211988Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2602.11351"},"observation_digest":"sha256:5b0297993bd357c2de788929952d5528b3e0dae2b0e700da931657ffdc83a082","observation_id":"2465e9b8-0ca7-4897-9838-026eacf3cd3d","resolution":{"observed_at":"2026-08-03T00:13:28.211988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.07353","last_updated":"2026-05-08T07:08:25Z","snapshot_observed_at":"2026-08-11T04:46:32.902221Z","submitted_at":"2026-05-08T07:08:25Z","title":"Confidence-Aware Alignment Makes Reasoning LLMs More Reliable","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:40.020460Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.07353"},"observation_digest":"sha256:0e6d117b59c90efa3faa31924002fd52544ebf84cee865c62e8c6e7a3e7d034e","observation_id":"6c5bfa9d-980d-4cbb-980e-0309ac158e4e","resolution":{"observed_at":"2026-05-11T03:55:53.932850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.18851","last_updated":"2026-05-13T11:04:31Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T11:04:31Z","title":"STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T20:47:16.236629Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.18851"},"observation_digest":"sha256:05410a8b03b95010de3b18f5c70e44a60a0601a9cab07392c61a608f90111aaf","observation_id":"95abce7f-b9cf-4393-a279-22f842fa3615","resolution":{"observed_at":"2026-05-20T20:49:00.696829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-02T18:56:31.274465Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:cc8ebc84d6ed80656392f72dde2c83524dbd7b4eb0527f8e8ffaded487e85a94","observation_id":"fb1c88c3-4325-4065-858e-d40580c05100","resolution":{"observed_at":"2026-05-21T06:19:41.990511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.22138","last_updated":"2026-05-21T08:11:54Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:11:54Z","title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-22T06:33:36.846345Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.22138"},"observation_digest":"sha256:20da4473d14652997f455b67f23193c0ea7cba0809ecca24d0db068f2b671652","observation_id":"4dae21f0-5cb3-4497-ac38-039c04402437","resolution":{"observed_at":"2026-05-22T06:34:41.015581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:38b1925a03698e41e0657f4684e3d19ce8d5034754fcb8633e849860433765f0","observation_id":"d65c1290-9258-4ad1-accd-ea2af3017a66","resolution":{"observed_at":"2026-06-28T17:22:24.890131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-08-10T19:13:02Z","snapshot_observed_at":"2026-08-12T22:22:54.712445Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:742c3dfc1bbf93a57a5f7fe5e5f217e6dc3ab2c2833910f7205fa9377d1d71e6","observation_id":"545b8966-bd2a-4b23-b2e0-185011057ac0","resolution":{"observed_at":"2026-07-03T05:57:41.430647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02508/citation-record","integrity":"/paper/2502.02508/integrity","json":"/paper/2502.02508/citation-record.json","paper":"/paper/2502.02508"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.205152Z","title":"( s + 2) ( 2.4− t 60 ) = 9 Let’s solve these equations step by step","venue":null,"work_id":"ece24b98-c273-4275-aecf-c068639b2a06","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.824996Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:3676a8c8118032302f37804f1a6279d0addf75ef2a46b7492dda10a4cb88b014","observation_id":"1229900a-f24d-4041-8375-33a12896dd33","resolution":{"observed_at":"2026-08-09T11:57:50.209342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.754123Z","title":"Self- consistency improves chain of thought reasoning in lan- guage models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.754123Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:406f4f45886c16398107150932122d490e208f6f91d4a5c5d06833933a382773","observation_id":"ad843070-ac30-4804-a4dd-5e40acc01e59","resolution":{"observed_at":"2026-08-09T11:57:48.754123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-12T21:02:37.814381Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-09T11:57:48.758762Z","title":"Math-Shepherd: Verify and reinforce LLMs step-by-step without human annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.758762Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c1a58cd68acfd123795687c9a28e3b13d345a1e47bb8c58da4ac94d98aa07b96","observation_id":"22b49c8f-5b87-473f-b689-220da3b35a17","resolution":{"observed_at":"2026-08-09T11:57:48.758762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T11:57:48.763506Z","title":"DeepSeek-R1: In- centivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.763506Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:7b17d89f2ed713c7ae92c6c058f5f285574fa1a4624ec7b0c086e4dfecefa7c9","observation_id":"e4c20d2e-04df-4ed4-ad19-030622c80607","resolution":{"observed_at":"2026-08-09T11:57:48.763506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-08-09T16:44:49.698332Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-09T11:57:48.773155Z","title":"Reflexion: Language agents with verbal rein- forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.773155Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:fd52edbc5faab365e95dfee6e36c8272017e6e7c63ae41529d9ba2039c148fba","observation_id":"f07620ed-7ca1-4ac4-9df6-786b49367384","resolution":{"observed_at":"2026-08-09T11:57:48.773155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16579","last_updated":"2024-11-25T17:11:54Z","snapshot_observed_at":"2026-08-12T12:55:35.142701Z","submitted_at":"2024-11-25T17:11:54Z","title":"Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16579","snapshot_observed_at":"2026-08-09T11:57:48.778636Z","title":"Recursive in- trospection: Teaching language model agents how to self-improve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.778636Z"},"links":{"cited_paper":"/paper/2411.16579","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:bde78611346d83f93c89066991dfded91a79bdc2a0b2d93f92e0150510c36bb1","observation_id":"d2ac63d0-277d-4136-855b-3533293a6cef","resolution":{"observed_at":"2026-08-09T11:57:48.778636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.062418Z","title":null,"venue":null,"work_id":"6157ed18-39a2-43d6-84d8-fa92d83d0c32","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.873047Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0eacc497b8b1fc790106d58cc41189118fbfe63f2d80b4242cedb2a47349dfa5","observation_id":"c692f436-95e2-4d79-8f9f-7afaea91f86f","resolution":{"observed_at":"2026-08-09T11:57:50.066840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.049180Z","title":null,"venue":null,"work_id":"5544bce4-7cfd-435a-8b51-6290e9d7b790","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.877128Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:931da49f685ea5754988642aa3325d461b461f0eadc27277963e19bf5df2705b","observation_id":"c1d70402-b030-47bc-b71a-db2d3020a1d0","resolution":{"observed_at":"2026-08-09T11:57:50.053463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.035897Z","title":null,"venue":null,"work_id":"afd85e93-ea1d-446e-9c6c-4b1d448d6421","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.881086Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:41f99f77648fc81c6e0ce1477fe2a00f867c2dd85ac5f0c1ea8411002507f0a0","observation_id":"a4e8493c-1a30-45a9-b0bd-7bf9cab9f7c4","resolution":{"observed_at":"2026-08-09T11:57:50.040040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-09T11:57:48.797404Z","title":"Qwen2.5-math techni- cal report: Toward mathematical expert model via self- improvement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.797404Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b50ecc495ce7d3160f095fc5e9f5ef95bf82b23725a0779dee110ec926af8332","observation_id":"7f7acff6-6204-4b09-a876-a4dc6805cb13","resolution":{"observed_at":"2026-08-09T11:57:48.797404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04295","last_updated":"2023-12-05T08:38:01Z","snapshot_observed_at":"2026-08-07T23:35:18.737859Z","submitted_at":"2023-09-08T12:34:28Z","title":"FIMO: A Challenge Formal Dataset for Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04295","snapshot_observed_at":"2026-08-09T11:57:48.802192Z","title":"SWE-bench: Can language mod- els resolve real-world github issues?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.802192Z"},"links":{"cited_paper":"/paper/2309.04295","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:9d9299c5ab7e6d6666ef04e11dadef7fa3b61138c77cf80840c88ce89f5ec4b6","observation_id":"9d6d1d30-2b9b-442a-8479-e85dc2cdf8fd","resolution":{"observed_at":"2026-08-09T11:57:48.802192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-12T16:59:08.048588Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-09T11:57:48.815737Z","title":"Generating sequences by learning to self-correct,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.815737Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:612f1cb5ad8c5e51173436a259c70af52bced10ac03b62f42af6c89f63b3c79d","observation_id":"cf00df94-b20b-4b68-8a09-efa45ca0b981","resolution":{"observed_at":"2026-08-09T11:57:48.815737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.820421Z","title":"The final answer is: 7 Figure 6: Math Domain Example","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.820421Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:154734c71bbf99744e30b61dec71fff0aa6ff23dbcb1594c02dc71428cd8a524","observation_id":"17b21789-6b6d-49df-8266-65ab88b727f1","resolution":{"observed_at":"2026-08-09T11:57:48.820421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.166563Z","title":"- For p = 2: The exponent in 17! is 15","venue":null,"work_id":"0ee863af-c3a5-4522-8c66-7ad82c9a6699","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.838795Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:37c39b5d8964270e997b0a44940898975fbbd98d336e35731de6ebfcb84e0896","observation_id":"4951b2ab-7486-4d87-abd6-a331eddc6b91","resolution":{"observed_at":"2026-08-09T11:57:50.170634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.192108Z","title":null,"venue":null,"work_id":"c0e8b965-ad4e-4e3b-be5d-4bf104beb5a6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.829328Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:bb5444f5d0a416742a1ea13ffb8bb427c6e7c1f70935c684acc4732ad24bab5d","observation_id":"90b6fbf8-c42e-458b-be63-406341098dd8","resolution":{"observed_at":"2026-08-09T11:57:50.196434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.153569Z","title":null,"venue":null,"work_id":"a837f11c-30d7-4e1f-bc8f-4dd52b89708d","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.843189Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b5dc7fcb59bcc23c0c5ad9cb4e2f52837944ae2fdb2c82ab1fd57985aeee28fb","observation_id":"e10216c5-ea86-4ad2-832d-5319d6692a62","resolution":{"observed_at":"2026-08-09T11:57:50.157546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.140643Z","title":null,"venue":null,"work_id":"9b1b9426-0ff1-42d4-a339-77f367d01f92","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.847508Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8d3f9993afc305d40a495e025fa4a6cbe64cc40432d81cc3cc4bb271ac17664e","observation_id":"f2b2bf08-6002-4209-9eba-b358a6efedc4","resolution":{"observed_at":"2026-08-09T11:57:50.144768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.128045Z","title":null,"venue":null,"work_id":"2d5f0869-e17e-4d96-b8e4-032503abee05","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.851794Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:2bb1c5bda489633cd8ed7ffcdc2c334a93ecb0cc329aebb2f8d1035aaab48856","observation_id":"e92b71bf-6983-4a18-854a-7f2ad207b046","resolution":{"observed_at":"2026-08-09T11:57:50.131974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.115110Z","title":null,"venue":null,"work_id":"4e5bb4a9-dc6d-4b40-8c6c-004a74e5f7a6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.856150Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:675e4032a4dcfe93f6c3aefdd780cc9d549a570965615b32ade60c4a64c63457","observation_id":"abb21582-f2a0-4546-bc1c-a6fcfe9e8b39","resolution":{"observed_at":"2026-08-09T11:57:50.119153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.102302Z","title":null,"venue":null,"work_id":"765173a1-aa71-428d-b6cb-61c389d99520","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.860446Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:7abe20f7ddc88c8fa21d8f54857d4e7f32bad024377acb5dbc6701830d61e3e3","observation_id":"777bdcce-ada4-49fc-97fb-1b9de9789362","resolution":{"observed_at":"2026-08-09T11:57:50.106481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.089090Z","title":null,"venue":null,"work_id":"f9ea5925-d39a-4336-9654-5371e19556cc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.864677Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:cd12bc1bf8a2b6daf8af46c62326643d3dea2b0da5462a4c2673eb5902a76a9f","observation_id":"a8672318-e70f-4ff6-8aea-480f3952d479","resolution":{"observed_at":"2026-08-09T11:57:50.093349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.075774Z","title":null,"venue":null,"work_id":"e348bb3e-d7fd-49ad-9363-612a93553ebd","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.868939Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:3d6abce0dda1cccb327eb148e3fd82f25633a73b73cb215bb1da0db7e7a826ac","observation_id":"87438d9e-6158-4009-9c43-d64daa440b31","resolution":{"observed_at":"2026-08-09T11:57:50.080011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.023065Z","title":"- The liger is a physiotherapist","venue":null,"work_id":"d21ec63c-a1c2-42f8-8566-f0d6808d7383","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.885162Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:25f2718143e223520748254bb75eece33806a3cf9bcbd151d64936bf14db8c84","observation_id":"ce5e6b8e-8bcf-492d-850e-299148b484f4","resolution":{"observed_at":"2026-08-09T11:57:50.027233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.009596Z","title":"- The dimensions of the box are 52.3 x 43.6 x 36.1 inches","venue":null,"work_id":"f2a888a7-48fe-46cd-ac40-b52dea59eee5","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.889206Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0e083c1bd0b5a18ee22d65d08d6cd28115fd916477cf63ab203f5de5a09d1ad8","observation_id":"02121093-8594-4fab-969a-83c14b37d159","resolution":{"observed_at":"2026-08-09T11:57:50.013742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.996280Z","title":"- The seal hides the cards that she has from the bee but does not build a power plant near the green fields of the husky","venue":null,"work_id":"c27e14f0-dfbe-462c-9645-29d2c180987a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.893289Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e3c8395a86c77eff40d04396a95360e30ddfa355e14239cd7f4601418b7139a0","observation_id":"9523bf24-98d7-47d6-bb58-8f9ecaa43a15","resolution":{"observed_at":"2026-08-09T11:57:50.000605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.982996Z","title":"Therefore, the final answer is: True","venue":null,"work_id":"4e9e1453-51f4-48a4-b5ac-ddb3508fcc7e","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.897435Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:113fa5c4bf3bb64833b46878db3a1cc4209ce7182e447f1b0d3621e48ad483c4","observation_id":"bf68543f-2169-4be7-8dd4-c5c382ab41d0","resolution":{"observed_at":"2026-08-09T11:57:49.987513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.970287Z","title":null,"venue":null,"work_id":"7a7bcba5-83a6-4e7e-b7b7-13c1227e74b1","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.901882Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:190ef0579563ffe9b3bb1edc88fc2e0de26b407719c7341f0159299b5d85e212","observation_id":"44c8e436-d893-49ea-870e-02b0eb7a74ef","resolution":{"observed_at":"2026-08-09T11:57:49.974480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.957654Z","title":null,"venue":null,"work_id":"1f9491fc-61a4-42b4-93b6-be6f49619770","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.906295Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a8e43574560ef255d1433c0f03409bcb89c65e57bb354d85ea0bf4a9afcaefee","observation_id":"3571d180-50a5-4a2b-9753-e55d5e86d7e4","resolution":{"observed_at":"2026-08-09T11:57:49.961712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.944393Z","title":"Based on the facts above, answer the following question","venue":null,"work_id":"875874d4-905a-41fe-a857-7074608622e4","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.910561Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:797a5ca90e02a1bb467fefed86ccab0bf0c0de0f162ef7867f6c0f921240187e","observation_id":"ea7231ba-b934-4bd9-aba9-6f1de521ebc8","resolution":{"observed_at":"2026-08-09T11:57:49.948650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.931222Z","title":null,"venue":null,"work_id":"7ce0913c-e7e9-4406-b567-b428652bbb28","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.914960Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e17670d9f9b36c58f11f0118fb33f98a809701549ee23cfc35dae3c5243f4149","observation_id":"99591b1a-de19-4422-93e4-dbfbe821be49","resolution":{"observed_at":"2026-08-09T11:57:49.935352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.918473Z","title":null,"venue":null,"work_id":"edf00ac8-f8e7-4a48-b6bc-e1866c2a37a9","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.919175Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:df1a9e7db72ca09cea26d294068be7f6efa774f27b42b321723e65247620e5f0","observation_id":"d4f71e77-8491-4029-ad36-21663d827ae3","resolution":{"observed_at":"2026-08-09T11:57:49.922571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.904786Z","title":"Christopher Reeve’s spinal cord injury was severe, and he required specialized medical equipment and ongoing treatment","venue":null,"work_id":"23c7a644-3704-477f-abd8-60eb67bebe9f","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.923486Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:266613dfc7571983a20bf049c2c8b7d67318d7b302f51e52d148d4edae547300","observation_id":"9c233a02-91d4-4681-a439-8cff21c8f94a","resolution":{"observed_at":"2026-08-09T11:57:49.909191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.891677Z","title":"The molar mass of Mg is 24.31 g/mol","venue":null,"work_id":"8a10fd67-b377-4b5c-b33d-eefa3b774395","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.927807Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:582e51bf4dfa2b4a7b69eff2cc7864c19cc2053e968ab663c6b98037bb5d0828","observation_id":"fd1a1377-5d53-4f12-9b72-8680a4a240c4","resolution":{"observed_at":"2026-08-09T11:57:49.895865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.878539Z","title":null,"venue":null,"work_id":"7b1893c1-ec27-4dd3-9ff4-60afd7322ebc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.931959Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:1903c0e65bd8b69426809467ec6bfdf072ec296aaed70b05795af6ca13014344","observation_id":"0dcf4edd-ccde-4e4f-907c-e2be8e9c3cae","resolution":{"observed_at":"2026-08-09T11:57:49.882898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.865533Z","title":"Since the reaction occurs in a beaker and the volume change is significant, we need to consider the external pressure and the change in volume","venue":null,"work_id":"ff489748-7cd7-4104-8e94-94a2906ffed3","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.936376Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e52cf76cd3fa19694b2a404377af9556f854b8e3c7c7142a95520f3815cbbafc","observation_id":"69830b52-fb84-451f-88ba-3d86a1614d41","resolution":{"observed_at":"2026-08-09T11:57:49.869824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.852171Z","title":"Here, text = ’ertubwi’ , sep = ’p’ , and maxsplit = 5","venue":null,"work_id":"6951bc3b-16da-4051-90dd-b9f14593eaa0","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.940664Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:215a85587356a70f31a08b170cf96e7e9853fad0a02213ae67c58478a231035b","observation_id":"2c19af94-8fab-42ae-8de9-effd2345dfb4","resolution":{"observed_at":"2026-08-09T11:57:49.856599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.839314Z","title":null,"venue":null,"work_id":"f2edd071-818a-499b-8087-7a2f9d4894d9","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.945072Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:03efed68a26a9005e1d1e9bb351ddd6f8a1cf603f4b763e4cec807d9cf31cce2","observation_id":"ba60185a-c98c-40c9-a26a-1ba0eee35b54","resolution":{"observed_at":"2026-08-09T11:57:49.843271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.826394Z","title":null,"venue":null,"work_id":"4e2937bd-1e07-4ef8-b9d7-5397b4ec7174","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.949270Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b691ac80c0380cce3ead44c1eb0d324b450bd4e2e81bfcb77f65557a5b31c48a","observation_id":"ec314509-d6d9-4609-9331-5d69742a99f6","resolution":{"observed_at":"2026-08-09T11:57:49.830571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.813833Z","title":null,"venue":null,"work_id":"281544d5-b28d-4d50-a894-07e8cc1237a7","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.953461Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:f3e9f9b1fc02579b0a0a08020f61deb96dfa625bbd38202296effc0daba34e2c","observation_id":"b6ca5d4f-7b25-4fdd-856f-60c266f740d1","resolution":{"observed_at":"2026-08-09T11:57:49.817832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.801266Z","title":"Let’s consider the correct approach:","venue":null,"work_id":"a18420bc-875f-4107-a590-6e23c514a9e6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.957469Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0c1d1b067afb328d8f0c0cbedc23376fafd1e967598e88ccaff38fc62ce7e44d","observation_id":"349d8217-d6a6-45f3-870e-cd1e5e910ed8","resolution":{"observed_at":"2026-08-09T11:57:49.805212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.788234Z","title":"Given the function’s behavior and the input, the correct approach is to split the string into two equal parts and reverse the first part","venue":null,"work_id":"f3999227-34a4-442b-9cbe-f70b246c3bf3","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.961799Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:63fe17dbc2f90ddf337777ac48aafdd98e07c29361555a036993e874b4c46f3b","observation_id":"f816ac15-1d9a-4c7d-a835-3929024227bd","resolution":{"observed_at":"2026-08-09T11:57:49.792615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.775501Z","title":null,"venue":null,"work_id":"8a16f90d-3efc-4636-9fb8-1cad27852beb","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.966290Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e5c7ce6007d35a893d74f784499f1643ae660087c9ab97c701cba49854c0be61","observation_id":"86edcf3a-a8eb-42be-8f1e-bd830876c99a","resolution":{"observed_at":"2026-08-09T11:57:49.779702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.762957Z","title":null,"venue":null,"work_id":"8819ee72-727a-40b4-a902-eee137283e8b","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.970794Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a480cf32aa5d84da2f54207d67d79056fb4919a6f460560fb1bd5ca7fbec7111","observation_id":"8ecbffa9-686f-4070-b627-d7e3800d4444","resolution":{"observed_at":"2026-08-09T11:57:49.766859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.750311Z","title":"Therefore, the final answer is: uertpbwi","venue":null,"work_id":"5517f234-fd94-4fb1-9c0c-71c256b807b5","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.974976Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8bb1e40319b7d35f1329b8a474e10e499b2fc7db77948bd4d495e5eb660895ab","observation_id":"05b90b56-5fab-4fb8-aca9-12731434e318","resolution":{"observed_at":"2026-08-09T11:57:49.754569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.737654Z","title":null,"venue":null,"work_id":"7b8fc317-fa2f-497f-8cf8-e6035884c7e4","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.979367Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:60057b19b1afb34e319cb346e878943e14cc52e7d095091241496cc18cef3ae5","observation_id":"1ca2df08-b4d2-4b80-aee0-0bf7aad63402","resolution":{"observed_at":"2026-08-09T11:57:49.741549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.725213Z","title":null,"venue":null,"work_id":"694a3026-33b3-4d09-88e9-808d3637fba6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.983809Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0570f3246d76c0958d19c41ab6b8f44d1fdb6a428d701c1a328e2c98ccf63f81","observation_id":"c5f63040-891e-405e-b8bd-d9d959bff08f","resolution":{"observed_at":"2026-08-09T11:57:49.729279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.712567Z","title":null,"venue":null,"work_id":"d7729486-a905-44da-b106-f4e38c557c6c","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.988466Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:562f90769a0a2be0cd707e33821bb6ba48aa96514a320d3b78f86562bba9c0ee","observation_id":"abb1883f-114f-4317-9126-d9c4c5187dea","resolution":{"observed_at":"2026-08-09T11:57:49.716694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.699649Z","title":null,"venue":null,"work_id":"09bdafc0-295d-4552-84b0-eb9cefeb8f88","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.992777Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:f055c5902e0671b1aebcaaaf7cd7ce2f14206119ab0ed840efbdf0a0c5a53b89","observation_id":"3e88025a-aafd-41ca-a416-84d63f7d2690","resolution":{"observed_at":"2026-08-09T11:57:49.703827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.686014Z","title":"superhuman","venue":null,"work_id":"028d0a0d-ddef-4a5b-8cc5-4f8bec907e5d","year":2021},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.996928Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e4f79093d769aa6868200702d8c051af5e0eee5bfdc99c5fd46f2cb1ac0685b9","observation_id":"ceeaa65e-5ae9-4037-8c03-29b00904140d","resolution":{"observed_at":"2026-08-09T11:57:49.690490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.672590Z","title":null,"venue":null,"work_id":"215da23e-0365-4d51-8ba1-9cbbf57cf449","year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.001527Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0bea61c240828e133603614039e8fa8d2f9d0d1502235c1771fa8e0fbb9a3836","observation_id":"825bd4f2-9bbf-4372-8d44-9d73c49354da","resolution":{"observed_at":"2026-08-09T11:57:49.677070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.659738Z","title":null,"venue":null,"work_id":"7c1cb7ab-29a8-44e1-a462-6909b06f315b","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.006055Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:9937afdfb04bc477352efaf10a8b19426d1eac6bb5e0002dc98c0778ce4cc1ae","observation_id":"f374d70c-f487-4960-b004-b9010dd17816","resolution":{"observed_at":"2026-08-09T11:57:49.663891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.179452Z","title":"$x$\\\", (high, 0), E); label(\\","venue":null,"work_id":"f1256a58-2daa-4972-bb3a-90892aefde7a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.833684Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:7822a44bedc040aba3eb1296a7161dc8d7deef285535fd973989c22eaadb93b8","observation_id":"440fd80b-05ef-4887-94d2-c5c0950a5070","resolution":{"observed_at":"2026-08-09T11:57:50.183460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.646518Z","title":null,"venue":null,"work_id":"f5940daa-623a-4de4-a00c-382d8e1ec2bc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.010468Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b7d783d8d87b22c49e99a8fe2857b7fb225f22f61e61c87008fd5d02bddd67aa","observation_id":"a98f65f2-ce8b-4bd4-9cd3-4a3eb0c65d48","resolution":{"observed_at":"2026-08-09T11:57:49.650716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.633360Z","title":null,"venue":null,"work_id":"f9e0165a-d7d3-49f5-8890-8de335037dcc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.014684Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:585007bdc556ce207c758d177987cacf9d6c166d92e685d4de4fc13c101419c3","observation_id":"6acb6765-8bdd-49c4-8d36-86741e19e657","resolution":{"observed_at":"2026-08-09T11:57:49.637406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.620662Z","title":null,"venue":null,"work_id":"f8cb710d-e802-49bd-be8c-148285178f1d","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.019125Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:1c920f6cb4f1ac211e991da874e8c71c62b5b95cc196337821551a583f368c7d","observation_id":"8cc3729f-f38e-4e13-af50-12adacdcab2c","resolution":{"observed_at":"2026-08-09T11:57:49.624675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.608045Z","title":null,"venue":null,"work_id":"157e16c7-d1ba-4560-adf1-9679eaa3c1f6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.023421Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:03ae8215d920f706b8d7f3dc20c3641ee0bd1ee33cd45bcfc1c8513abe3fe678","observation_id":"fdf46ab8-92e1-40e4-87dd-0dd07027af26","resolution":{"observed_at":"2026-08-09T11:57:49.612216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.595008Z","title":"The prompt templates for these situations are detailed in Appendix D.1.1","venue":null,"work_id":"61934083-e7bc-45ea-b351-f6bdda52da3e","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.027700Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:316a07e26119161a3f9b449a9d03a559e89bf5556fa73e31912a6444bc02e598","observation_id":"3bb8c525-c608-422b-bad7-b8df7e631eb8","resolution":{"observed_at":"2026-08-09T11:57:49.599320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.582224Z","title":null,"venue":null,"work_id":"43e47a6c-a4fe-423c-99c4-5ef2ae5134d8","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.031908Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:66852194098d15b4585b3093d619fcc088c10ad2d9259e82f3237fb6d6b88ea7","observation_id":"73504001-38ec-4431-a69c-b15472a3f8fd","resolution":{"observed_at":"2026-08-09T11:57:49.586401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.569154Z","title":null,"venue":null,"work_id":"4e0ac90f-cdfe-4b83-ab39-203345f3d50a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.036034Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8719068bda9d10fdeacf73464f0103a7704de606fed399747528d2cadf4794a4","observation_id":"f9036570-0158-46fc-a653-4793b71f957f","resolution":{"observed_at":"2026-08-09T11:57:49.573534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.556220Z","title":null,"venue":null,"work_id":"0b8696c1-7ed9-47b4-b54d-c6cfd384d1ad","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.040666Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:3de6e173439d9dab45f2f57f3cfaa75dde1148a07bf23e5de85f255eb375d043","observation_id":"2be8cf18-cc91-498b-8c66-97132679f4f4","resolution":{"observed_at":"2026-08-09T11:57:49.560445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.542918Z","title":null,"venue":null,"work_id":"36f9b1b0-a513-46c2-88ff-3f97fa589c11","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.044888Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:07d02ce27e2ee4b7f36539bf09102cb4423f267a4ff132ba7efb6803098a78d6","observation_id":"a31b254e-eaf5-4416-b473-50d75e761889","resolution":{"observed_at":"2026-08-09T11:57:49.547163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.529517Z","title":"Therefore, the final answer is: \\(\\boxed{answer}\\)","venue":null,"work_id":"3e716699-d752-4638-9235-c580dfe69251","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.048976Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0a933e5a70c89029f1938c13084e0aa2baa28a85ce63b3b5171caea49e811347","observation_id":"21746f7e-f1ff-437a-9a0f-a5188a9b3e90","resolution":{"observed_at":"2026-08-09T11:57:49.533673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.515866Z","title":"Verify: [brief explanation of why you are correct with one sentence]","venue":null,"work_id":"4c848f43-4b86-4793-9d6f-b9d378c360bd","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.053555Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:fdaf23bf427c4a9e1a225e1dae3d862f22e8c7a950f7d006846a088984d19168","observation_id":"74f75386-9f21-4dbb-a897-5a9759c8299b","resolution":{"observed_at":"2026-08-09T11:57:49.520413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.502836Z","title":null,"venue":null,"work_id":"d3c919ce-fbba-4790-8224-02b81f3123b4","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.057793Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:fd7fcb7e5d051d6c8ac11f2ba185ef9caae44bec456a74173ab8ae2069275798","observation_id":"b8140fec-c184-44ac-ba4f-ba4d59b635a4","resolution":{"observed_at":"2026-08-09T11:57:49.506941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.488590Z","title":"ground truth solution","venue":null,"work_id":"8ce638ad-3855-4473-8d3b-4dfbcf6a1fef","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.061965Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:33cbf92410b17c0f1830aa2149550e69e3b93ee2dcab265f080c0a96bbb3566e","observation_id":"8e954bae-307e-4996-a927-807d6d650c62","resolution":{"observed_at":"2026-08-09T11:57:49.492947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.475289Z","title":"Your task is to carefully review your own solution to a math problem, and adhere to the following guidelines:","venue":null,"work_id":"8182ed56-166e-4a73-bda4-2b0f7703afeb","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.066144Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:56b0312476a3772d7ae69bc8226c5f857a260cfe096cbb5241056f4fb99f9ef5","observation_id":"5145fcb8-f4d6-446b-b393-24040ba1a788","resolution":{"observed_at":"2026-08-09T11:57:49.479751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.461663Z","title":"In Step <id>: [brief explanation of the mistake with one sentence]","venue":null,"work_id":"8c873df9-86cb-4fd4-8630-bdc97c68879a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.070386Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c84d70d893fbdcdd7099a6a0e5c5727ccb72502c5cdbfa5c5fa8f8c531b8be5b","observation_id":"001184a8-ab1d-465f-bf9a-98620a7691d4","resolution":{"observed_at":"2026-08-09T11:57:49.466269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.447778Z","title":"Alternatively: [your suggested step with one sentence]","venue":null,"work_id":"f78de392-65d4-45db-a802-759116f6aec7","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.074909Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:276797c6a5a0ac30c0a73c6c561fb3b12eb3b53009303bd81a48fa22eb4976f0","observation_id":"175599de-f265-4d54-94bb-a9a071bf276b","resolution":{"observed_at":"2026-08-09T11:57:49.452554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.434140Z","title":null,"venue":null,"work_id":"74cd06a1-b278-42b0-8892-223f38fd931b","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.078980Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:fcaddb0c5b63aaec7c6b51722e0da020d2a584bd58b2c82c63cb10b7292d8511","observation_id":"5ec0956c-14ff-4e15-9f1b-8914bc491e99","resolution":{"observed_at":"2026-08-09T11:57:49.438562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.420847Z","title":"ground truth solution","venue":null,"work_id":"f00d4a32-5c51-44cf-9ad3-600d92c7ea37","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.083128Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:487961af1355e0f8e432a2cd282256f3a0cff4cf61f62e02b4e6292fc699b588","observation_id":"12b31eee-316f-4c46-a17b-ac1890d98f6e","resolution":{"observed_at":"2026-08-09T11:57:49.425042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.407269Z","title":"You are collaborating with a partner to solve math problems","venue":null,"work_id":"d14444f0-7768-4c8e-9219-815075b36ef9","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.087244Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:385994d5110fd0aeec67647729e2ad3a8e045f6ccaace58a89a5a64358914435","observation_id":"87e3eeb2-83dd-4dff-89fa-3a4ca5684bce","resolution":{"observed_at":"2026-08-09T11:57:49.411650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.393804Z","title":"Your partner’s partial solution","venue":null,"work_id":"c7635d79-e52c-4eac-b085-a4654becb9dd","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.092476Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:9b4fbddd2635412337f87ac05aa754499e7b978aa8a80fe9465de46b12f48586","observation_id":"d0f29297-4655-444c-9f67-15c26dcb8c94","resolution":{"observed_at":"2026-08-09T11:57:49.398107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.378902Z","title":"Your partner’s partial solution","venue":null,"work_id":"2110d6a0-0da5-4557-863a-7cc7fb1281c2","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.096709Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:04883ac7331d47e2a781d7c8c78cbf78674105d2e3a2aaf0d45c9e69582de7ab","observation_id":"68dcfcd3-ac7a-4ee1-bcfc-b54d0dd5352a","resolution":{"observed_at":"2026-08-09T11:57:49.383765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.364475Z","title":"Alternatively: [your suggested step with one sentence]","venue":null,"work_id":"12f9d4b8-0824-4d8f-84dd-6fc90c78d039","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.100902Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8cf41aa224fd81b4f910470b4373a576bd3d008fd5b00c2461ed53e07514388e","observation_id":"49e2bf81-44b6-4ce0-853b-db0cf2e0b213","resolution":{"observed_at":"2026-08-09T11:57:49.368878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.350285Z","title":null,"venue":null,"work_id":"af691c1e-5869-466d-9804-fb4c24e9fee2","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.105098Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:ffdbdc43b4455c01c0b71cd5ac252cab7283b345e6e36ce03be70d07ef80c9dd","observation_id":"1eb586c8-faf3-4076-939e-fca111bc0d06","resolution":{"observed_at":"2026-08-09T11:57:49.354962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.336379Z","title":"ground truth solution","venue":null,"work_id":"7736f983-a04b-4474-88ca-690a75193942","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.109751Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e2f1c745b64062442e304b8bf5be87246632258fb78f07581102cd7d90239134","observation_id":"b8929a89-83dd-49ab-9288-3c0f08af1672","resolution":{"observed_at":"2026-08-09T11:57:49.340855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.321844Z","title":"DO NOT refer to any mistake in your partner’s partial solution","venue":null,"work_id":"7e794e9a-ba4f-4e5c-a68e-378bbebab8de","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.113775Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:f71f195fa251efb74854c67f7c181d0bea78200706e967ec336ee85396de7c6b","observation_id":"343bcb62-c7e8-47c8-acc6-b67a5f3a413d","resolution":{"observed_at":"2026-08-09T11:57:49.327010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.306249Z","title":"three two five","venue":null,"work_id":"ad7f5da8-f859-41c1-93ae-a992e0544077","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.117837Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:1d4640adc49b21ede99fe82cebcd5cf9a533615c1e11874416168849be64277f","observation_id":"f3f5fad2-c131-4f0f-be50-f619e458dcd5","resolution":{"observed_at":"2026-08-09T11:57:49.311495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T11:57:48.792502Z","title":"A reduction of im- itation learning and structured prediction to no-regret online learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":668,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.792502Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a0695a4895dfd15b1241a04ef5d06d2701ebe2041c823d97c39a69ff12bef2dc","observation_id":"2bd64f1d-4468-408b-a609-8a5c9002de74","resolution":{"observed_at":"2026-08-09T11:57:48.792502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.788137Z","title":"Efficient reductions for imitation learning,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.788137Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:06dbc94e490edbd1ba139d56fc986910db633753bc818af67dac7e893ac1e86c","observation_id":"48295069-fb9a-405b-bdbc-fd320cc7f24f","resolution":{"observed_at":"2026-08-09T11:57:48.788137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04229","last_updated":"2024-06-06T16:29:25Z","snapshot_observed_at":"2026-08-10T06:23:47.214592Z","submitted_at":"2024-06-06T16:29:25Z","title":"The CLRS-Text Algorithmic Reasoning Language Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04229","snapshot_observed_at":"2026-08-09T11:57:48.811186Z","title":"The CLRS algorithmic reasoning benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.811186Z"},"links":{"cited_paper":"/paper/2406.04229","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:bbaccd9cf13ce0ceba4bebc1598579e859770806a8f0c32c73aabe05e6641300","observation_id":"25f66ac8-423b-486c-9a92-82531b4a572c","resolution":{"observed_at":"2026-08-09T11:57:48.811186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.783650Z","title":"Im- itation learning: A survey of learning methods,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.783650Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b640f7b37e7bdc03b7a7a583d6556abd1bf8ce105ea4e2c79f3cc30171b11a55","observation_id":"9b043971-f640-4552-aee1-adc2149f58f7","resolution":{"observed_at":"2026-08-09T11:57:48.783650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01560","last_updated":"2024-10-05T03:54:22Z","snapshot_observed_at":"2026-08-10T11:04:25.169116Z","submitted_at":"2024-10-02T14:00:09Z","title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01560","snapshot_observed_at":"2026-08-09T11:57:48.748398Z","title":"Openmathinstruct-2: Ac- celerating AI for math with massive open-source instruc- tion data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.748398Z"},"links":{"cited_paper":"/paper/2410.01560","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:26522725a9ae23a774f5fb2bb4c5e88f1116743cdf872c107a6c4a1879c6e07c","observation_id":"74fa24fa-07e2-48f0-99c3-4e3cb1325270","resolution":{"observed_at":"2026-08-09T11:57:48.748398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-10T07:37:55.457401Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-09T11:57:48.806698Z","title":"Common- senseqa: A question answering challenge targeting com- monsense knowledge,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":3634,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.806698Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:25b8d16780357bf5b139b1b711456d160ff76b56eeccb8ade1648dc8ba7592da","observation_id":"18646795-6beb-43db-b12b-d781a9d6c42c","resolution":{"observed_at":"2026-08-09T11:57:48.806698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 14 inbound Pith citation observations for arXiv:2502.02508."}