{"as_of":"2026-08-09T13:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ad2d4855c279fefc9153299e70e951e4b644dc11278f44d6aa14ac65d74da90","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T00:15:23.806078Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:43:50.453019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:28:34.750651Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2603.15600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.15600","snapshot_observed_at":"2026-07-08T02:18:11.958550Z","title":"From passive observer to active critic: Reinforcement learning elicits process reasoning for robotic manipulation.arXiv preprint arXiv:2603.15600, 2026","venue":null,"work_id":"0e6b52e8-e76b-4ff2-83c8-94dff0fbeb8a","year":2026},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:26:32.209719Z"},"links":{"cited_paper":"/paper/2603.15600","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:492a421d6f7f2ecf11728e51e21567b79cc0c54ea94fe68d129d413bcc287b49","observation_id":"cd366838-6d98-451c-8562-d0297cfd7c58","resolution":{"observed_at":"2026-07-08T02:18:11.958550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15600","snapshot_observed_at":"2026-08-02T11:43:50.453019Z","title":"From passive observer to active critic: Reinforcement learning elicits process reasoning for robotic manipulation.arXiv preprint arXiv:2603.15600, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T11:43:50.453019Z"},"links":{"cited_paper":"/paper/2603.15600","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:332283562625c6acee828e5f908ba3af18080a1a874a16169664be3c0790667e","observation_id":"fa4c40d2-3acf-4b15-a40a-2b5d8b6537b4","resolution":{"observed_at":"2026-08-02T11:43:50.453019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.15600/citation-record","integrity":"/paper/2603.15600/integrity","json":"/paper/2603.15600/citation-record.json","paper":"/paper/2603.15600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2503.15558 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:42ff5955c744d07c6190b6ab623b8d755caf87dec0d480648641c1b3d4712813","observation_id":"c920dbd5-d791-472c-ab73-ffa4817ff4c9","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2503.06669 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:f1318fd102a0874d688487a747e4b2ea7dc75d47428d24ff90e8a111c9342303","observation_id":"906857b2-1350-4767-93bc-c6712ce26667","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2506.18088 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:8020de843b2f231a69f182005d71cd5e290ac68113ffba5d0c3d1990b1ae0822","observation_id":"c6985b90-d686-492e-ab78-98eeff8a4703","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"International Journal of Computer Vision134(3), 118 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:002598c8f0d358ecfaa1637823d4dd382a4c0b28a19c70aeb988c01405ab4805","observation_id":"2f6baf78-7525-4c7a-8146-015d16a440be","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:8d95cfea458769c1879531a04dc1663ddc4238630cb11b17b125eeee7a82c111","observation_id":"ea14883e-98a6-4fb9-9ef4-a8371292709f","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:7635691608a83fb9062e51b2e9b294144e5bbac3942020e4a13b8ebeb97e9cf4","observation_id":"dce9322f-d4b0-472e-b15d-551d74b47622","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2503.21776 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:e87d2efedc1c8dae11fef314e46f8df124321949f0de447b5028cee5134bc3a2","observation_id":"fd42acf6-edd1-4dec-8704-47722f4f9b15","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2509.24008 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:0351e2345a2046189ea30aef11cea784977e8c5576637de21c0c3f38b826ee06","observation_id":"77d94f18-604c-498d-9106-10d7ec5dcf74","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:a3c58a84441071b0027be0197e986be332023d4d82fa57553ecdc8ee8cb0b27c","observation_id":"e95b8d0a-e0d0-4397-88c8-f1291d8de256","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:e7f224dc1ff0b7db712ac39db547e6d2574d8f4adb3b010f8b0df7a4abd45cbe","observation_id":"26cf2db8-8fb4-4803-870e-35384312ee11","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-07T17:39:03.240589Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2502.21257 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:80a46870bca3d118e8173be534c7410ebcd5baf91bb96df6ee74ed186db592a4","observation_id":"1225215a-d9a5-4a9b-8f23-55fa07bba6b0","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Conference on Robot Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:86118fa295575fdf0e627729d2dbd073e99b0957c387a480c0e5e0ce23b57294","observation_id":"739393f4-a145-47af-b25b-b0a548f38353","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"IEEE Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:a0059de699a482ddb5b9ea84fb8dc08e9f1dd39a784a15949775fed32eb8b37e","observation_id":"d4d2860d-ae29-47d1-912e-baee44ce171d","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:d67378bb13b2cb37d06c9138384b8be7b3babd224675c2355b8969f98822dff9","observation_id":"93c2f594-3627-4441-a4ac-a2b5dcbd01ed","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the 2024 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:e56f271d4987f754e4a159fd01afac5129e265c022146fe163e34a9c1efef221","observation_id":"8a89f71c-52dc-4a5b-91b3-4577aa2f63a5","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02629","last_updated":"2025-08-06T07:24:55Z","snapshot_observed_at":"2026-08-06T04:52:16.570994Z","submitted_at":"2025-08-04T17:18:14Z","title":"HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02629","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2508.02629 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2508.02629","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:8954d295b8ae88afa0db581cdad69c05bde63c83e17c90ec95cb14e5e668e719","observation_id":"d8123644-d375-4a8c-b703-fc8df5f30158","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15724","last_updated":"2023-10-16T21:04:57Z","snapshot_observed_at":"2026-08-02T12:10:11.743351Z","submitted_at":"2023-06-27T18:03:15Z","title":"REFLECT: Summarizing Robot Experiences for Failure Explanation and Correction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15724","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2306.15724 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2306.15724","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:cdb2c20d93388d237ecda87fc78744a759ed1cdeff8fd75ed4eaf7c08f82f456","observation_id":"0d5de116-de60-4dc6-88e4-86129c48f8fe","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: The Thirteenth International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ce74a5f30946859a249a74603d7fff3a53ba6237643234d39755132a278e8404","observation_id":"9ab05e74-3e3c-455d-94d2-b7f56154b112","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:2ca00fb3b8365ae74b2db4c0385e6a3058918a4a8f412589e875603b86e32441","observation_id":"0e6633fa-a047-44c4-82f1-809833e3666a","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2210.00030 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:11c40fb85b0ec2d1044c1570a3653dc407d6c579b03262264e4d5d19e1d9b89f","observation_id":"daddd858-47e4-4b90-99f9-5afd777f99b6","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:16998a87e99b6b8ad87445155124c0898a7d6d20fee70a156d5071db647437c8","observation_id":"5f0f3ebb-341a-42ba-9293-4fd4d99f65f7","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"Advances in Neural Information Processing Systems36, 42748–42761 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:95a47fe781b7a58e5d714be73c109b8bb37a46abd243603e14d37840b9442c48","observation_id":"7f11d403-8ca4-40ed-b9db-9fb470e15885","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:652b8273226931f697396121423c990413074b83a879b198c5f54a151b372792","observation_id":"849ce268-6fdb-4ca3-a01a-943cea8e4504","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:be3f48b22f6c077a392817230e3d42cacd2ff84d8c44b61bde37ef7de061fa4e","observation_id":"34d4ee02-880f-41de-b9f3-1291531ae180","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:f3e9a8b4608df89b6cbfbdecc216d3f297988807332fb1d006c2bd9f8b4f5cb5","observation_id":"d349e58f-4194-4901-9c8d-14242a2bcc2e","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: 2024 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ee44b29f50ac0e6b16f41e68d84de6a6fe56888a0216919663418e01ed614a99","observation_id":"e9c53b10-ced2-474d-b9ee-dea6033e6a2d","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2504.07615 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:c892b162cbd8cbe2519d48fd836d9bea234f3a8b708f43bb815fd89acc3ffbe7","observation_id":"d88e741c-b566-4753-a169-5bd6d602c2c9","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:caa8f1e21a42ec9165aa1be58b40aa13783fa27af80c7c075de44798b1be9cdd","observation_id":"1aaad079-3313-4336-9dd5-ff8dfc7c45e6","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"Advances in Neural Information Processing Systems36, 55681–55693 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:6e185b77f5ef09f620238a6428db7681fbadb89d97ca0c28e08b6c452832a84c","observation_id":"bde9bf53-b50f-4062-88ac-53300a35c169","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2512.23703 (2025) 18 Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:6450526df073261fa60c6d75bf99bab44811729efb6f1c33996d47f0ffb6af0b","observation_id":"3ade0c3d-d275-45f9-887f-c96f6f150392","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2503.13377 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:0c271cb5f307d3aeaeacb716a7d0bb80cd7ceb8b1abbd0cd33bf27d81e56ed7b","observation_id":"b1878c71-7d1b-42b3-a3cf-d3016bbb1f29","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:9d1438076d5bf2a64e60a6b741cfdfb1405be5b4b9216f463cceed2d8fb090a1","observation_id":"1f889538-75ea-4539-861c-0b2788cfca84","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2503.10615 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:991719815172271be24eb7d58ff522361344d4a78ecc4a6eab64e68ceddc36a1","observation_id":"47df8133-c1e5-40e7-a383-0248b4f95a99","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"Advances in Neural Information Processing Systems36, 76749–76771 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:7c8b041006ac2eb24d3469cd0cd50829a2d4e2133f4e6e5b2448ab0fab73d73a","observation_id":"4e67a908-8132-4dd4-a9be-e528f9bcc6aa","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2509.15937 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:309b90ed6e015ead883f230105ec7f77960aca88d71a8780f528f268152f6713","observation_id":"2fa45b7f-6e93-4d3d-9ea2-7f3953076b21","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2505.10911 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:25b74ab099ba56e9e9a76ae6f8d97e13b6d16119491368ec6b6cef75af64b9f2","observation_id":"152efcb2-adf0-48fb-aa7e-bef29a39a8be","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15224","last_updated":"2026-05-21T22:24:08Z","snapshot_observed_at":"2026-08-02T05:31:26.489605Z","submitted_at":"2026-01-21T17:56:59Z","title":"PROGRESSLM: Towards Progress Reasoning in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15224","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2601.15224 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2601.15224","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:5b1d083f337b823335f5d91e1db2a1e7563cbfa6e3c6e3584e625ea4c5777126","observation_id":"035738a4-3709-487e-8dd6-e4d6bd2550a0","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"action af- fordance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:a6ed766e268e1b53d88fa7d41565311a79c97676fec66fbe624e1716d2401aec","observation_id":"79630530-51c6-4ae5-b6c6-df80086870f8","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:46bf295f7e1c284a4dc51bbcdaec8d0bafc86d5c289cab98f576ab68d35b86da","observation_id":"351bcaf6-86e9-48a7-a226-767d5c55d8d4","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:db1da7a238c307f92274f67fa363fb2483a3b1700ba23a30a6803a6650b1ebe9","observation_id":"10b346a7-4e13-40da-a142-9ba9c4e868f3","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:93722dd85bbd6002621335aa1cc72ffe8770c71ecb929310f1547d6e58c89770","observation_id":"534a3022-9c85-429d-b32c-e3a1186fb7dd","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:4ac9a2390daa0b321db928d94a6e53ddc537a3a3d12a12b160ba216776234dde","observation_id":"1a190acb-accf-44a2-9e0b-b48bfe664bec","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:b33d9b31049c567a4763466857d92b10d0e2a3886d7931d56cb753436a0e3787","observation_id":"7cd01e7c-aa96-436b-9c4d-afcd8466f85a","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:15c7abd1ca1f0115a9f6ccc2fa1436279da17d387f1ff1244ca2555429e4663f","observation_id":"68e81e24-455b-46ca-911e-9d991c001d1b","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:637694d29aa687148878dcd6db7dedd6ba1b65b793595e90567f92e4869bd091","observation_id":"73772088-f22c-4a07-a482-e11f7631d104","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:d556596a94013234fa101c16e06ece7addcaf25bfc7ef9a7183a198eef8314e3","observation_id":"20038482-61ac-44d0-b86c-6125a4407884","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ebf179b8036757195e5b3c26d83526975b0fbb5ae1623e4749d1d9e0128169b7","observation_id":"b40090d2-1706-4e92-9ed4-4295bfff4837","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:0789a12edbf31f03f0002a6e38435bbbaba0a4c47ce85d4044f8fc02c63ab39a","observation_id":"c84cba22-3dfd-4c07-8652-8a60cff220d2","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:34ea6249522a8081d572de5a3a6ac65a657945cf0aa0323ded35242a2f3a73d0","observation_id":"18949f62-9e2d-4925-8274-5ee860451b9c","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:215ba58384a16177dac875512043d930afa504f310f2acc1c6f6f651b61c0775","observation_id":"f3b732e4-f508-4393-839f-2cff31177a10","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:cd937ca2201224e4ee43c1c3aaa3a81891329f39b0591e5ccffdf39acf039982","observation_id":"19af9763-7ae7-4237-ba3c-d0d53bceec44","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:141ba7f204ebf3df24c41bb102d18e9f5e803e88de246ee6f1b7d5ebac72c7e2","observation_id":"926707e5-4660-41d0-aac6-6c2a07efe432","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:08fd7cbc4273470e77d372fc99df784197ce9e33bbb6d1279166ffcd77e19db2","observation_id":"59e94540-1d3f-48c5-a519-41204336493a","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:02f697bbca38f7ff32d958331c31471b0469697df5c2791fadfe1689be377e1b","observation_id":"7a9b5885-2747-410f-89c4-f0b9a4adfbeb","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:4879f4fd2914b9bece0b3dda5d90ef00c78e4828dac86f06f2f2e4ea4abedf26","observation_id":"b8890ae3-9a5d-4d82-9b1a-4a24dec4252a","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:071191c485cd3931b41e2d0b39463d2b6ec0682d99ac7174d87641706635687e","observation_id":"5e6b3a2d-697a-46dc-a6e8-6d2d27a6d729","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ea604c54d1949d289f2cbb82c85c52e9ff38306d72170be80e948dc413acc030","observation_id":"6c5c7a38-8b03-4a8a-a00b-6300a6c1c57f","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:a8bad7e223f48dff64c9c2f53344514811031508bc9f83af3fb3fc049b8a4b41","observation_id":"8dead64d-278b-4012-9f74-99dadd6d3bcb","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:30679dfc0caf13bbcb9e13e38491e9b92dced0b08cc65ab5d063558fc0862959","observation_id":"5258f7f2-c35a-4780-8373-6ba88ee75fb0","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:18e7842080d09cf56b5b2c9d91350319f315e70b40bababa2942e60b2d22e4ff","observation_id":"c25d3396-957f-4a79-ae7b-1d36ab64cbb7","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:28780eb532962be681151026fc081b8f996dd01af9a70fa130f4d640ee056365","observation_id":"597e948c-5a1d-4619-8dd6-a2d55408f569","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:25987949e28a1b7107e5d14beae1b36a6caa38341a2ac109f60dfd71bf229828","observation_id":"178c66b5-29d9-4275-8b9d-1fa5e18d1da5","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:062c7641834b9a0de4216c0dbf72824050d4bbe55c4f3ec8cdab948790a4f99e","observation_id":"b345ea29-7e16-40f0-a21a-33d9eefa6fba","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:7cd8da9406cb64d624a71902ecc9c498a4d2fb46e6ffcef1b04b982d059d4390","observation_id":"daf0d1cb-c942-4d7d-8641-244409365810","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:da18cc9bf4dc430aa3c3e5a739c661b47e9f8cd8f0e4dee3ae706e9b65074bc5","observation_id":"cb0a888a-d569-4d6c-afec-6250ce962257","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:00492942697f12e2aa991b20038cabbad2aa8e5cf6af90d38f8728ba57cf22c0","observation_id":"68c0fa73-402a-4af7-9796-ffbeedbea826","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:952681750f3892620873677a66861f2ba71e269fa5910137734aa1c7f3535912","observation_id":"c84297d0-2014-4279-941d-66447aa3592c","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:424ea16761e5141ede17e39367e8921ac4a6827e86f717f41346b05aa0ef0515","observation_id":"78718746-6dfe-48d7-a371-b39014a9aa7d","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:7e8116b8786426781ae78cf3feb84ed9f4d348d36dff95477c4aa76243a2836e","observation_id":"9392ff9c-0f50-4e85-a324-05ca582a5180","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:95a124be3a3823596d214f8d570ee03b4c38b314335baa7115ca0bbe9be2d86e","observation_id":"07ca303a-338a-4e6f-8a50-f42114704f21","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:0843cecf9931bbf240572c2122005d4e5f408fb145b7499140b6abc3398a4253","observation_id":"70021a35-7441-4840-91ba-540fc37cc482","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:3890b3d7a24a2c7b926eb0e61ebd94c1c51c04ee1ba215e92566cda1c65b5433","observation_id":"041ea1c9-f40a-4c16-9175-be85b32438c8","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:77caf63d724e497d9470ccce50f6d7634b8ba629772b27362657c2e9d31f9b96","observation_id":"8609f85c-0c2a-4e34-9c4b-fb3ee53f9374","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:285c076b48e1b58e5586f7ab9753b50bdc52f02afe98bb45f9d931bfd3c8576d","observation_id":"505376e3-332a-4f72-98cf-c74c249f3cca","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:d3456108cfda9196614d173de5d6100afbadbb37101279345af451d102723671","observation_id":"b6dfe426-33ae-4557-b460-621654beabc3","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ee1d7c93180b33eca14d3ba64b8f262e6edc72708101fc7bb952a32349d752fd","observation_id":"76524d55-fb3a-4ef8-b9d1-20240320611d","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:8c0aaa61cbcddae03011d6ab0cded6987690a22c84f7802554a867aa75d6d413","observation_id":"f46f3cd5-2d02-4d7a-a437-72ede533dbc9","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:44b34e1fca56ea2fce7557d02a20721a517c58d6b7e014ace859ca800f5da3bd","observation_id":"f6955444-0d5a-4cbd-a69f-445dac5094f3","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:73b7fd964c52b1497c52ef3ee795c6c76f62d3dccd06c4ab5034a7e0acfe6005","observation_id":"2808c361-a09d-46f8-8e44-c84bfb8b5228","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:d0716a5ee146afbbdc9062a769fbc2222b96325a8c0bcb5db945b11e47c8dd20","observation_id":"f83ad472-53cb-4306-90a4-ba21bc075e9e","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:fe1cf228e2df561355422c4133d1631d518dd6eeaddc5383a47022f4acb61bf8","observation_id":"8edc348a-376b-45d2-a382-30395ea954d9","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:93467a403a134e9edd20accaea20389848648ea6ab460b42eef948c97ef3fdd1","observation_id":"dd7a986d-25d8-46d9-9d82-b29a4ea2a522","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:d0445b8585fdfa9cf7dc5d31e2e980fbbf82faf32e5c0f64575e91b0a6caf574","observation_id":"a910ae80-4e5b-40b6-b87f-038ac253890a","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:cd10aafe9efcad58a12021f26f137b41a84196b196e0740d94f566a5d173e043","observation_id":"eb2a2479-e307-42c9-8f1f-283e2c65f5f7","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:69bf4fc8a421775c0308037425a38144a1511c3dd310b50268cb903379325abf","observation_id":"42c2320e-f8ed-46b4-b525-45b62fdb03da","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:5e5b6e619906a0bc004372657a35bfee2fec2901f0461451912f99eef53280b7","observation_id":"981be42b-ed00-40eb-b23c-c32a4e1326c7","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:c3bb3b4d4e33569ec9ea63982575ec6c76b0ed1b55a44f018d0eba75e536662c","observation_id":"ce3bfbc3-7d2b-4302-8f59-5174b85d5650","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ae5c23ac5d78485f41cba9368d60f2fda669552130ca18e3e93ad6cc481c4d4b","observation_id":"de7ad738-5761-402f-91d7-8b861bef026b","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:a80eb375d3fbff42a812e24798f5fe25848f9240d4a37ea154105502ddaf13d3","observation_id":"46ca7258-3b13-4a6f-98f9-ff6ec787c5c3","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:2adc6c89605ad9e1eeeb9f504c685076308200eaad14ab0fa2219a36526af9d2","observation_id":"9f480a64-a050-4a8c-bb33-1472c0163b73","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:7344c404e593e42c753572ff0aef4299825c9f4fd4cc7f8303ea008e1c616423","observation_id":"068c8929-6e80-4691-b069-0067d15a2eb9","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:9498c38039a04aa5e4bfa623b821c5e18bc0791b60ffca20f10a4baec6bf8337","observation_id":"f36d2235-ba91-42ba-be67-7dcb23f1b806","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:55eaf085550458cb6db4faaf335bb73427466f05db6d0e78b968acd420d6b299","observation_id":"8ad243ec-b105-464a-b35e-92222f4601a7","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:0e923588b8e06a4455debc7bcf2ee8c00601fcc3f7ff61d21c4fe39a5050ac37","observation_id":"e95d1cc9-37e9-4890-bd7b-0a51338e1448","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:98d1b790ce982df2444d833aee6bd1427e69854709d7140596044fe99b6f7c0d","observation_id":"8af89784-aaaa-429a-bf0f-95c845c10306","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:af9e07738e80091f7dd5cee419a8b2cf0b48d1a52fc4b3438079689903c5ef8c","observation_id":"bb5e6354-016e-4539-82a8-60e5a6bc6d0e","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:3e9d0dd17a5fe5ace3fea9a033c4ec575a040ca7acc6b41bb7bb0863aaea16df","observation_id":"38f1d27a-360b-46c0-9411-b436a64fcf9a","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:2f0ce8481c141cbddd7e94b59524a000ac1d7730cedfcc558479a85f00e3a5c5","observation_id":"9467cbd6-da70-42da-8aab-56a96b5f735f","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:69ccf18336986f77a7063be1fe6496f92366529e4c45e5bf251a0dbac94424e0","observation_id":"9d1d2f9d-c8a0-4374-b5fb-71387a79f341","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:72d81caa475568ca153670e514515c9c2fe75b04d42144c49128c19a0a5c7b4c","observation_id":"de8650fc-db8b-47c8-a626-f367eb744c1c","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 2 inbound Pith citation observations for arXiv:2603.15600."}