{"as_of":"2026-08-16T12:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2523ee1a293a11f1eb65e7349210ee259a064f411c0878e880485476cec8da15","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:21:40.641794Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:12.064728Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-15T23:21:12.064728Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.064728Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:2dfe2453b74a84ea56b957e956780513bb5b23a8733765da40f0bf4b69140da7","observation_id":"b6a2d442-edd3-43fe-b415-f99bd643a4e8","resolution":{"observed_at":"2026-08-15T23:21:12.064728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2508.11196","last_updated":"2026-05-06T08:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T04:06:40Z","title":"UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T22:17:41.758059Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2508.11196"},"observation_digest":"sha256:1c684a735aba97116e6e7da59dbced863c990f7ca3db71ad3091cd9b65baec01","observation_id":"562becc3-0bf1-4cd9-b8f0-829ea6af43a6","resolution":{"observed_at":"2026-05-18T22:21:53.290875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-15T17:09:18.102569Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:18.102569Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:55b14c2565f215b0b29e27d40e49dab6cb41a2f5db84dd4f441cfd7bc4c68975","observation_id":"be41000b-fa61-4774-89c7-5dbac2f99424","resolution":{"observed_at":"2026-08-15T17:09:18.102569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d5813fd69402447ad172a912ff53b57208493275b0f11c6e19bd0a965011185f","observation_id":"3c920247-9f73-4a74-b31d-de700b27b369","resolution":{"observed_at":"2026-05-18T19:21:48.400095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:5a7357cd0e33fbf8b5c27bd42a772e223e9e01b307fe0129cf47be574000f235","observation_id":"bd874107-7871-46f7-a6e0-00b32ff204d2","resolution":{"observed_at":"2026-05-18T00:02:25.071498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2603.15432","last_updated":"2026-04-08T15:52:59Z","snapshot_observed_at":"2026-08-13T13:13:25.945624Z","submitted_at":"2026-03-16T15:37:07Z","title":"Gym-V: A Unified Vision Environment System for Agentic Vision Research","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T10:05:09.049846Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2603.15432"},"observation_digest":"sha256:fff2ddb812948db272f0b20fff87bd1039b43ea7b0b06e1cbd23a0fe6b5caf23","observation_id":"956c631a-0ef5-4bf5-8f4f-2c7720d85ba0","resolution":{"observed_at":"2026-05-15T10:05:26.028670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-08-11T00:38:42.624588Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:6345dbe50fedef7e77e6eddedca01eead6dc7f157aedc0a6a1d586f9ee1f0c12","observation_id":"58c72bb5-6fd8-4fc1-87b9-46224ea591f5","resolution":{"observed_at":"2026-05-11T15:16:08.788471Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:24.844859Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:c6c05607bfa83dc10ca12e77bbfb8e4ec6319fe627fc17688128032082be2d04","observation_id":"c91ea36f-f7fd-4ea2-bbdc-c0320bde6f33","resolution":{"observed_at":"2026-05-12T03:26:19.110488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:28.552513Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:7799bdd29d2340dee6cd06a416930ade945a2fb59ea52ad828b313b7aed362c6","observation_id":"9da3c042-ac19-4f9d-b2fa-fe0fe1f26042","resolution":{"observed_at":"2026-05-13T06:47:26.994016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2606.28266","last_updated":"2026-06-26T16:57:40Z","snapshot_observed_at":"2026-08-12T16:54:45.166709Z","submitted_at":"2026-06-26T16:57:40Z","title":"RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T04:09:32.397341Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2606.28266"},"observation_digest":"sha256:60afa000d5db27851d03e1009960a15af1ec126342362edd57800cdfc2e6e650","observation_id":"69838789-0ba6-4fc1-aaae-0b6f5097178e","resolution":{"observed_at":"2026-06-29T04:13:05.251364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.13426","doi":"10.48550/arxiv.2505.13426","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning","venue":"ArXiv.org","work_id":"4dddffc2-49aa-4fc0-90d0-ec06a2cedd41","year":2025},"citing_paper":{"arxiv_id":"2606.30217","last_updated":"2026-06-29T12:30:24Z","snapshot_observed_at":"2026-08-03T23:12:01.383471Z","submitted_at":"2026-06-29T12:30:24Z","title":"Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T05:55:19.083517Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2606.30217"},"observation_digest":"sha256:044d9ddcf4b872c2017765c6f781d6cd838257e6d791965bf89470a1c74335e8","observation_id":"3f6d3dd1-ceba-448d-8587-55ad11df59ff","resolution":{"observed_at":"2026-06-30T13:34:41.170593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-01T02:58:29.293555Z","title":"arXiv preprint arXiv:2505.13426 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25308","last_updated":"2026-07-28T05:39:01Z","snapshot_observed_at":"2026-08-05T09:28:39.486019Z","submitted_at":"2026-07-28T05:39:01Z","title":"CAST: Game Solvers as Turn-Level Teachers for LLM Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T02:58:29.293555Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2607.25308"},"observation_digest":"sha256:5075205f97aaf86ef38b123d18beaa22fde830718c90556df2bfa71a885b495b","observation_id":"2e6a6b4c-2bcb-419c-8434-262108d00612","resolution":{"observed_at":"2026-08-01T02:58:29.293555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13426/citation-record","integrity":"/paper/2505.13426/integrity","json":"/paper/2505.13426/citation-record.json","paper":"/paper/2505.13426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.335073Z","title":null,"venue":null,"work_id":"0f633f5a-8619-4ea0-9c2d-b990c14000ad","year":null},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.414846Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:34ada3a48f14f7476c9725bcb85acdffce1f21b3750a1c36a75f22bbed5de97d","observation_id":"632309ab-ceac-4221-83a5-87b08d498007","resolution":{"observed_at":"2026-08-15T20:21:41.340425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:21:40.420400Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.420400Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:eca2227268d76e6d94a755865dced9bbdc9f535364c89bd8009c8d24bda5e2c3","observation_id":"24134682-60cd-461a-b811-80fa3ec1cec0","resolution":{"observed_at":"2026-08-15T20:21:40.420400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.425329Z","title":"Deep blue.Artificial intelligence, 134(1-2):57–83, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.425329Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:adab610225de8d5a4ddf49543a2197edc5f449a0b1ba5fadec909a5f5b667253","observation_id":"279d5243-cd23-4ba9-affe-6dd70ebc6c66","resolution":{"observed_at":"2026-08-15T20:21:40.425329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.307982Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":"fb52c93a-8072-4b70-aa72-28e47615f546","year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.430240Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:c3f76945eedf8f5bd8cac783423f6349874fa74e9dca8bee6bfa889a142c1589","observation_id":"3fec197c-b599-4d52-8449-4d313ca7646f","resolution":{"observed_at":"2026-08-15T20:21:41.313219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.292059Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey, 2024","venue":null,"work_id":"81297e75-f465-4de1-8856-c71a6fb67b2c","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.435063Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:4cb52337dd31f9f53ff7e2b83beaa920b49c3f557f2a79a4a7fd2bb10f785e63","observation_id":"f83a8618-2e4b-4f9d-80ce-38bf088742d0","resolution":{"observed_at":"2026-08-15T20:21:41.297446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.275072Z","title":"Pca-bench: Evaluating multimodal large language models in perception-cognition-action chain, 2024","venue":null,"work_id":"50d565df-d3d8-4774-8e8f-d2b40b041263","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.439988Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:ed1a7e202d14057e687146ae998fecf024a9699e0419cb289cfdd99236fabfcd","observation_id":"369135b3-c9ed-42dd-8a5e-39620b1cf007","resolution":{"observed_at":"2026-08-15T20:21:41.281126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12889","last_updated":"2024-09-22T09:51:58Z","snapshot_observed_at":"2026-08-13T15:43:14.023141Z","submitted_at":"2024-09-19T16:30:25Z","title":"Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12889","snapshot_observed_at":"2026-08-15T20:21:40.444733Z","title":"Can vlms play action role-playing games? take black myth wukong as a study case.arXiv preprint arXiv:2409.12889, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.444733Z"},"links":{"cited_paper":"/paper/2409.12889","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:c3694a589afb12b6c732e8f68ba7ee27add272e73d32c9cd214ed575ee80ecb7","observation_id":"1a6d9cb4-f391-46e4-aaeb-b0cca2fb1a16","resolution":{"observed_at":"2026-08-15T20:21:40.444733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.259419Z","title":null,"venue":null,"work_id":"a6b26864-caf7-46e0-982a-e4068ade0bb6","year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.449752Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:09bb6b70c845d48460bc4cb049dd9bc68aeddb2fdae032602c7cf1bcb10fed9f","observation_id":"efd27942-730f-4235-bcc4-794e94b13ce8","resolution":{"observed_at":"2026-08-15T20:21:41.264761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12348","last_updated":"2024-06-10T17:14:09Z","snapshot_observed_at":"2026-08-16T10:06:25.840162Z","submitted_at":"2024-02-19T18:23:36Z","title":"GTBench: Uncovering the Strategic Reasoning Limitations of LLMs via Game-Theoretic Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12348","snapshot_observed_at":"2026-08-15T20:21:40.454784Z","title":"Gtbench: Uncovering the strategic reasoning limitations of llms via game-theoretic evaluations.arXiv preprint arXiv:2402.12348, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.454784Z"},"links":{"cited_paper":"/paper/2402.12348","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:d0e017cd1f3f62b4090ed94f5575cf7e629f19cb83e0383cc07904bb4ce8e806","observation_id":"67ab1055-ff75-4e04-977b-dcc0f3ffde41","resolution":{"observed_at":"2026-08-15T20:21:40.454784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15257","last_updated":"2025-04-21T17:35:42Z","snapshot_observed_at":"2026-08-16T11:27:17.531953Z","submitted_at":"2025-04-21T17:35:42Z","title":"FlowReasoner: Reinforcing Query-Level Meta-Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15257","snapshot_observed_at":"2026-08-15T20:21:40.459605Z","title":"Flowreasoner: Reinforcing query-level meta-agents.arXiv preprint arXiv:2504.15257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.459605Z"},"links":{"cited_paper":"/paper/2504.15257","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:1cdf82f8c9e752cf60d2a66274694d120414cf273261c6387bdbf78f5d891765","observation_id":"1c4d1528-a51b-4f91-89a1-44542b429875","resolution":{"observed_at":"2026-08-15T20:21:40.459605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03181","last_updated":"2025-05-06T04:51:57Z","snapshot_observed_at":"2026-08-15T23:55:32.239185Z","submitted_at":"2025-05-06T04:51:57Z","title":"VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03181","snapshot_observed_at":"2026-08-15T20:21:40.464359Z","title":"Vlm q-learning: Aligning vision-language models for interactive decision-making.arXiv preprint arXiv:2505.03181, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.464359Z"},"links":{"cited_paper":"/paper/2505.03181","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:b6b1c904db1b7c64691fff32d20595be12f8420f138c955a51efae826fcf212f","observation_id":"c351b643-633e-4b3b-8341-6134f6b7f1a8","resolution":{"observed_at":"2026-08-15T20:21:40.464359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.245003Z","title":"Mmevalpro: Calibrating multimodal benchmarks towards trustworthy and efficient evaluation, 2025","venue":null,"work_id":"3dd2d54b-0468-46e5-b08e-efa19ef44158","year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.469372Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:212ccc4b8edfb127d17df5c6b690c5be73767bd3f88c76cf8ad7a2233fc273e8","observation_id":"9669f4b8-7798-426c-a7bb-20595bb0425e","resolution":{"observed_at":"2026-08-15T20:21:41.249782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-15T20:21:40.473965Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.473965Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:31c13536ad9e65984d54c964424bb9022af8a19a1d3337f35db26793be2d0319","observation_id":"8f7321ce-28c0-413c-8135-2ff7b7a81489","resolution":{"observed_at":"2026-08-15T20:21:40.473965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.478709Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.478709Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:acb311cf563206390977ee3d146fb38017383ace1f7e8fce6a85ef0c5bb5dfaa","observation_id":"4dc716f5-6070-476c-85a1-73e1b3daf1c9","resolution":{"observed_at":"2026-08-15T20:21:40.478709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-16T12:48:11.595390Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-15T20:21:40.483549Z","title":"Jarvis-vla: Post-training large-scale vision language models to play visual games with keyboards and mouse.arXiv preprint arXiv:2503.16365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.483549Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:4cafcc34d3168a24ad710cc187e45eccf210fab3307ec850728e18f7b6106b88","observation_id":"5854a8e8-56d2-44d4-8836-6ee06d98abf4","resolution":{"observed_at":"2026-08-15T20:21:40.483549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-15T20:21:40.488243Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.488243Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:ffa99747f28e368c794a8d2aa7f7891a4a045c4461639ae3fad4b3c8536b1c05","observation_id":"2acb931c-f258-4e73-a7b0-304dbf0627d0","resolution":{"observed_at":"2026-08-15T20:21:40.488243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.492543Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.492543Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:ab05f1c36d7870d84e0daa98f759ef51e72abfcd11e3e2dd3927a18053ea4e7e","observation_id":"554de052-0550-4e9e-8ce0-6b395012918b","resolution":{"observed_at":"2026-08-15T20:21:40.492543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.496919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.496919Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:c5b281ac4ee925ad0f36d9e9cd56ebc0a9d6ae313dc5f66b18d5c57ee0602860","observation_id":"0520e4b8-2b95-49be-bc5d-68c3f11b8e40","resolution":{"observed_at":"2026-08-15T20:21:40.496919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.501709Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.501709Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:03d674e1964256a59b6d50fbe5816423e1fb8e623f32f1414ab7ee0e75d10aeb","observation_id":"1a33699d-6603-444a-bd60-73df5d3a53f2","resolution":{"observed_at":"2026-08-15T20:21:40.501709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.193118Z","title":"hello-gpt-4o, 2024","venue":null,"work_id":"54480d6e-dd8c-49ca-bf03-caa4d0f06d90","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.506425Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:345880589527c4dc1aaf7ea6c5cb4b57b34bb4135e839f324633d54f287b2f0c","observation_id":"fa0cbb04-9ab0-4d0b-8e6c-9f2ed2d4b218","resolution":{"observed_at":"2026-08-15T20:21:41.197712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-08-13T22:17:36.984752Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-15T20:21:40.510952Z","title":"Benchmarking agentic llm and vlm reasoning on games.arXiv preprint arXiv:2411.13543, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.510952Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:dbf01be592711aef2c896e6fb4fabe6c0abf4c8bb1d5f314afbc5ef6cc8f15a0","observation_id":"4bb05e01-a1b2-4078-8281-07f3f2c907c3","resolution":{"observed_at":"2026-08-15T20:21:40.510952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.177448Z","title":"Generative agents: Interactive simulacra of human behavior","venue":null,"work_id":"61b86ce2-ae5d-4a5f-bc85-96329b025132","year":2023},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.516003Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:d9fb19c477ad88779b2669590850d22647b21dcab1ed33d9ab30206d6bee59f1","observation_id":"937eff5f-c397-41e7-9755-fe62a921f8a5","resolution":{"observed_at":"2026-08-15T20:21:41.182835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.520512Z","title":"Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.520512Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:f1c242a2145b64fcaa81d649ff8598bce8b16835b3a2b1cf769f78fad7c3ba17","observation_id":"8360e5ef-6d8b-4245-9f09-f53d9aac24f2","resolution":{"observed_at":"2026-08-15T20:21:40.520512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.525076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.525076Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:c86414a1ae405a87b0cc6e34189fab6e07e77c59c70bc2172b7d2e13ff32168d","observation_id":"feeea2f0-153e-4c9d-9859-c3dff08eeac0","resolution":{"observed_at":"2026-08-15T20:21:40.525076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-15T20:21:40.529437Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.529437Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:a6189ff897172f57356d21befd1d8d741ad572a4ea581a2f9de91dabaceaef81","observation_id":"aed021ba-1089-49ad-b927-6d7003827db8","resolution":{"observed_at":"2026-08-15T20:21:40.529437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-15T20:21:40.533997Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.533997Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:68f444a5601d416a81b4a1c8874e60449a99cbd208a6ccf46db760d0424358fc","observation_id":"37e6be08-a1fd-43a2-b726-7067a8694a7d","resolution":{"observed_at":"2026-08-15T20:21:40.533997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.538357Z","title":"Maddison, Arthur Guez, L","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.538357Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:627198b5879757c28079483d674dbb7c363232ad26c124ff12e5404b07455d48","observation_id":"e0eaf1a4-9c0b-49a7-88a5-79cf97e50fc1","resolution":{"observed_at":"2026-08-15T20:21:40.538357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.543185Z","title":"Mastering the game of go with deep neural networks and tree search.nature, 529(7587):484–489, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.543185Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:9cae84510fbfb0aee5c7c178492b6c29360f266c1f4609b13ae7b9a7aa2b4102","observation_id":"5a6cad25-9eab-41cf-82e2-5771c660ffbb","resolution":{"observed_at":"2026-08-15T20:21:40.543185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03186","last_updated":"2024-07-02T17:23:13Z","snapshot_observed_at":"2026-08-13T04:02:49.444355Z","submitted_at":"2024-03-05T18:22:29Z","title":"Cradle: Empowering Foundation Agents Towards General Computer Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03186","snapshot_observed_at":"2026-08-15T20:21:40.547708Z","title":"Cradle: Empowering foundation agents towards general computer control.arXiv preprint arXiv:2403.03186, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.547708Z"},"links":{"cited_paper":"/paper/2403.03186","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:8b77662c8e9b89e10f530bd9869aaf66f86542c0978bf8dfd0e59475cb1180a0","observation_id":"e768e2fc-e5e3-4485-bdd2-97e99ee52e0d","resolution":{"observed_at":"2026-08-15T20:21:40.547708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.117333Z","title":null,"venue":null,"work_id":"0c78274b-8aeb-40c7-9a38-b8bfb1f6da6b","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.552327Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:c4ec180639d8cc8b6c22dbbe00d783ac3356cce16744198f1faeebe502a9ad71","observation_id":"75fc430f-ef66-4d7d-bd53-b8427f8ad369","resolution":{"observed_at":"2026-08-15T20:21:41.122308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:21:40.556940Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.556940Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:1bdc1f83016b0351ddc7641470972a042f2e14d1eaf05ad569915a4aa277bb19","observation_id":"4082641c-36e1-4276-ada1-bc9f938798ce","resolution":{"observed_at":"2026-08-15T20:21:40.556940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.561840Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.561840Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:eab3bf672f78f9e8626a61df6816a3263092b28780a96ebd9f8c1f4719bb44c1","observation_id":"33a03cbd-d4af-4138-b4a4-741a8feb7f18","resolution":{"observed_at":"2026-08-15T20:21:40.561840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.093216Z","title":null,"venue":null,"work_id":"19c43730-a686-4844-83c7-b64f115d3dcb","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.566256Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:a89145622a884179586709429a39d5aa2836461c19cef8b6821bb8f2823b1123","observation_id":"5c4bc011-e5b3-4f25-bb36-774bc6d6d5e7","resolution":{"observed_at":"2026-08-15T20:21:41.097633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02868","last_updated":"2025-03-28T22:28:31Z","snapshot_observed_at":"2026-08-15T05:02:48.282444Z","submitted_at":"2023-04-06T05:01:28Z","title":"Can Large Language Models Play Text Games Well? Current State-of-the-Art and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02868","snapshot_observed_at":"2026-08-15T20:21:40.570782Z","title":"Can large language models play text games well? current state-of-the-art and open questions.arXiv preprint arXiv:2304.02868, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.570782Z"},"links":{"cited_paper":"/paper/2304.02868","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:f4f773a5d4a536eb654ea15c8e0df7649d45d9f744cbd53672437a8a4db0e4c6","observation_id":"31b151e0-0773-48b5-b0e1-ef04023fb839","resolution":{"observed_at":"2026-08-15T20:21:40.570782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.575106Z","title":"Are large vision language models good game players?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.575106Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:54c03782311bc1ac19be15604cf9b4890ab1186b3e5d0200920b4ff6cfe11130","observation_id":"5389e299-c36a-421e-b639-b6871230a2fa","resolution":{"observed_at":"2026-08-15T20:21:40.575106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02358","last_updated":"2025-03-04T07:29:03Z","snapshot_observed_at":"2026-08-10T06:50:52.677734Z","submitted_at":"2025-03-04T07:29:03Z","title":"Are Large Vision Language Models Good Game Players?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02358","snapshot_observed_at":"2026-08-15T20:21:40.579494Z","title":"Are large vision language models good game players?arXiv preprint arXiv:2503.02358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.579494Z"},"links":{"cited_paper":"/paper/2503.02358","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:12870a55f52701d0d8378c7d1c123277f853a58b5d2761f15cb4685ffe538e39","observation_id":"7a376b86-59df-4aeb-b987-b5ce65fecef5","resolution":{"observed_at":"2026-08-15T20:21:40.579494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-15T20:21:40.584123Z","title":"Describe, explain, plan and select: Interactive planning with large language models enables open-world multi-task agents.arXiv preprint arXiv:2302.01560, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.584123Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:231a8f662eec78452b63bbb4e61b6978319efbe13acaf96e2be66b18f2ab1318","observation_id":"e8c5e5f7-f051-476a-84ad-7f46718e2760","resolution":{"observed_at":"2026-08-15T20:21:40.584123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.068697Z","title":"Waytowich, Devin White, MD Sunbeam, and Vinicius G","venue":null,"work_id":"2df404e7-6689-4066-bb97-bb9a274e9dcd","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.588424Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:b7a8ceb918e837d2d1780ef620dfce73ab8dbcca93e307366b92001980c34948","observation_id":"88cd7c0a-e4be-42db-8f9b-9298ab9bb032","resolution":{"observed_at":"2026-08-15T20:21:41.073150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01557","last_updated":"2024-03-17T23:23:31Z","snapshot_observed_at":"2026-08-13T05:58:59.275924Z","submitted_at":"2023-10-02T18:52:11Z","title":"SmartPlay: A Benchmark for LLMs as Intelligent Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01557","snapshot_observed_at":"2026-08-15T20:21:40.592511Z","title":"Smartplay: A benchmark for llms as intelligent agents.arXiv preprint arXiv:2310.01557, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.592511Z"},"links":{"cited_paper":"/paper/2310.01557","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:652ef6b51757f1ee104e1ff9160d06fca9d16b2f2d7e413f3bbc4921970cfb83","observation_id":"3c5628f0-b510-41b6-afb7-d5133c637cf5","resolution":{"observed_at":"2026-08-15T20:21:40.592511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-15T20:21:40.596690Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.596690Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:787921cb914fe2c1ac40e473c4dc45b20fc03e29941eeaecb9164e0ce06f5c80","observation_id":"49c54ada-c4b2-4a80-bd78-2547dfcf2463","resolution":{"observed_at":"2026-08-15T20:21:40.596690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.054663Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning","venue":null,"work_id":"fe8db7f4-45af-4dba-bb0d-b85b92728b44","year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.601099Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:aed4cb38d798bfeed1fc029ca24c94baee4a03d6f9db87a669e87d81d09f1207","observation_id":"4f129bf9-27fd-4024-8774-5aec1655a0ac","resolution":{"observed_at":"2026-08-15T20:21:41.059318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.039899Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":"892967fe-e151-439d-a1bf-e58d98d0b7dd","year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.605736Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:a9d00db449f1829cbd638e58f05eb796eec4107e2067bb9b7618318fd8aebf86","observation_id":"30b7371c-8f7b-4be9-ba6d-6c5884c4719a","resolution":{"observed_at":"2026-08-15T20:21:41.044872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.610285Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.610285Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:302ac81536a7a7bbbb062d076e66245bf35f603b5ac60c5fac060d8209c91b25","observation_id":"16eff4c8-22ad-4de0-b4b0-9a1c1f59bb4d","resolution":{"observed_at":"2026-08-15T20:21:40.610285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:41.012815Z","title":"aha moment","venue":null,"work_id":"87da6617-d342-4467-b5d8-3f845d09f99f","year":2025},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.615135Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:64a2d583aa9a86f4da90c9dc654f7f27de17953773d31fe1e55f8049428377c7","observation_id":"192e4191-6ac2-43c1-8814-1fbb634907e1","resolution":{"observed_at":"2026-08-15T20:21:41.019518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.980857Z","title":"Output Format Description First describe the board in <perception></perception>","venue":null,"work_id":"5fb83526-9a4b-4272-a995-8d71fecd8b4c","year":null},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.624234Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:a1d85d0f399ba77dc76e92ce80371c1a24cc68bb24810df8267b0f13754d15e2","observation_id":"742fffcb-b53a-4d78-9b03-812468680c52","resolution":{"observed_at":"2026-08-15T20:21:40.986156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.965740Z","title":"(row1,col1) (row2,col2)","venue":null,"work_id":"7531f17a-ceb5-4162-93ca-caf331f6c6e4","year":null},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.632844Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:6740ab277398f28de349c4cd56e7c3b505fdd599d53d506222d1818729649314","observation_id":"5946c486-f3bb-4bcd-8867-09cd084c5fa0","resolution":{"observed_at":"2026-08-15T20:21:40.970513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.996388Z","title":null,"venue":null,"work_id":"44e67fc8-acfe-4ecf-9efd-681d03122db2","year":null},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.637255Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:54422694e8f60ac16a898fd69923fd192e242930c93475a4f87177a70237b8a2","observation_id":"af7af115-aad6-4ed2-9647-c2359f32d881","resolution":{"observed_at":"2026-08-15T20:21:41.001590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:40.948369Z","title":"Output Format Description First describe the board in <perception></perception>","venue":null,"work_id":"13fd762c-5177-4364-9f10-957dad337269","year":null},"citing_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:40.641794Z"},"links":{"citing_paper":"/paper/2505.13426"},"observation_digest":"sha256:e9569920bdc1a41591ed1bd6463638259d3eb205b24d4f39bae5cdb29e336dfd","observation_id":"ce5ad0eb-10e1-4d55-855b-a909c6ce8a03","resolution":{"observed_at":"2026-08-15T20:21:40.955184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:11:34.287802Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 12 inbound Pith citation observations for arXiv:2505.13426."}