{"as_of":"2026-08-09T20:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc05bd65a391c5d451348b2ed2fc0b3369eacd22bc851f62d9a37eeb406e54bb","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:16:51.452335Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29915/citation-record","integrity":"/paper/2606.29915/integrity","json":"/paper/2606.29915/citation-record.json","paper":"/paper/2606.29915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Don’t just assume; look and answer: Overcoming priors for visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:524acdf3944b40629b7ba747f1b11cc68db7ae21e48ff88bc99bd0ba3ce8f273","observation_id":"02b8d00c-4f93-4420-83ac-e36dd654eddb","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:245e0c6def7ff54d1effb45dcf08501655a4f3759c8eb419d3c10766022dd0fa","observation_id":"f2005225-0a92-4941-b183-d69a499f2df9","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:c7368524b5cd6c47aa945dc49f91f974aed62f008892dfdfce41b5ae04c9e04a","observation_id":"ee40dcdc-5370-4c95-a3d8-967bd50e467a","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:9c14655efb09d9e5c77a6aee9355365ab6ee9020e04100039ba99e7000b6772c","observation_id":"304897c1-bffe-4823-93be-ce55427eff1c","resolution":{"observed_at":"2026-06-30T07:14:22.073999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:44b156a83657d54a9859f17a83d8a5dde4220ab92e9e2ec002996aa1afd78a2b","observation_id":"d7f7db7e-3c3f-49a4-9b6e-ff5569249d74","resolution":{"observed_at":"2026-06-30T06:24:19.583033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Are we on the right way for evaluating large vision-language models?Advances in Neural Information Processing Systems, 37:27056–27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:d3a6ce3ddf8eeaa46f3925e62754e9581baa7e09a3488bed60278b517aa46c53","observation_id":"27fd4ac7-7e01-4009-a5d2-eb51a41c2ce3","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Beyond question-based biases: Assessing multimodal shortcut learning in visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7e5627e66ea17cb241e7ee47ec6ebc62df600371ce631aff28f997d5034c68ab","observation_id":"381137bd-9993-4a30-837d-a17fd62a0a69","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Gemini 3 flash: High-efficiency agentic multimodal understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:5485ffe3f3fbad0894aef2e1ffc676823dc250e5b4756252096eeeff9da03abf","observation_id":"567c85f0-f740-458e-9cdb-ab0859677745","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:651bd9d77d644066b05578fe705de4297da2286a2eb2c9c1798addc46e8674f2","observation_id":"681706ef-c37d-430e-a621-b8633a67aebd","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:3d41ff12dab8ee9ee1d109cec2f095923f83847d3075b08bcc836d9afc92861d","observation_id":"a41934e7-2ede-4f66-a00b-f76a93870f80","resolution":{"observed_at":"2026-06-30T07:14:22.071060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:991d451c4b46448dff81d78f65c19d04e247f2965d77e355246302628190d8f3","observation_id":"9cb8e320-72d3-4e2f-9a86-0ee4dd2e9462","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:6ce8360cc0cb62dbbe1fae6602920e1da9b6d4cb19c4ac5b205f4b6b71b35806","observation_id":"a8a852af-ba1f-4046-b480-da8f5a67508c","resolution":{"observed_at":"2026-06-30T06:24:19.584388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Raven progressive matrices","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:3e71be8e1fca57dd34d1610bdf1f98c8fdafada950005c1afe7683c82cb0b687","observation_id":"cee35312-3f35-48a6-b8d7-35a4c954a5f3","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:41bf1619b96a8c54ab024a7c30c774608d0d00537c717a436c594b6ea16be218","observation_id":"77debea3-3348-4396-bc2c-d0d78d85c398","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:46116d50b8c43980be7e46591faf14d0f75a38d09054641d2d5d0e8e13b817e1","observation_id":"bc695b8e-3edf-47f5-b018-e49f0a68ec03","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Imore: Implicit program-guided reasoning for human motion q&a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:d5fa61bcd6ddc5dfd5fdefe32e380a61aa56c003617f76be667c865cc91280ad","observation_id":"c59b158b-a7c3-4a51-b698-9e6950b63d02","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vision-sr1: Self-rewarding vision-language model via reasoning decomposition and multi-reward policy optimization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:439aac6709876abeda9dcec795583c7a928b319e7b6e077e59665e073f8ee988","observation_id":"68e336e7-f3a2-4420-ac31-b599f80d5a74","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2034},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:652693ca07129ecdf006bcb27bd43fdd4ecc40b9be50e0b9e92e7f82c7a317cc","observation_id":"fccf2cf1-8ace-4b76-a479-ee35882b6513","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in neural information processing systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:8352c66c27a69cf5471e48d6112934071eb97047401be5124260a97e375838dd","observation_id":"ca8cded6-2d71-4a6c-8461-950e1b81a47f","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:191458a40db58f3f5fb9eb24aa97f8a8919d5175a4a96984c30ba66c93d3b1dc","observation_id":"9bfd8663-6812-4d8c-a8e8-ff796bca7233","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"A computational investigation into the human representation and processing of visual information.WH San Francisco: Freeman and Company, San Francisco, 1(1):4, 1982","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:25244fdd6c3e908190bb818a961ff38435312f3dc947d18eb81bd0df5e1c7c0f","observation_id":"08a5f508-d2ce-4c02-bce3-ef8ce740177d","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":"2504.05299","doi":"10.18653/v1/2025.acl-long.718","metadata_source":"pith","pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLM: Redefining small and efficient multimodal models","venue":"cs.AI","work_id":"810cc87f-f6bd-4443-9673-5e30982426b9","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7d041e725fc9b059949c6c7ef397dbdf14a3e2202daf832511cbc65a6f724a6c","observation_id":"33942dd2-30ed-426a-acdc-5777d7bab885","resolution":{"observed_at":"2026-06-30T06:24:19.588487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:6937750b80ff9d515968cc35457dc6cbe896793ac61c4f0cea6d056b9ee92c3f","observation_id":"1f35ee56-26f9-4737-8384-360dc2ed56b0","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Pkr-qa: A benchmark for procedural knowledge reasoning with knowledge module learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f9ccc579b46ba1627f41aff8d1a01ac93442fc220de5b62326e64900cc456d11","observation_id":"59f4b493-5f3e-45a1-9c08-676339e7dbae","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:c168fe171d2fe2b789719451520053a36694114ef845e5cbdad028da732e762d","observation_id":"bf751ef3-1174-4d11-b2c2-3d524abe4764","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f0559fa5c4ef233fdbe410afd150b4980248c6f6c1eb506bb8b1148a6c0559c7","observation_id":"ccbc4a4e-de5e-42a3-a945-99785e6dda8b","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08889","last_updated":"2024-06-07T05:45:02Z","snapshot_observed_at":"2026-08-02T21:49:10.577943Z","submitted_at":"2023-06-15T06:45:46Z","title":"Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion","version":3},"cited_work":{"arxiv_id":"2306.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.08889","snapshot_observed_at":"2026-06-30T06:24:19.584161Z","title":"Dissecting multimodality in videoqa transformer models by impairing modality fusion.arXiv preprint arXiv:2306.08889, 2023","venue":null,"work_id":"af6ca6bc-1e89-434e-afe6-bb3ef37b94f1","year":2023},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2306.08889","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:73f411313b6244b5a6f47de116b986b0764a6a7dc15b3f3c49b1f60d94a95e1b","observation_id":"5e974d39-0d41-4161-a197-8def928049a4","resolution":{"observed_at":"2026-06-30T06:24:19.585935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:0fd55058bcced02e7ff96ef0a90a51c0f56bf12265072c0dda9ac4606cd8d323","observation_id":"96d199c0-0ddf-41ce-be50-f39ca01f802b","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:1aefc05529e939a6041865941d2cdf14f77db6b624818eb5c93296cebd3d5953","observation_id":"b6c63f4b-5c70-4a23-962e-6d5d7467de5c","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Grounded reinforcement learning for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:17d2accd02e6ae15badcd8ff1838b1d33df41ab329f26baf2ef09d0b23da217b","observation_id":"c8ad17e8-4c85-44a1-bf44-cc49afe30d08","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:472153680c36d6ea7167f80ab2f78d8e1e8aa8f29c8e5f132dc55966c1636272","observation_id":"324d5f17-1452-403d-810d-b9ed2a1b16ee","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:bc959030206063b68868a7d4566eee017a0495cf6367907379011e0c289ca6b2","observation_id":"1a146134-7fb7-4d46-a9fd-869d1b678983","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:78368da0595e9ba54a5650c932d62c95807e537c33339121ff3e8973ca899ef4","observation_id":"ee428d28-21d9-4781-98d6-00f5aed48bb6","resolution":{"observed_at":"2026-06-30T06:24:19.577448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv e-prints, pages arXiv–2504, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:127da6523ddfcf9381c16a8aa4f3d8531085beaa8f4928bf72faafbcf47b3e50","observation_id":"beb3ca3b-32e5-4dfb-9342-9ab25c3dc33e","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Language prior is not the only shortcut: A benchmark for shortcut learning in VQA","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:1eb0e787f0bfe28752caaf9e51fa7e493cb07d11cf927d97fec4b1f546cf2bbc","observation_id":"3817647c-3a84-414f-ad02-75b509cb8a2b","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:c0dbe90bc42a87030c6912556fd39213f9704653b10f81a47bd5e26c6ad8d162","observation_id":"f8492fe8-ccf3-4c5d-babe-8f2ea424a8b6","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:0a27b774232e6f5e5711df90186d5da4c0675b5fccfc0933534d7545887030e6","observation_id":"8edf08a1-565c-4f43-8536-fbd4300c7b4f","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning of vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:84f64954220825ecb2363ebfe8dba1748987f2bada64b5aa6d681cb4906650b3","observation_id":"c6c2f491-059a-47b0-bc86-75c48693c019","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:927e7f16f56572be9731b32563627c30163447b98b3333bf1a4d84bfc7684079","observation_id":"df0e8031-8d0b-4862-becf-f94c559ca7b0","resolution":{"observed_at":"2026-06-30T06:24:19.592194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:28212c5b8181186f3c8d8d40fa2fdeb3b4a56517d770a882a8f3a5204e69b6b1","observation_id":"d76f3881-784c-40ee-96e9-31edee27a189","resolution":{"observed_at":"2026-06-30T06:24:19.581646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:65b02c257b327a9fe57dddfbccd4c792cae68e40b54dd052b27e450cb1608d1c","observation_id":"4ef73406-d8cf-452a-bf48-4a59a9975570","resolution":{"observed_at":"2026-06-30T06:24:19.590819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:36090e81c82a6d2e72c6819ae2237aa1dbbbba1c4e8f9383fa2a0e9b4560b9e9","observation_id":"9f84fce8-0f5a-44ee-a14e-82980fd649b9","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Procedures as a representation for data in a computer program for understanding natural language","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7724875618eeb98999bbf6a3a45b3990f98de1f9518c13402976138de91764b7","observation_id":"d1bc2cc3-8b94-4cda-897f-1267bc9e62b6","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Learning structural descriptions from examples","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:26f38e6985e42fd25665823076436cf4a80677ec2b22e5d7e2c2578950e58371","observation_id":"a06c8446-a93e-497e-abd8-c75bdbe0a6fa","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:3bc8181543958e43cb97664ecc89a7e47b51994ee5e53ae262aa785cf6bb62c8","observation_id":"a4642844-0455-4f73-8e94-04cae7b4956a","resolution":{"observed_at":"2026-06-30T06:24:19.569669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Realworldqa: A benchmark for real-world spatial understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f53c4874a088cc261c0efef9678c482fb87216c7ac721f7fda5174429f4954d6","observation_id":"5ea1c24a-e558-4ac0-877b-e6af5a798835","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f7d952060d44e3b1c8a9a21865c2c1c023ad9de87f8ac557fd0a5116ee3b9ae8","observation_id":"40a64413-d951-4af7-bb72-51832351807d","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Neural- symbolic vqa: Disentangling reasoning from vision and language understanding.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7e8bc2bbaf6ef64bb54605441cfbe4d5036a571efdac23a89c58b2e600a906d3","observation_id":"ad88ec18-9174-4c7f-abe2-bb20bd58f2d1","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:1ed7400871ff90c8ce62ae471f164e06be06b258b5153d2fcdfac82ed5493ae5","observation_id":"deaf51d4-4060-4d61-b0d3-0f4199430f68","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:d5889c425a316d130b8581a42511a95c77be4b25b402d6c682ad07cbf46ad231","observation_id":"2fa4283e-d302-4393-83fb-ed25a5e22a12","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Raven: A dataset for relational and analogical visual reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:be8c02239908110756ede8c831c18b50d53066594774d2f2e19d51d3aa45b5fb","observation_id":"25ac8f50-9b0e-4b04-aeef-587f5588266e","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13428","last_updated":"2025-08-19T01:03:45Z","snapshot_observed_at":"2026-08-09T05:39:18.806792Z","submitted_at":"2025-08-19T01:03:45Z","title":"Mitigating Easy Option Bias in Multiple-Choice Question Answering","version":1},"cited_work":{"arxiv_id":"2508.13428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13428","snapshot_observed_at":"2026-06-30T06:24:19.586131Z","title":"Mitigating easy option bias in multiple-choice question answering.arXiv preprint arXiv:2508.13428, 2025","venue":null,"work_id":"4685584f-fed6-4dc5-99c5-797341c4f7ba","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2508.13428","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f860240bacf961d7891114cf469379c7c133337ba8d01743a4e48d3cb2cd9356","observation_id":"5d838940-73f2-49c8-87ed-0113bd0f5b32","resolution":{"observed_at":"2026-06-30T06:24:19.587769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:69b0ea6fd8f92e270342aa566d0aca34668dc923429f24a78d4cb4e1a1ff1250","observation_id":"00e4f341-87a6-4d92-97a7-6bf27303ca4a","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Physreason: A comprehensive benchmark towards physics-based reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:50a7d5e2a7835b2c9d7b73c6913b71e0696072716e72bea411f28aad77adae5b","observation_id":"1df64fe7-114f-4e9d-97c2-1dd1c9a1d1e2","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Multimodal chain-of-thought reasoning in language models.Transactions on Machine Learning Research, 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:a9bf9f1ae9894c277402438a436cf6ee1ad4baa7008d2928a523f78dfee33ac4","observation_id":"87f9e699-cdf2-4b17-80b9-ca1a51bfb1f1","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:82539a9a0efdbc3b24ff538f022c0df8421e91a9ff210e5adc97460c4b9190c9","observation_id":"cb99c87c-ba04-4766-b386-b18c03a4e5dc","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:22:26.835541Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2606.29915."}