{"as_of":"2026-08-10T00:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:deb65d2ef72b6cfacde30526231003cebcc0cab05382e1f6f68e3aad045c0cfb","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:39.624185Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:24:12.349405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:41:27.623339Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2506.14907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14907","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perl: Permutation-enhanced reinforcement learning for interleaved vision-language reasoning","venue":null,"work_id":"6ed035ce-1053-4717-8ca6-1ecc2365d0a3","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2506.14907","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:203c049639ae600c2d6a462d360639333826a5d92cd555a8e9825465a9265672","observation_id":"b6ea3834-aab7-4c19-9a34-08b612d1218e","resolution":{"observed_at":"2026-05-12T07:41:27.635779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14907/citation-record","integrity":"/paper/2506.14907/integrity","json":"/paper/2506.14907/citation-record.json","paper":"/paper/2506.14907"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.829650Z","title":null,"venue":null,"work_id":"4e78f1ef-1e45-4176-bd56-ed5bc3114f73","year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:31.914954Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:db157519a3f96b8d42517971965051a3eb2794c36719321df01a664b23758e6c","observation_id":"7092c52b-5bca-473c-9826-8149a8b766be","resolution":{"observed_at":"2026-08-07T00:13:41.901593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T00:13:32.009011Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.009011Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:df31384dcd1427a1bc187fb2d5da5a1d212fe2323d960b4f133cc34da027eec1","observation_id":"a6445511-1020-4d41-bf05-90d35ac66653","resolution":{"observed_at":"2026-08-07T00:13:32.009011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:32.220329Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.220329Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:ae95d9a7ebd72c571146d15ee66f53b715173b80f23c2364156981a6407ef90d","observation_id":"9a406960-5b41-49e5-ab7d-faf1c48482fa","resolution":{"observed_at":"2026-08-07T00:13:32.220329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T00:13:32.352115Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.352115Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:a983c37e9d7bc13422de52ac26f4c9d3e5dc999915fafd2e26d9ec9306ac8a7b","observation_id":"99ab7755-a867-4a3f-a010-852e7f934c84","resolution":{"observed_at":"2026-08-07T00:13:32.352115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:13:32.538218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.538218Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:17844a6eca6fbed61bff2452356c07bd1073c74ef4c2c26580ba33719a8d92d8","observation_id":"edb2f5a2-d2e2-418c-9825-522082cb27e5","resolution":{"observed_at":"2026-08-07T00:13:32.538218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:32.756391Z","title":"R1-v: Reinforcing super generaliza- tion ability in vision-language models with less than $3.https://github.com/Deep-Agent/ R1-V, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.756391Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0d090dd2aabed2cd90553c8b44833053b9eba156a119a1fb44705c556bff9bab","observation_id":"28e8f5b2-f541-40ab-bddc-7ac53985a7e9","resolution":{"observed_at":"2026-08-07T00:13:32.756391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:13:32.948421Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.948421Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:2053af3e3ae7947d1a5a9484ff10351f7504183399ee3e1350c2ea365389ae9f","observation_id":"184742c6-bfff-4dff-b576-0814a270fcff","resolution":{"observed_at":"2026-08-07T00:13:32.948421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.133533Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.133533Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:9709b33cac6d2482143fd4be9ba6d32a624e23a88e1ab5533465af8eb9c8ffc5","observation_id":"9654d880-b9d4-40cc-9421-ba067ee95d51","resolution":{"observed_at":"2026-08-07T00:13:33.133533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.262709Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.262709Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:7c2cb4f0535960fccb066f858fdf0327213998c604c09e3c8b7ce27041d0af91","observation_id":"81d95e07-7c81-4516-aee5-534b3670bf48","resolution":{"observed_at":"2026-08-07T00:13:33.262709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T00:13:33.384064Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.384064Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:99dc0403661464e88e05b701cef5e241412f93c2ade8f507f8e6746ea949352b","observation_id":"2e8e6fc8-a836-430b-a708-30f8d4e9fa8c","resolution":{"observed_at":"2026-08-07T00:13:33.384064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.524376Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.524376Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:05353942ae0894461b80c8f7840a9d3229e33f69886b3d16050489599fa7c3fd","observation_id":"f041fc3e-2fd4-49b4-ac1e-f3b8011fc45b","resolution":{"observed_at":"2026-08-07T00:13:33.524376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.648674Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.648674Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:84799f2604508542f2151a1d80edeb987a0c95d75a2c2cca3b00e09e7a831ed4","observation_id":"1433762e-0e14-48f1-9b58-26362d305067","resolution":{"observed_at":"2026-08-07T00:13:33.648674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:13:33.821384Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.821384Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:437f3ea9a182f6ebab188e7af6f776a0c110eaf5974a09437958854f158e8665","observation_id":"de473be6-df96-4f94-8e09-42e1161ac5ac","resolution":{"observed_at":"2026-08-07T00:13:33.821384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T00:13:33.957683Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.957683Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:95a491392b2ac913b807e52cb07002994204390020af75de7c0ba9361a8f3e2e","observation_id":"7ba9abc4-c2b4-418a-97f2-d52f1800de0d","resolution":{"observed_at":"2026-08-07T00:13:33.957683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T00:13:34.087876Z","title":"Mantis: Interleaved multi-image instruction tuning.arXiv preprint arXiv:2405.01483, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.087876Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:3320081bde3917d46d33fb69ea6748f91afbeb7b34063ca4cc582772fd13609a","observation_id":"478156f5-7241-4773-a1a2-e247ff7c9487","resolution":{"observed_at":"2026-08-07T00:13:34.087876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.601772Z","title":"Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024","venue":null,"work_id":"d7d6d656-4773-4553-92d1-d804319f38d2","year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.221237Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:e2f48e35c3ba80be349d9cba8bb9c51fb5a9e6c1dd08605163f2c63d02029df3","observation_id":"ec0b58ea-ebb6-455b-8d00-5f57b13f99a5","resolution":{"observed_at":"2026-08-07T00:13:41.668514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T00:13:34.402388Z","title":"Mimic-it: Multi-modal in-context instruction tuning.arXiv preprint arXiv:2306.05425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.402388Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b0f5ed833f614fcc919eae9646edc360b8875500aa721560310cc1f30df3d68b","observation_id":"1e62c27f-6b19-485b-bdc4-9715a2074995","resolution":{"observed_at":"2026-08-07T00:13:34.402388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:13:34.565255Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.565255Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:39ce850630fc7c98da3ab4a50aa494d5462a0bfd25ebc3faee8573eebe1d85fc","observation_id":"e53a2749-ad2a-4335-a6f2-d026a31666f3","resolution":{"observed_at":"2026-08-07T00:13:34.565255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T00:13:34.729605Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.729605Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0cd30a6bad2b65101e8c502cb68646f46cb57b159577e8815d2f1d72d1ea7733","observation_id":"aa1eb206-ca7b-4363-b8fd-77b9c0e6ef69","resolution":{"observed_at":"2026-08-07T00:13:34.729605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-07T00:13:34.937970Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.937970Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b027581af43d0c246b9630ebb2ef7c6686165f425bbc7f4c061df1802cbd22c7","observation_id":"2274912a-62dd-498c-9c8a-40ea3cd393f8","resolution":{"observed_at":"2026-08-07T00:13:34.937970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T00:13:35.115254Z","title":"From system 1 to system 2: A survey of reasoning large language models.arXiv preprint arXiv:2502.17419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.115254Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:fc6a23869fd6323ddfa6954a6f6579e6901c85228d59c30696c4728315e11c3a","observation_id":"8e90f3af-d9cf-4891-82ab-e32038325b4b","resolution":{"observed_at":"2026-08-07T00:13:35.115254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:35.298768Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.298768Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:8b84886d8792791663be2f1fc9bc610c364bf4b9d75f601d3fdf95453e6c324d","observation_id":"6a1a9c86-15d6-4581-8f42-f0c60376f761","resolution":{"observed_at":"2026-08-07T00:13:35.298768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:35.442727Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.442727Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:1c670504cef810f6cf8958e96f0e70d65d6894572ae53da1403073f44461b17a","observation_id":"c824f2f8-60bc-48b9-b6c8-08237dc06a80","resolution":{"observed_at":"2026-08-07T00:13:35.442727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T00:13:35.595022Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.595022Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:e2661959233a9d485a54fe1bc14866e261c7739a2de68b374e531715b7754942","observation_id":"d4ca0f18-ef2c-4ad0-934b-34a7904cc1df","resolution":{"observed_at":"2026-08-07T00:13:35.595022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T00:13:35.700936Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.700936Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c30dc6f7b9d114731bba8d4203a1d48d4d16a358dc65e734472ed6dc584ad236","observation_id":"2ff7774c-4b31-439e-9014-b250ba33e0d9","resolution":{"observed_at":"2026-08-07T00:13:35.700936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T00:13:35.879349Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.879349Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b54353974526437581b0f1e1ed41220cb40602785a59e5bb62f0550c6931c3b9","observation_id":"7e8f4daf-9202-42bd-bce7-898792bd8cbc","resolution":{"observed_at":"2026-08-07T00:13:35.879349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-07T00:13:36.034767Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.034767Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:3311aa99fb89e1c74544623701169745cf1f744632b0e53f83680f4417d2522a","observation_id":"bdadbe14-78f8-4313-9062-86a97b7c5f15","resolution":{"observed_at":"2026-08-07T00:13:36.034767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:36.207581Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.207581Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:f5b8a8757f717aa051fd6f8a4ab6781258ee2646e0e2883db0cecdca0baca2af","observation_id":"d624d141-7b69-4ce4-92d1-14900e371b1d","resolution":{"observed_at":"2026-08-07T00:13:36.207581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T00:13:36.315527Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl.arXiv preprint arXiv:2503.07536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.315527Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:83da91c4ab253f0a30775336ed62165d679858e56105e04a37285dd3077a83c8","observation_id":"b003eea8-f02f-44ca-b787-9f27e783d4f9","resolution":{"observed_at":"2026-08-07T00:13:36.315527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:13:36.455699Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.455699Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:e8cb510f1fd742878c7b945ac86b440c2421fe398da10412f2bec7a9abc0cc6a","observation_id":"62e16628-6758-4883-802e-bb8abce82333","resolution":{"observed_at":"2026-08-07T00:13:36.455699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T00:13:36.582059Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.582059Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:12ef6a93f5a316483d8b13e6b7422a5d63bb2467e0b749ad544ce32ff3193ad5","observation_id":"90c1b662-c989-420d-b621-aa1b4ad3a9b6","resolution":{"observed_at":"2026-08-07T00:13:36.582059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T00:13:36.715006Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.715006Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:405e9fbc971ae1f3465b2db3a7ffd7007fbecefe27c9101a4364c818ca186200","observation_id":"b60d486f-3e83-4dfc-82a1-882f978f8b58","resolution":{"observed_at":"2026-08-07T00:13:36.715006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:36.849148Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.849148Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:8428a913ed5637b9d574febc080b0acd87264c0d5e50def02311e19f44edbbec","observation_id":"fbe8e408-d38e-4d83-b997-b3745f1fca6d","resolution":{"observed_at":"2026-08-07T00:13:36.849148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:36.989656Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.989656Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0a5ca1ac5960546f7b727da7d4bdfff3ea393b5a5391645c1b174a3b39c31862","observation_id":"3ce6b951-cd47-4683-884f-15b36ff612f0","resolution":{"observed_at":"2026-08-07T00:13:36.989656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:13:37.117863Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.117863Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c7dd6e2b9732165268726aafb5e04bf4a3541373835fe6f55e19a398d39c786e","observation_id":"1ab728e6-e5c3-49aa-9bf2-89d59bb4acb3","resolution":{"observed_at":"2026-08-07T00:13:37.117863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13792","last_updated":"2025-03-18T00:45:02Z","snapshot_observed_at":"2026-08-07T16:56:19.726284Z","submitted_at":"2025-03-18T00:45:02Z","title":"Identifying and Mitigating Position Bias of Multi-image Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13792","snapshot_observed_at":"2026-08-07T00:13:37.269158Z","title":"Identifying and mitigating position bias of multi-image vision-language models.arXiv preprint arXiv:2503.13792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.269158Z"},"links":{"cited_paper":"/paper/2503.13792","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0012245ad8391c374b05b6940004691305118e5ac803ed93117f7bc750df61c8","observation_id":"fd78d89e-0a1d-4c24-9d28-09fb75ad6012","resolution":{"observed_at":"2026-08-07T00:13:37.269158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-07T00:13:37.427098Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding.arXiv preprint arXiv:2406.09411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.427098Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:8c3ea43910b0c8411ca6ee2368e5ff4359e5b7f375dc568feaf8f93fc647e283","observation_id":"ba28c4ed-87bd-4f28-8a1e-0dc9d73bc252","resolution":{"observed_at":"2026-08-07T00:13:37.427098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T00:13:37.599695Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.599695Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:16b7e6d926f8a7a8e455d074542ec4d7ebe0d7e84092a2a530c7a82704722088","observation_id":"1964cd2d-2e29-4943-8abb-0bb44abc25d2","resolution":{"observed_at":"2026-08-07T00:13:37.599695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:37.725734Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.725734Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:28e5750dc939238610c7089258078132675ad8058d28eccdd0ab4d76a4a9c2ec","observation_id":"f441ceca-fd9d-4f93-be5f-703d0c7dc510","resolution":{"observed_at":"2026-08-07T00:13:37.725734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20808","last_updated":"2025-08-01T13:54:16Z","snapshot_observed_at":"2026-08-07T17:40:37.569464Z","submitted_at":"2025-02-28T07:50:36Z","title":"MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts","version":6},"cited_work":{"arxiv_id":"2502.20808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20808","snapshot_observed_at":"2026-08-07T00:13:39.856562Z","title":"MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts","venue":"cs.AI","work_id":"b9e36e90-ba20-4986-847d-f238009800e7","year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.882009Z"},"links":{"cited_paper":"/paper/2502.20808","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:aa8dc274ea770afee5c91abbc5e2f9752cb8ab4967864a9cc9695d04fceb477e","observation_id":"8d44726a-0687-4b8f-8626-30727eb0e571","resolution":{"observed_at":"2026-08-07T00:13:39.956964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:13:37.984565Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.984565Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:57427dc61219584a7cc5f2e49be439396dbca5d049d3a21391351f7e79a43347","observation_id":"1a54b7a3-06ed-4e51-9bac-347642c2cbbc","resolution":{"observed_at":"2026-08-07T00:13:37.984565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T00:13:38.129961Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.129961Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c5905b7685130bc70b3134f11c45902c638727e2271459bad503ee2db5c6e710","observation_id":"b17b943e-74b1-4da0-b8b0-fa9175c1f749","resolution":{"observed_at":"2026-08-07T00:13:38.129961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T00:13:38.298726Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.298726Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:71769e96ad774fa97e215c4facb9eb44fe4a961df4d0357e1d641f7103cf47c1","observation_id":"7a55003c-15a0-438a-849e-98e537465ebb","resolution":{"observed_at":"2026-08-07T00:13:38.298726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-10T00:19:13.518873Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T00:13:38.425045Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.425045Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:16e24574a13540fc6f20531e68b6f67650fc0c515a7018d4e9afa28763545f31","observation_id":"7dcb0f31-3bf2-4cea-bf6c-bd8fbc64ad49","resolution":{"observed_at":"2026-08-07T00:13:38.425045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T00:13:38.613601Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.613601Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c0a3c5f89df8d2f61c5cc57314c9158c306473eb1b3eaeee2bc570d983a08147","observation_id":"318971f5-3c8e-4986-9e14-17882b99da2e","resolution":{"observed_at":"2026-08-07T00:13:38.613601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T00:13:38.760957Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.760957Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0ec7c6e42c2da31c239824e8d06381c0586625f957cb5436370bc2bc023fd375","observation_id":"8660b85e-6440-41bf-bfad-4132c46f346c","resolution":{"observed_at":"2026-08-07T00:13:38.760957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20199","last_updated":"2025-04-28T19:02:18Z","snapshot_observed_at":"2026-08-09T02:44:17.320022Z","submitted_at":"2025-04-28T19:02:18Z","title":"Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20199","snapshot_observed_at":"2026-08-07T00:13:38.864735Z","title":"Weaving context across images: Improving vision-language models through focus-centric visual chains.arXiv preprint arXiv:2504.20199, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.864735Z"},"links":{"cited_paper":"/paper/2504.20199","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:e276b1261561eb67a4289f6d2df0f7efdfeaf0cb48469c994b17419d67bfe066","observation_id":"e96dd684-1d67-49e9-ade6-dc48f2146cc4","resolution":{"observed_at":"2026-08-07T00:13:38.864735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:38.951679Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.951679Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:314b868a48ad26f4d339305b59b9cc61bbbf95cf1cc4a5c707e07e91de28389a","observation_id":"04c97516-3cfc-4ad1-b5ff-7318ad84af4b","resolution":{"observed_at":"2026-08-07T00:13:38.951679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T00:13:39.058338Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.058338Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:7d3b0a71fc0380d375224fcdd09b07445da30082ed17b26995daa377e6a36646","observation_id":"d101a7d7-f6ae-4f1b-b221-7b6c73884ae8","resolution":{"observed_at":"2026-08-07T00:13:39.058338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.294909Z","title":"<image> <image> <image>","venue":null,"work_id":"ce007a1e-1e23-40e8-b4fe-c43dddb5f1f3","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.156891Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:2505438db818edccb2c25d5afefedbdc829b64333631de639ff3b71bf8aa3c36","observation_id":"71e1be06-232f-4421-a9e0-465fa8439e73","resolution":{"observed_at":"2026-08-07T00:13:41.417822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.114551Z","title":"A\", \"B\",","venue":null,"work_id":"15196cd0-91a5-4bda-8ed5-1fd56be3bdd4","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.231536Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c62768faf01c5459ec6ac430ed89aa41df240490e639f5fca6c614f0fd35c7de","observation_id":"658e9f6c-80b5-417d-ae13-dc24caa3edd0","resolution":{"observed_at":"2026-08-07T00:13:41.203753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:40.936592Z","title":"question","venue":null,"work_id":"d6b31191-5c45-4140-9e8b-0bae275218a1","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.382669Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:f67c62e4fa039afe75fcb19c2e9135fa209f30a0af46a3813587821d2054384f","observation_id":"0489e2ff-37dc-4717-83b3-87d0ffaefcc4","resolution":{"observed_at":"2026-08-07T00:13:41.009674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:40.651720Z","title":null,"venue":null,"work_id":"e54d0239-5cb5-4958-b0fa-d3e818ef64f1","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.502807Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:f91c15f8554ee1c0c1ab38c69ba1193400ac68d49a976df1f573be307f7bcb17","observation_id":"e6222173-1915-4f3d-bf24-b3597aaff662","resolution":{"observed_at":"2026-08-07T00:13:40.815528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:40.400183Z","title":"should_change","venue":null,"work_id":"cad3afe4-21ab-4440-abf7-d63689c515d6","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.624185Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:6b7367b724ecc55ee087801206aa195d53ccfa41d74746e8282cdfbc192b7cec","observation_id":"49b31685-98cd-4e34-ac50-81f53b919c9b","resolution":{"observed_at":"2026-08-07T00:13:40.469684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.14907."}