{"as_of":"2026-08-11T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ee8e8d28eeb5c21c0852bd1bbebe678b49c4667420675e6d53f7871dbbc3ed9","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:19:04.977166Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T15:11:57.228949Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:29:53.301476Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.19406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19406","snapshot_observed_at":"2026-07-04T14:29:53.301476Z","title":"arXiv preprint arXiv:2505.19406 , year=","venue":null,"work_id":"968cfea2-2af1-4b31-ba89-c69ae172c61d","year":2025},"citing_paper":{"arxiv_id":"2606.27330","last_updated":"2026-06-25T17:44:48Z","snapshot_observed_at":"2026-08-03T00:40:31.745653Z","submitted_at":"2026-06-25T17:44:48Z","title":"Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T03:51:51.827622Z"},"links":{"cited_paper":"/paper/2505.19406","citing_paper":"/paper/2606.27330"},"observation_digest":"sha256:97da49b81ccdfc063ecbdabc2d66f6ad5d9a9f7b07c533ccff734d1a6e0e2348","observation_id":"f2b08c53-5e61-4ef5-888e-dc17d57686b4","resolution":{"observed_at":"2026-07-04T14:29:53.304356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.19406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19406","snapshot_observed_at":"2026-07-04T14:29:53.301476Z","title":"arXiv preprint arXiv:2505.19406 , year=","venue":null,"work_id":"968cfea2-2af1-4b31-ba89-c69ae172c61d","year":2025},"citing_paper":{"arxiv_id":"2607.00374","last_updated":"2026-07-01T03:20:06Z","snapshot_observed_at":"2026-08-07T17:15:46.303275Z","submitted_at":"2026-07-01T03:20:06Z","title":"Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T15:11:57.228949Z"},"links":{"cited_paper":"/paper/2505.19406","citing_paper":"/paper/2607.00374"},"observation_digest":"sha256:59b45e66fabd81e5539b72e1e970108a40b6329f9f19e4f532456ecf0e9476c3","observation_id":"031bfc5f-2dd0-4126-9ef8-6cc40ce19550","resolution":{"observed_at":"2026-07-02T15:17:07.304743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19406/citation-record","integrity":"/paper/2505.19406/integrity","json":"/paper/2505.19406/citation-record.json","paper":"/paper/2505.19406"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T14:19:01.915052Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:01.915052Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:183526defd27447b35d2dd5b484102391061c8e58b4921c1afc9a61ab9c8e9d8","observation_id":"2015ac20-33ef-4a2b-983f-c547a9ca023d","resolution":{"observed_at":"2026-08-07T14:19:01.915052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-10T22:12:40.914743Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-07T14:19:02.318580Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.318580Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:66c6a447eb06bedd0f6ef8095cbeaa95a6202de8a0d38370f1a62f5800a18dc2","observation_id":"b1e26433-bd32-401a-a42f-42851105daa1","resolution":{"observed_at":"2026-08-07T14:19:02.318580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:19:02.504324Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.504324Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:823c877a040253dbfa620b0e0e58541adec61447ed701eaf08dcece3ce4f2b28","observation_id":"18acaf29-64ab-4962-bfb0-4fb940ccd2e8","resolution":{"observed_at":"2026-08-07T14:19:02.504324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-10T21:11:43.711209Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:19:02.650097Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.650097Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:3c80ebafcad3aa13ce110dc2afa280697aa5c31199abd666cf15fbb50327aa2f","observation_id":"82ab3d3d-13f9-4382-8cf0-d5cfdb58dcb1","resolution":{"observed_at":"2026-08-07T14:19:02.650097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-10T17:58:02.856512Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-08-07T14:19:02.805674Z","title":"Advancing language model reasoning through reinforcement learning and inference scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.805674Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:9fbb36b16dd33845196a73b58ef1691490f55f8c5245f104962f780a1666763a","observation_id":"4e063a37-5cf6-4970-b35f-34de18d07322","resolution":{"observed_at":"2026-08-07T14:19:02.805674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23905","last_updated":"2025-06-27T14:37:02Z","snapshot_observed_at":"2026-08-10T20:34:28.442368Z","submitted_at":"2025-03-31T09:54:55Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23905","snapshot_observed_at":"2026-08-07T14:19:02.964530Z","title":"Boosting mllm reasoning with text-debiased hint-grpo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.964530Z"},"links":{"cited_paper":"/paper/2503.23905","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:8470b2b6167ee76309fcbbe63e95831a439d1014f253ede70f28d27683bc2c8c","observation_id":"bdc4a137-b272-4730-8576-cbc00ffd0c81","resolution":{"observed_at":"2026-08-07T14:19:02.964530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:19:03.067077Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.067077Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:4a97d925fa27409a228725649bf8d93c1c870162b57090d9bc0ae05e58a76f21","observation_id":"0a2542e1-2b09-4150-a480-e600b0aea9d6","resolution":{"observed_at":"2026-08-07T14:19:03.067077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-07-29T18:39:02.141391Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-07T14:19:03.201102Z","title":"Understanding the effects of rlhf on llm generalisation and diversity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.201102Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:bd7532b353254308cf7ca64e839459f72168dbbe458eb5fca66fd95361b9f109","observation_id":"c20c6894-9fcc-4cb0-a18d-f9177110cd8f","resolution":{"observed_at":"2026-08-07T14:19:03.201102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T14:19:03.442626Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.442626Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:a46e3097ff45f85417dab5f482ab0191449239fd7521b82b2dae6e8937aa314d","observation_id":"5bfc92f5-42a7-4f04-9283-7df32d795d5b","resolution":{"observed_at":"2026-08-07T14:19:03.442626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:03.584308Z","title":"Metaspatial: Reinforcing 3d spatial reasoning in vlms for the metaverse","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.584308Z"},"links":{"citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:882ca85a2a20e29a5a080c8b9c8d2141a7a2c6bea2a2bb4710f787b735c22f6d","observation_id":"a380a69c-12d4-4f35-a5f8-1577f7eb76b2","resolution":{"observed_at":"2026-08-07T14:19:03.584308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:19:03.674719Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.674719Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:5020bca38bac64864cb5b667967ef20aae52a2db1f1d05e18b54920ff9e7eb7b","observation_id":"b9799e86-71b6-418d-afac-5e6ab7f019b4","resolution":{"observed_at":"2026-08-07T14:19:03.674719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T14:19:03.823999Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.823999Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:4cf76b40cc8e65b88a34b0824ae09b715fa5b0f980f9c261c72244450f1203f0","observation_id":"6a944832-4ef3-4194-9ba9-a99067b7f3c5","resolution":{"observed_at":"2026-08-07T14:19:03.823999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:19:03.941349Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.941349Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:72aaa786d61108fcaad3d047607b2726442444f4c359d33504c45d99c0acbfd2","observation_id":"9de96a95-7ef6-4650-b085-1905bfe6dfd2","resolution":{"observed_at":"2026-08-07T14:19:03.941349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14985","last_updated":"2025-03-02T03:27:58Z","snapshot_observed_at":"2026-08-09T23:18:26.350617Z","submitted_at":"2024-07-20T21:24:40Z","title":"Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14985","snapshot_observed_at":"2026-08-07T14:19:04.095763Z","title":"Generalization vs memorization: Tracing language models’ capabilities back to pretraining data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.095763Z"},"links":{"cited_paper":"/paper/2407.14985","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:68a28d2f562194319b18ad81acaef93b6108977aed1957df7cf4ca1f06f713ff","observation_id":"2c5e2e8c-d1f1-45c9-808b-d94d2edc3773","resolution":{"observed_at":"2026-08-07T14:19:04.095763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T14:19:04.218387Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.218387Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:6a3332cf96b0e6d3af7af4e7e4f69bea201d87221043e9834a91441d5452efbd","observation_id":"05057945-d3bb-4106-8c93-394e0f6d9656","resolution":{"observed_at":"2026-08-07T14:19:04.218387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-10T19:14:48.972519Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T14:19:04.371188Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.371188Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:9b90118317ed8411d1558aa10d3694e50b20cb79e8d8c50bea2ac60f36e98121","observation_id":"47598c7c-5742-4d49-b975-a4a009bdb9c0","resolution":{"observed_at":"2026-08-07T14:19:04.371188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T14:19:04.527707Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.527707Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:3bde6067631bed4fc859b80f6b3c9bcae4d2190796832c3ddd0f762c5a33c202","observation_id":"9c7d8425-f4b5-4bbf-9fc8-2eb76722dfad","resolution":{"observed_at":"2026-08-07T14:19:04.527707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-10T11:40:54.338233Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T14:19:04.657935Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.657935Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:b8e11fc17d06ef2f6337206b81702113a6ed9102a9c79ba03cc1cd444794cd41","observation_id":"2f88aef6-8697-47bb-a8ff-b2997eefa401","resolution":{"observed_at":"2026-08-07T14:19:04.657935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06680","last_updated":"2024-10-10T14:38:37Z","snapshot_observed_at":"2026-07-06T18:12:47.499337Z","submitted_at":"2024-05-05T16:35:30Z","title":"Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06680","snapshot_observed_at":"2026-08-07T14:19:04.798512Z","title":"Exploring the compositional deficiency of large language models in mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.798512Z"},"links":{"cited_paper":"/paper/2405.06680","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:58f517f7da7c73f4586aaf5cde3f906cc9346b711899dba918970eea917807bc","observation_id":"cd2034a0-62da-402e-93e3-4bcac76dd10f","resolution":{"observed_at":"2026-08-07T14:19:04.798512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-10T19:31:41.185985Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-07T14:19:04.977166Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.977166Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:d277076a0e1db81c5b2e255114f8d6ecd6a1a01af02ff2e6b5beba08a14dd61c","observation_id":"8b14d4b8-a2bd-44ab-8590-7b87811c4b6e","resolution":{"observed_at":"2026-08-07T14:19:04.977166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T14:19:03.335586Z","title":"Liangchen Luo, Yinxiao Liu, Rosanne Liu, Samrat Phatale, Meiqi Guo, Harsh Lara, Yunxuan Li, Lei Shu, Yun Zhu, Lei Meng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:03.335586Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:17f400e17610bf2812edf4dac9663e98ae30b3a97030eac4386f773fc099dad9","observation_id":"71bf01ed-c9d8-45de-a256-2f291490d0f3","resolution":{"observed_at":"2026-08-07T14:19:03.335586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T14:19:02.165225Z","title":"Tianzhe Chu, Yuexiang Zhai, Jihan Yang, Shengbang Tong, Saining Xie, Dale Schuurmans, Quoc V Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.165225Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:08b9a57d51590163d436db01391c5cb41c72f7bcf8e46dabed0aaf4fa9176298","observation_id":"86d89c6b-f0d1-4f19-b05b-551e409a7a4b","resolution":{"observed_at":"2026-08-07T14:19:02.165225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:19:01.977150Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:01.977150Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:73630d2a0d833adfd27042a957f979b5ec6a01e7691166defe5abf90ead30889","observation_id":"f295fbe9-90b6-48b8-ad51-5d90ac34222a","resolution":{"observed_at":"2026-08-07T14:19:01.977150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 2 inbound Pith citation observations for arXiv:2505.19406."}