{"as_of":"2026-08-09T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:687df192a34125be04fe074ec1e224007c5d38de576027195acb592815467494","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:02:43.614624Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04726/citation-record","integrity":"/paper/2608.04726/integrity","json":"/paper/2608.04726/citation-record.json","paper":"/paper/2608.04726"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-06T18:02:43.554226Z","title":"InProceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 4178–4188","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.554226Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:5bf6c7c036c2671d4308c1c11e604d6d7ee543ab17dc37d91d24ac271e0fa22a","observation_id":"7a482709-b5dd-4cb3-a056-9dfd3d727272","resolution":{"observed_at":"2026-08-06T18:02:43.554226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.563621Z","title":"Li, B.; Zhang, Y.; Guo, D.; Zhang, R.; Li, F.; Zhang, H.; Zhang, K.; Zhang, P.; Li, Y.; Liu, Z.; and Li, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.563621Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:47028b696fbb6634f6f2d70cf86993c37c00636fc73544fa04114cfe82c18c09","observation_id":"db58b1e2-504e-4452-9dae-b83961accf95","resolution":{"observed_at":"2026-08-06T18:02:43.563621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.567634Z","title":"Lin, H.; Liu, Z.; Zhu, Y.; Qin, C.; Lin, J.; Shang, X.; He, C.; Zhang, W.; and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.567634Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:d261fc8a2e937adb1042f848c617f5759cc8305a4c6dda780b62c6423d5c898f","observation_id":"9133902b-5ab7-40d2-9911-fdede827cc13","resolution":{"observed_at":"2026-08-06T18:02:43.567634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.572158Z","title":"arXiv preprint arXiv:2601.21821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.572158Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:beddc773460ad494905c1959a4bc6ec0a9bb39a59117d3e79312fc9568d48559","observation_id":"073a3ff1-8751-4f9b-9003-9930983f4ffa","resolution":{"observed_at":"2026-08-06T18:02:43.572158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04802","snapshot_observed_at":"2026-08-06T18:02:43.576081Z","title":"Lu, P.; Bansal, H.; Xia, T.; Liu, J.; Li, C.; Hajishirzi, H.; Cheng, H.; Chang, K.-W.; Galley, M.; and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.576081Z"},"links":{"cited_paper":"/paper/2602.04802","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:a60296fb9aa7401c18f2c7aaccb936fffc5797f141d749ac22bf4bdb2b1904b7","observation_id":"5082ee0b-8a44-460d-9ebe-fc329006bb18","resolution":{"observed_at":"2026-08-06T18:02:43.576081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10433","last_updated":"2025-08-14T08:15:41Z","snapshot_observed_at":"2026-08-08T09:00:56.651395Z","submitted_at":"2025-08-14T08:15:41Z","title":"We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10433","snapshot_observed_at":"2026-08-06T18:02:43.584703Z","title":"Wang, K.; Pan, J.; Shi, W.; Lu, Z.; Ren, H.; Zhou, A.; Zhan, M.; and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.584703Z"},"links":{"cited_paper":"/paper/2508.10433","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:f09a089e8a107300e357e61291328a8133b4b6801caa806b8e45bc100c110ec6","observation_id":"e4571943-360e-4046-9080-7be6d136e523","resolution":{"observed_at":"2026-08-06T18:02:43.584703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-08-06T18:02:43.598214Z","title":"arXiv preprint arXiv:2507.03483","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.598214Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:d7591bc82e8fcbf727ca4f88a56538ecc7dbe6536fecf73ec72ad53d870f3082","observation_id":"182f00bc-48d2-4ba2-9971-1b52146dab92","resolution":{"observed_at":"2026-08-06T18:02:43.598214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.602554Z","title":"Zheng, C.; Liu, S.; Li, M.; Chen, X.-H.; Yu, B.; Gao, C.; Dang, K.; Liu, Y.; Men, R.; Yang, A.; Zhou, J.; and Lin, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.602554Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:83c1032b5c87ed15366ac5f8ad1e1fa40b3f4e43d8ed1e7e956c981e1d0d40ea","observation_id":"fcdee749-e364-4976-8046-a77cfebff434","resolution":{"observed_at":"2026-08-06T18:02:43.602554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-06T18:02:43.606491Z","title":"Zheng, Z.; Yang, M.; Hong, J.; Zhao, C.; Xu, G.; Yang, L.; Shen, C.; and Yu, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.606491Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:e4a3dfe0b5688cfa19f1569e639574870d81e2bebda811a8b947db91c80823a7","observation_id":"62e59df4-17db-4dd9-b4fb-0c5a31f7e731","resolution":{"observed_at":"2026-08-06T18:02:43.606491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T18:02:43.610661Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vi- sion and Pattern Recognition, 16793–16803","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.610661Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:4209782c2f8f5f5dadd920353792aa11952c9f73f8b2048321d38613189617d0","observation_id":"393aa8f8-c4fc-49da-9c84-44ecef1a648a","resolution":{"observed_at":"2026-08-06T18:02:43.610661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:44.315267Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":"1d49fcae-01d5-414d-a21c-c7ac09390f1e","year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.614624Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:132b5a47ff23f47b5d17d841e8438179e44aa8d9206fc37e1a4bc3b5b34cc290","observation_id":"fa9de672-90ac-483d-bee0-3e604dfe204a","resolution":{"observed_at":"2026-08-06T18:02:44.323648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:02:43.588950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.588950Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:567825ca23ab62b1fa3774d96ab8adf7086b0c2d8b237d7a74daee6c0b3c56e7","observation_id":"1780b0e9-a7ba-4a10-923c-93daf34ea924","resolution":{"observed_at":"2026-08-06T18:02:43.588950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-06T18:02:43.558955Z","title":"InAdvances in Neural Information Processing Systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.558955Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:a41d726b4740764e6972844b462f73a7e7b36bdcf3889ef79dcf2d7c91659eb6","observation_id":"f4a02599-d57b-4a32-83b1-4d2d1094bfc0","resolution":{"observed_at":"2026-08-06T18:02:43.558955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T18:02:43.580389Z","title":"Meng, F.; Du, L.; Liu, Z.; Zhou, Z.; Lu, Q.; Fu, D.; Han, T.; Shi,B.;Wang,W.;He,J.;Zhang,K.;Luo,P.;Qiao,Y.;Zhang, Q.;andShao,W.2025","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.580389Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:90f9e96715b9d98960970729981e4c29c441f2c9d62b117ffa5367a4018e39ea","observation_id":"7f726666-04ca-4bbe-834b-124876c1cfb1","resolution":{"observed_at":"2026-08-06T18:02:43.580389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T18:02:43.593744Z","title":"arXiv preprint arXiv:2412.10302","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.593744Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:93987e2970d8784f6cbcfdf0ea59a292e1e4955138f2bec57f679ecc736f6914","observation_id":"7b70000d-798d-4848-b40c-80934cbca12a","resolution":{"observed_at":"2026-08-06T18:02:43.593744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.545297Z","title":"Assran,M.;Duval,Q.;Misra,I.;Bojanowski,P.;Vincent,P.; Rabbat,M.;LeCun,Y.;andBallas,N.2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.545297Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:60003316bfeb3c3d5fa235ff3cc15d11b07bcebc3c607cd6c982b226ec083df1","observation_id":"43834796-eb56-4b6b-85e4-d0ba82abc155","resolution":{"observed_at":"2026-08-06T18:02:43.545297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.549873Z","title":"arXiv preprint arXiv:2602.09483","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.549873Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:41b57cfbc55a6391ed2085bf55df64b0ac6d2b759ad1e378472f676fa75285e6","observation_id":"7e1ffec3-0e69-4bff-89f1-4d1b2d5f4022","resolution":{"observed_at":"2026-08-06T18:02:43.549873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T06:02:43.987512Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2608.04726."}