{"as_of":"2026-08-09T14:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df5c765994fd9860cd8673f7520561d0b14edc10850358023e5dabe94bd7b189","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:39:00.033360Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T16:03:08.102407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T15:39:00.033360Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14340","last_updated":"2025-05-20T13:27:17Z","snapshot_observed_at":"2026-08-08T01:27:46.166032Z","submitted_at":"2025-05-20T13:27:17Z","title":"Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T15:39:00.033360Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.14340"},"observation_digest":"sha256:9ab604e1f0cf817ad9b4ce32382f6c888469d84bac7bbc161f1bb0df78a595de","observation_id":"35ccaa1c-edcb-4a3e-9b49-be7bb19f70a5","resolution":{"observed_at":"2026-08-07T15:39:00.033360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T15:34:01.080099Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14880","last_updated":"2025-05-20T20:11:36Z","snapshot_observed_at":"2026-08-07T15:25:57.104729Z","submitted_at":"2025-05-20T20:11:36Z","title":"Incorporating Token Usage into Prompting Strategy Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:34:01.080099Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.14880"},"observation_digest":"sha256:cd87e91148d7ca4c7c502e366764cb132dcf5bd1c6d7407f99939d5fab997a57","observation_id":"a6cf2500-24d8-4980-90e6-625bbe754fe9","resolution":{"observed_at":"2026-08-07T15:34:01.080099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T14:30:22.096111Z","title":"Visual prompting in multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.096111Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b25b81d0df350c481d09ae31ac8a1a1962c9bb2fe341b47979293094e6757847","observation_id":"22a4348b-32aa-45d7-840f-981ad9e234c0","resolution":{"observed_at":"2026-08-07T14:30:22.096111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T13:45:57.523050Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-08T23:47:58.987947Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.523050Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:dac00331c427e454fd49a492962ae552c8f14fc145cbe735b6ba807e107db8a2","observation_id":"0ac4b01f-4cd7-4810-8161-76edb9375d4f","resolution":{"observed_at":"2026-08-07T13:45:57.523050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T12:43:41.257873Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-09T10:06:18.400948Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.257873Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:401832d86f25b9c2487b1c217df2e1d088730be32db4a128b84f7e14254f1d5a","observation_id":"a40d6278-33db-482d-a494-cb1094d91504","resolution":{"observed_at":"2026-08-07T12:43:41.257873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T05:36:15.716207Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07575","last_updated":"2025-06-09T09:20:20Z","snapshot_observed_at":"2026-08-08T12:50:28.189950Z","submitted_at":"2025-06-09T09:20:20Z","title":"Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:15.716207Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2506.07575"},"observation_digest":"sha256:285e9ecfa5e64e179be1eec49ddb4c2bb58a71546f0530fdf689ec6e3a487ba1","observation_id":"7aaf53df-d37c-4d31-b5c1-7996665ae2f2","resolution":{"observed_at":"2026-08-07T05:36:15.716207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-06T23:49:47.733190Z","title":"arXiv preprint arXiv:2409.15310 (2024) 1, 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16112","last_updated":"2026-07-11T03:45:43Z","snapshot_observed_at":"2026-08-08T00:43:05.134755Z","submitted_at":"2025-06-19T08:02:53Z","title":"AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:47.733190Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2506.16112"},"observation_digest":"sha256:4a9cacf4a9ac0176a5f59ed78677b79d67db55b1561ebcbd5b365eb8e0b471e2","observation_id":"ee4b47a9-2a6b-4935-b17b-3a2656142bf0","resolution":{"observed_at":"2026-08-06T23:49:47.733190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-06T14:36:55.827401Z","title":"Visual prompting in multimodallargelanguagemodels:Asurvey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18447","last_updated":"2025-07-24T14:33:06Z","snapshot_observed_at":"2026-08-06T19:31:11.014579Z","submitted_at":"2025-07-24T14:33:06Z","title":"PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:55.827401Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2507.18447"},"observation_digest":"sha256:0f69230dce48ed80d93391339265e47c6796e9a2221166c48b645868a89bd3dc","observation_id":"8f1ad2cc-cb70-4d95-a6eb-141ee985027d","resolution":{"observed_at":"2026-08-06T14:36:55.827401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:35:24.104443Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.104443Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:70b17158f3a981e22f3cc2feae8e44543f67f29cb499184483f9fa9e57185f90","observation_id":"d7e906a8-9839-4d82-9328-c67c32ea5419","resolution":{"observed_at":"2026-08-05T23:35:24.104443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T21:01:26.976295Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10065","last_updated":"2025-08-13T08:05:47Z","snapshot_observed_at":"2026-08-08T04:37:03.833237Z","submitted_at":"2025-08-13T08:05:47Z","title":"Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T21:01:26.976295Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.10065"},"observation_digest":"sha256:380843c002145918408c4285f1cd1c8e140be8d6d2b15e66ad6a5828ef8b37cd","observation_id":"3e86d794-ff2a-413c-b997-c1cb4c560696","resolution":{"observed_at":"2026-08-05T21:01:26.976295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:32:17.850843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.850843Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:2b5cce1a376c523c9077361461e43505c3dc94b0f5e2337a9d568edd970014e1","observation_id":"45f422a6-bf94-4aba-a52a-2f60719e77aa","resolution":{"observed_at":"2026-08-05T23:32:17.850843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-02T14:54:38.934183Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:7ac9a434543b2bbbbb749fff1bd91a185ec4725380a03708f543cdb83b8624d1","observation_id":"be421962-57d0-4d6b-a57b-c015f11c8160","resolution":{"observed_at":"2026-05-11T05:35:57.458742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2604.10527","last_updated":"2026-04-12T08:43:28Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:43:28Z","title":"STORM: End-to-End Referring Multi-Object Tracking in Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T16:25:31.777907Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.10527"},"observation_digest":"sha256:3b2de4b2ae91d649d455c33ec4aaeca91e641edbe67650ae2b0b44ac96beaf7c","observation_id":"6005aaec-6a6e-487f-9189-3de52d2a65b5","resolution":{"observed_at":"2026-05-11T08:56:00.442212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:7002c991350e4af3b47f7ec8cda16b96365895a49b0d4c8c3635930ee22c4f29","observation_id":"32c52558-2f0c-44c1-9586-f9c50a23884d","resolution":{"observed_at":"2026-05-10T06:56:47.420763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2409.15310 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:129aa69c4fefe99699c694c1625632000da0003ea1a68f645bf6b3b71fcadf78","observation_id":"3f808a75-1b6c-497b-ab1a-dbc0d9006b24","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:cc448bc9c3b7a42957c1c42e7de987e14e87761c6b832480005135e534e131aa","observation_id":"c2e6a976-bb1d-443f-89b0-e8f8e9a0a29f","resolution":{"observed_at":"2026-05-10T23:15:49.439868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.08526","last_updated":"2026-05-08T22:17:54Z","snapshot_observed_at":"2026-08-02T11:50:00.146281Z","submitted_at":"2026-05-08T22:17:54Z","title":"Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T01:24:59.721212Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.08526"},"observation_digest":"sha256:62d31c4d87304250ec9577e15ce7ba5adfde06fb561c11c76fcebce7f0d5ab77","observation_id":"5a3cfb1b-a25e-4961-b5b8-646f10e721cf","resolution":{"observed_at":"2026-05-12T08:01:28.145905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.11169","last_updated":"2026-05-11T19:28:20Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:28:20Z","title":"OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-13T02:24:42.530103Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.11169"},"observation_digest":"sha256:2d61466c7d99a34613490e9df87e702aa6b8752e78415179f1c0ad8f87dea9fd","observation_id":"1a7e3a96-1854-41d2-bc00-f77617cb93cc","resolution":{"observed_at":"2026-05-13T02:27:07.225834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.15342","last_updated":"2026-05-14T19:12:20Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T19:12:20Z","title":"Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T16:02:53.887605Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.15342"},"observation_digest":"sha256:74d66ca9a34abf499174b5015729ed13171554e5fb792be7f21854c35f1cf1d0","observation_id":"9d51bcf7-f6d3-43cc-9d9d-296b3341e32c","resolution":{"observed_at":"2026-05-19T16:03:08.104159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-01T23:57:13.850939Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15193","last_updated":"2026-07-16T16:48:39Z","snapshot_observed_at":"2026-08-08T18:50:34.084684Z","submitted_at":"2026-07-16T16:48:39Z","title":"Plover: Steering GUI Agents through Plan-Centric Interaction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T23:57:13.850939Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2607.15193"},"observation_digest":"sha256:ce388f20edec18832415aedcef0a8edc32a0704480bd58a6a70c1f05495ac236","observation_id":"e0630495-5989-46a3-9cb4-bb265b6a0e85","resolution":{"observed_at":"2026-08-01T23:57:13.850939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-02T06:18:16.279690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16311","last_updated":"2026-07-14T16:45:02Z","snapshot_observed_at":"2026-08-02T06:18:04.185958Z","submitted_at":"2026-07-14T16:45:02Z","title":"Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T06:18:16.279690Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2607.16311"},"observation_digest":"sha256:a80dd1385e50bc8d1ea3ce3f0ba62a972880cc36eb971075c087413dace9d11d","observation_id":"c9cbef5a-a706-4849-baec-6e32fb03b999","resolution":{"observed_at":"2026-08-02T06:18:16.279690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.15310/citation-record","integrity":"/paper/2409.15310/integrity","json":"/paper/2409.15310/citation-record.json","paper":"/paper/2409.15310"},"outbound":[],"paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2409.15310."}