{"as_of":"2026-08-09T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17104ef834471837ef5a74ec6e03e3a6a4565f971167a5aaaaeaf5547992e4e6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:45:56.874054Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-24T03:33:50.786236Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":"2304.06712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.06712 (2023) 3","venue":null,"work_id":"7cecc1dc-5be8-4d35-b542-1c3c3d23c8c9","year":2023},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:52fa29b1653a93effd677128aa4b52f87347cc83c14e5e53f2042f12611e336c","observation_id":"ac6869bc-71bd-42a0-afd8-8f19df449366","resolution":{"observed_at":"2026-05-15T23:26:06.303819Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":"2304.06712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.06712 (2023) 3","venue":null,"work_id":"7cecc1dc-5be8-4d35-b542-1c3c3d23c8c9","year":2023},"citing_paper":{"arxiv_id":"2403.13805","last_updated":"2026-05-15T05:14:37Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:59:55Z","title":"RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T03:31:58.848180Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2403.13805"},"observation_digest":"sha256:7619bc55c17747af003e18d0b539ae43f201f86281fd01ac7ec12bb56aa43c63","observation_id":"d66c9429-a5b5-4afc-ba0d-b70f8ad9d70b","resolution":{"observed_at":"2026-05-24T03:33:50.788761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":"2304.06712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.06712 (2023) 3","venue":null,"work_id":"7cecc1dc-5be8-4d35-b542-1c3c3d23c8c9","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f48514613957ce0c66576f322addc956dacfd588230301a4e9f18eafbb2d3219","observation_id":"dcb66970-d321-4245-98b2-a09e0c80b1e4","resolution":{"observed_at":"2026-05-15T20:18:15.551709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-07T13:45:56.874054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-08T23:47:58.987947Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.874054Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:f4f42dd7c78a42fb609f9dc603a119c41d49cf86706527cde9e4a8b8d405a568","observation_id":"cef1a705-6e1d-4fe4-b967-8f7369bcafec","resolution":{"observed_at":"2026-08-07T13:45:56.874054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-07T11:01:11.648041Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03799","last_updated":"2025-06-04T10:06:32Z","snapshot_observed_at":"2026-08-08T13:03:29.824359Z","submitted_at":"2025-06-04T10:06:32Z","title":"ConText: Driving In-context Learning for Text Removal and Segmentation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:01:11.648041Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2506.03799"},"observation_digest":"sha256:8fb8a009ecf07326442f38c6fad89cfd951d618430a2faca9ef0f795acc9daa7","observation_id":"28371d84-9f29-4461-852d-8375f006c0d9","resolution":{"observed_at":"2026-08-07T11:01:11.648041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-06T10:17:04.350951Z","title":"What does clip know about a red circle? visual prompt engineering for vlms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-09T10:06:54.862111Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.350951Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3bd4fa33986a92092c72d746fbfa8b4d2ea87145aaad92506bcfe5642f836a2b","observation_id":"b7290177-dbcc-48bf-afe5-da6924556643","resolution":{"observed_at":"2026-08-06T10:17:04.350951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-05T23:35:22.821052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.821052Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:c4a6f900be81deaa605e9d9dd4df0ebb0d30416feb647cb3d3f20acd72acd0e9","observation_id":"15dba7cd-b3ed-4867-80aa-c3808a26b4e3","resolution":{"observed_at":"2026-08-05T23:35:22.821052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.06712/citation-record","integrity":"/paper/2304.06712/integrity","json":"/paper/2304.06712/citation-record.json","paper":"/paper/2304.06712"},"outbound":[],"paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2304.06712."}