{"as_of":"2026-08-09T06:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3dff719256825d8fa0fe53e367b5f7c0ac242fad4b13f6bbf8c79cb8aced8aa3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:57.423394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:53.217043Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-07T11:54:57.423394Z","title":"Zhang, L., Xiong, Y ., Yang, Z., Casas, S., Hu, R., and Urtasun, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01182","last_updated":"2025-07-08T20:18:16Z","snapshot_observed_at":"2026-08-07T23:49:37.581868Z","submitted_at":"2025-06-01T21:33:36Z","title":"Humanoid World Models: Open World Foundation Models for Humanoid Robotics","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:57.423394Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2506.01182"},"observation_digest":"sha256:521146884c963916fe066d9a685013316a150e043e0dcdc4c157c976d806c163","observation_id":"c73c9ba7-c9ea-4e43-9e37-a0a8a497c1a9","resolution":{"observed_at":"2026-08-07T11:54:57.423394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2507.04227","last_updated":"2026-04-14T14:47:25Z","snapshot_observed_at":"2026-08-01T14:12:08.736574Z","submitted_at":"2025-07-06T03:31:36Z","title":"Mobile GUI Agents under Real-world Threats: Are We There Yet?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T06:57:25.257775Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2507.04227"},"observation_digest":"sha256:be6c8f72cdcc10add30ba77c01f2592fc1f23931fe199fdafc97e8a2dc48c8d9","observation_id":"ff4d8d66-ad65-4f5b-af4d-afbdd0c8c57c","resolution":{"observed_at":"2026-05-19T07:02:07.906593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T17:46:22.192112Z","title":"Vision-Language Models for Vision Tasks: A Survey , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10106","last_updated":"2025-07-14T09:45:34Z","snapshot_observed_at":"2026-08-07T07:18:38.132008Z","submitted_at":"2025-07-14T09:45:34Z","title":"BlueGlass: A Framework for Composite AI Safety","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T17:46:22.192112Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2507.10106"},"observation_digest":"sha256:60bd91600b05955204ffded67309c1bc0e5ec314328169ee7159c1899f45023c","observation_id":"3db49778-a5be-4ef0-a1c8-f7351c95ef90","resolution":{"observed_at":"2026-08-06T17:46:22.192112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T15:43:10.857101Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15285","last_updated":"2025-07-21T06:35:46Z","snapshot_observed_at":"2026-08-08T20:20:51.804408Z","submitted_at":"2025-07-21T06:35:46Z","title":"In-context Learning of Vision Language Models for Detection of Physical and Digital Attacks against Face Recognition Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:10.857101Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2507.15285"},"observation_digest":"sha256:b5bfc6d5c8a3155ea03291ec4e85f813fa7da528af593f3c3dc68fd42358fd65","observation_id":"1e779dc7-e67d-466b-a7b0-912ccd56bd2c","resolution":{"observed_at":"2026-08-06T15:43:10.857101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2508.08508","last_updated":"2025-08-18T04:59:14Z","snapshot_observed_at":"2026-07-06T22:11:33.173654Z","submitted_at":"2025-08-11T22:40:05Z","title":"Re:Verse -- Can Your VLM Read a Manga?","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T23:14:25.088197Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2508.08508"},"observation_digest":"sha256:44a2f29b459d680c681c6865b6a58ba8118c7023906f04fdb555cecac960d39c","observation_id":"fc1f0fa0-6955-4ad4-8235-c919c200d8d5","resolution":{"observed_at":"2026-05-18T23:16:54.116669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T10:27:39.491216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-06T23:21:03.442673Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.491216Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:5a209242b79f2542907e29aa66359a814d209752a305ed188f9d9d4a067ad9dc","observation_id":"29a3e9b4-a2d3-46c1-80dc-c3f24e36a74e","resolution":{"observed_at":"2026-08-06T10:27:39.491216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-04T16:33:29.108092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12795","last_updated":"2026-06-01T08:46:33Z","snapshot_observed_at":"2026-08-04T16:33:19.031185Z","submitted_at":"2025-09-16T08:14:15Z","title":"When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T16:33:29.108092Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2509.12795"},"observation_digest":"sha256:74029dd0d3ec165a4d1ee06ce2f64a6d87801eea53a0e7e489c625450a6c4038","observation_id":"7bcb7bce-92b6-4178-9dc3-1075095b3b0c","resolution":{"observed_at":"2026-08-04T16:33:29.108092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-04T09:33:42.375221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.375221Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:0f3a903543261c6c3dad07d960d4e993487e6f5fb97de6f08937b44751e735d0","observation_id":"06b7ccd8-d487-4846-ac50-b8239a562185","resolution":{"observed_at":"2026-08-04T09:33:42.375221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2605.20648","last_updated":"2026-05-20T03:09:41Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T03:09:41Z","title":"Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T05:10:49.673130Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2605.20648"},"observation_digest":"sha256:670581a8ee024fda9c2df43724f227a5a8c23a092afcadc159c0455ea37eabf6","observation_id":"a59938c4-8385-45a5-abbc-10bcb40fce8f","resolution":{"observed_at":"2026-05-21T05:13:58.585221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2606.26734","last_updated":"2026-06-26T22:08:10Z","snapshot_observed_at":"2026-08-08T16:00:23.593832Z","submitted_at":"2026-06-25T08:16:42Z","title":"Robust Onion: Peeling Open Vocab Object Detectors Under Noise","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T05:33:25.373918Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2606.26734"},"observation_digest":"sha256:6355c319cb84b9822fe67e25d33d3151cc91a94ca3032c042f1e19974c0d6dc5","observation_id":"1d9724cc-0f04-4d66-a058-affd20e900ef","resolution":{"observed_at":"2026-07-04T12:59:53.218477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2606.26734","last_updated":"2026-06-26T22:08:10Z","snapshot_observed_at":"2026-08-08T16:00:23.593832Z","submitted_at":"2026-06-25T08:16:42Z","title":"Robust Onion: Peeling Open Vocab Object Detectors Under Noise","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T00:42:36.605869Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2606.26734"},"observation_digest":"sha256:e002f8ced3ebb0a8ea9da8c1775b58f890b16d547642f8454adadf63f6421006","observation_id":"1b779d3c-1858-4f7b-82bd-9cb8f7a7c7cb","resolution":{"observed_at":"2026-07-01T16:15:50.080203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-01T20:36:26.660978Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16582","last_updated":"2026-07-18T01:48:25Z","snapshot_observed_at":"2026-08-06T09:08:27.902543Z","submitted_at":"2026-07-18T01:48:25Z","title":"Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:36:26.660978Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2607.16582"},"observation_digest":"sha256:7357e281ad3200a7b1f614613709daa7a39d1a9105fd1f423f5c1ae893a04e8c","observation_id":"7ef60ee1-85ce-467f-a5df-44e7adf32d77","resolution":{"observed_at":"2026-08-01T20:36:26.660978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-01T13:26:30.037563Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19128","last_updated":"2026-07-21T14:18:25Z","snapshot_observed_at":"2026-08-09T04:40:17.801353Z","submitted_at":"2026-07-21T14:18:25Z","title":"One Model, Many Graphs: Learning over Attributed Graphs across Heterogeneous Modalities with Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T13:26:30.037563Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2607.19128"},"observation_digest":"sha256:09a4102cd9dc4518c81639a26a0f1bdc05597a7d5ddfb4f474701581f9faf3a8","observation_id":"d85a81fc-c181-46ff-9174-878c230ffae3","resolution":{"observed_at":"2026-08-01T13:26:30.037563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.00685/citation-record","integrity":"/paper/2304.00685/integrity","json":"/paper/2304.00685/citation-record.json","paper":"/paper/2304.00685"},"outbound":[],"paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2304.00685."}