{"as_of":"2026-08-10T18:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f541eab9f4814da2df9d3ba2a776c0e0bd41470ec1e825e07d28f02248d12d84","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:20:08.334206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:07.768237Z","state":"measured"}],"external_citation_measurements":[{"count":2607,"observed_at":"2026-07-04T20:00:07.768237Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T18:08:55.311069Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2208.01618"},"observation_digest":"sha256:607664b0c456d9af19dce609a4e16804d4c31be35af7513e8b8d28c3c1bf7b7a","observation_id":"68a3ef13-421f-44f3-a3a6-9243823bc9d8","resolution":{"observed_at":"2026-05-11T18:08:55.541350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2208.14649","last_updated":"2026-04-22T00:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-31T06:18:10Z","title":"DetailCLIP: Injecting Image Details into CLIP's Feature Space","version":7},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T11:08:20.298043Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2208.14649"},"observation_digest":"sha256:9076648ca0c2266c3483e2db4253012d8b9fff47ebfb6212e83ac29a6678b481","observation_id":"d7d90f01-0bf6-4483-be44-a1e77b96d2e4","resolution":{"observed_at":"2026-05-24T11:09:22.452379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-08-08T12:20:08.334206Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07855","last_updated":"2025-06-13T12:20:30Z","snapshot_observed_at":"2026-08-08T16:43:44.128026Z","submitted_at":"2025-02-11T14:04:43Z","title":"Vision-Language Models for Edge Networks: A Comprehensive Survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:08.334206Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2502.07855"},"observation_digest":"sha256:0d3ef975ee8033bc0030a9eff32bd2e8a50d1292bfabc616bc81c603be4072cd","observation_id":"57e163cd-281f-4af1-b3db-a4b1ea8f8487","resolution":{"observed_at":"2026-08-08T12:20:08.334206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-08-06T21:43:29.866668Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23577","last_updated":"2025-07-05T16:17:16Z","snapshot_observed_at":"2026-08-10T13:07:23.652868Z","submitted_at":"2025-06-30T07:29:10Z","title":"StackCLIP: Clustering-Driven Stacked Prompt in Zero-Shot Industrial Anomaly Detection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:43:29.866668Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2506.23577"},"observation_digest":"sha256:a53646cff2cd9604f126572e2716b0a05b57909c53cbeb6a21bff894362f4462","observation_id":"2b551534-5774-43ca-bc29-26542cf35cca","resolution":{"observed_at":"2026-08-06T21:43:29.866668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-08-06T18:24:53.412320Z","title":"arXiv preprint arXiv:2109.01134 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08475","last_updated":"2025-07-11T10:35:13Z","snapshot_observed_at":"2026-08-10T13:08:21.914665Z","submitted_at":"2025-07-11T10:35:13Z","title":"SynBridge: Bridging Reaction States via Discrete Flow for Bidirectional Reaction Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.412320Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2507.08475"},"observation_digest":"sha256:6b1ead483183b300fb19e84fa254d2df180442beb09a533c4303a80a978d9b3a","observation_id":"6495820b-8c45-4a35-966d-7ba4266044cf","resolution":{"observed_at":"2026-08-06T18:24:53.412320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-08-04T10:14:08.549417Z","title":"Learning to prompt for vision- language models.arXiv preprint arXiv:2109.01134,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11296","last_updated":"2026-05-25T01:51:58Z","snapshot_observed_at":"2026-08-08T16:32:41.485164Z","submitted_at":"2025-10-13T11:36:58Z","title":"$\\Delta \\mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:14:08.549417Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2510.11296"},"observation_digest":"sha256:33e430b33a14ec4ea40aa51ad0bde77bae0bea6b5b3d246cd87f9354152c8090","observation_id":"52bc2d64-fc76-4e3f-8c65-74ef080be272","resolution":{"observed_at":"2026-08-04T10:14:08.549417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2512.20249","last_updated":"2026-04-19T15:53:54Z","snapshot_observed_at":"2026-07-06T22:39:52.837578Z","submitted_at":"2025-12-23T11:04:34Z","title":"Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T20:15:50.210484Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2512.20249"},"observation_digest":"sha256:0aa2970281c9d436b82697eb4786826e680009938121d3fb8a7ac12593b49e58","observation_id":"ef9fd95f-1da4-4d7d-af66-76f365e15dc0","resolution":{"observed_at":"2026-05-16T20:18:23.191256Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2604.18444","last_updated":"2026-04-20T16:01:44Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T16:01:44Z","title":"ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:38.183119Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2604.18444"},"observation_digest":"sha256:ecb044251f0931eb72f6ef7a9f1c46c7e7a4e27e2229cea2d38e52c0da39df1a","observation_id":"3d304dad-0597-4e3e-a9a5-8a963d34d842","resolution":{"observed_at":"2026-05-10T04:45:20.976440Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2604.20311","last_updated":"2026-04-23T11:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T08:11:06Z","title":"Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-09T23:13:34.852488Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2604.20311"},"observation_digest":"sha256:f303bbe05742db109d0419be538ae4633686d7f3faf254e731e48f58a975ba55","observation_id":"a5c6457d-c08f-41be-a024-fc9916c5d2bf","resolution":{"observed_at":"2026-05-09T23:14:36.510352Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.02604","last_updated":"2026-05-04T13:51:45Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T13:51:45Z","title":"Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T18:26:24.377120Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.02604"},"observation_digest":"sha256:5d9e5e40cae910243a017f7328df340edf72a129dc9e78fd7fa0dede986abdaf","observation_id":"2aa58e67-2cf1-4014-8423-da1565bb5cfa","resolution":{"observed_at":"2026-05-08T18:28:58.211029Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.02912","last_updated":"2026-04-07T20:15:15Z","snapshot_observed_at":"2026-08-10T09:38:06.621696Z","submitted_at":"2026-04-07T20:15:15Z","title":"Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T19:04:20.674374Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.02912"},"observation_digest":"sha256:14b1ee9bd91e6d8bd9de49e81692f27579b618de511fbb89ab45d10a9a1581a1","observation_id":"fefcfcbb-8348-4a23-98db-fd3fecc40e7d","resolution":{"observed_at":"2026-05-10T19:05:44.275069Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.03294","last_updated":"2026-05-05T02:31:18Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T02:31:18Z","title":"FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T01:26:11.811914Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.03294"},"observation_digest":"sha256:0badae53d9254ec49be5ef6d61ac82e3fddb7f4d69a41894c397a45df6a71c3d","observation_id":"42ba4757-df8c-4608-bdb5-e337fe221c0c","resolution":{"observed_at":"2026-05-09T01:24:39.013742Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.06477","last_updated":"2026-05-07T16:01:59Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T16:01:59Z","title":"GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T13:17:48.295630Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.06477"},"observation_digest":"sha256:f156e001db6b76269594dffbed3545e0a418eb045aab5a59df569793e4c3e4d9","observation_id":"142f6e9b-f692-49b2-a0b8-b0229d78405e","resolution":{"observed_at":"2026-05-08T21:29:15.071225Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.11572","last_updated":"2026-05-13T06:26:49Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T05:59:23Z","title":"TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:41:07.685217Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.11572"},"observation_digest":"sha256:9261cc8465407968f22bfc3c4f3793c7b5b8e96a04728ce745414f6bd803faa3","observation_id":"dd73e5e7-bfd3-4153-83c4-51e12cce0f41","resolution":{"observed_at":"2026-05-13T01:42:02.392171Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.11572","last_updated":"2026-05-13T06:26:49Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T05:59:23Z","title":"TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T21:14:38.092918Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.11572"},"observation_digest":"sha256:f25c8033db119d4971fa34e75f63f23fa25620c316e98ad627148345a4c84400","observation_id":"e15eada8-be81-4a30-9434-4e2fa8cb232e","resolution":{"observed_at":"2026-05-14T21:17:58.410163Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.12952","last_updated":"2026-05-13T03:35:23Z","snapshot_observed_at":"2026-08-02T23:52:42.380267Z","submitted_at":"2026-05-13T03:35:23Z","title":"Debunking Grad-ECLIP: A Comprehensive Study on Its Incorrectness and Fundamental Principles for Model Interpretation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-14T19:55:33.741521Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.12952"},"observation_digest":"sha256:760abe35faee6fb1bcecee31c706d8ba93cd78309c504424739154a63dde1bad","observation_id":"6de3b287-6771-48c9-859f-749beb818b69","resolution":{"observed_at":"2026-05-14T19:57:52.550230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.17187","last_updated":"2026-05-16T22:52:11Z","snapshot_observed_at":"2026-07-06T23:28:12.114488Z","submitted_at":"2026-05-16T22:52:11Z","title":"PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-05-20T14:05:14.737146Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.17187"},"observation_digest":"sha256:6280b734f8c6d08574b5c581ee1bd2fb3ed7dad59bd7fa7557b7459614c89013","observation_id":"65b83ab6-516d-4082-b17d-0a6e127439a7","resolution":{"observed_at":"2026-05-20T14:08:20.777711Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.18162","last_updated":"2026-05-18T10:05:21Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:05:21Z","title":"Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T11:33:39.121508Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.18162"},"observation_digest":"sha256:518e7cbb3f98d4f36ad5abbcd97fa4af26b27d05c76b7ec8a38e1b7c9d325d55","observation_id":"276e70c1-fb5b-4276-883f-82c75cdbbf38","resolution":{"observed_at":"2026-05-20T11:38:14.383828Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2605.18464","last_updated":"2026-05-19T09:44:59Z","snapshot_observed_at":"2026-08-08T15:15:06.330916Z","submitted_at":"2026-05-18T14:25:25Z","title":"PERL: Parameter Efficient Reasoning in CLIP Latent Space","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:15.339048Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2605.18464"},"observation_digest":"sha256:371ba1e63f9ca79cc03b402159028bf86fd303513a64cd965b72fa3d7ed1a359","observation_id":"0aec0bb8-3d96-445c-b9aa-b45811663fdd","resolution":{"observed_at":"2026-05-20T11:48:14.619516Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models","version":6},"cited_work":{"arxiv_id":"2109.01134","doi":"10.1007/s11263-022-01653-1","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.01134","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"International Journal of Computer Vision , author =","venue":"International Journal of Computer Vision","work_id":"15671ff5-437e-4693-8834-c19a8d24d94d","year":2021},"citing_paper":{"arxiv_id":"2606.25657","last_updated":"2026-06-24T10:11:04Z","snapshot_observed_at":"2026-08-02T18:53:25.862048Z","submitted_at":"2026-06-24T10:11:04Z","title":"Steering Vision-Language Models with Joint Sparse Autoencoders","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-25T20:56:57.716246Z"},"links":{"cited_paper":"/paper/2109.01134","citing_paper":"/paper/2606.25657"},"observation_digest":"sha256:3ace1aa4f4699fff53e73c7f5a90d8230d4e50565d38cfff8b53a06c86050aaa","observation_id":"e4e39745-277a-47bb-ac9a-de4988b1e285","resolution":{"observed_at":"2026-07-04T20:00:07.769905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:24:38.45381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2109.01134/citation-record","integrity":"/paper/2109.01134/integrity","json":"/paper/2109.01134/citation-record.json","paper":"/paper/2109.01134"},"outbound":[],"paper":{"arxiv_id":"2109.01134","last_updated":"2022-10-06T11:36:09Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T03:04:47.411987Z","submitted_at":"2021-09-02T17:57:31Z","title":"Learning to Prompt for Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2109.01134."}