{"as_of":"2026-08-15T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9948a990ec54127a5d2d680b2db58321b3fb3fe50a1b2845c8ddec8aea457db3","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:37:57.214117Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:24:43.443062Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T19:24:44.625903Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"cited_work":{"arxiv_id":"2411.15099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15099","snapshot_observed_at":"2026-08-11T19:24:44.625903Z","title":"Context-Aware Multimodal Pretraining","venue":"cs.CV","work_id":"1340e34c-2bfb-43bf-867b-3fbafef77d6a","year":2024},"citing_paper":{"arxiv_id":"2412.06712","last_updated":"2024-12-09T18:01:13Z","snapshot_observed_at":"2026-08-15T17:49:30.290283Z","submitted_at":"2024-12-09T18:01:13Z","title":"How to Merge Your Multimodal Models Over Time?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:43.443062Z"},"links":{"cited_paper":"/paper/2411.15099","citing_paper":"/paper/2412.06712"},"observation_digest":"sha256:879f3180ec6cf1c119a76a4055e0e1dc0935d93c3ace57adb8b86c430bc361e0","observation_id":"b9b8c456-4792-410d-b998-f07c992c7b0e","resolution":{"observed_at":"2026-08-11T19:24:44.634180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15099/citation-record","integrity":"/paper/2411.15099/integrity","json":"/paper/2411.15099/citation-record.json","paper":"/paper/2411.15099"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.805098Z","title":"Towards in-context scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.805098Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:6722e5e7ef85e9cb08b4de79135925213a86060766a6620c44bb4ff4a076c8a6","observation_id":"70c765bd-bb09-4136-8981-ce3cf2be048d","resolution":{"observed_at":"2026-08-12T14:37:56.805098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.810558Z","title":"Food-101 – mining discriminative components with ran- dom forests","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.810558Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:aeedaf6e5e3df54821e0736318d0ab0ef66d65a374cc819949dd917f59de69da","observation_id":"c0e9a56c-d66c-4990-8c39-9eac67e6e79a","resolution":{"observed_at":"2026-08-12T14:37:56.810558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.814909Z","title":"JAX: composable transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.814909Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:852969ffbd3648d823715b8923c7f61e3cbe6b1b24be03559dcd2b23c0aab9f9","observation_id":"77018c0c-9f9a-4993-8ebe-d7d729fea3ab","resolution":{"observed_at":"2026-08-12T14:37:56.814909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.818931Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.818931Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:1da5efa75a1b286abd8a9e406313e091aefd116e95e63e2f745b2ec1253006ba","observation_id":"45091425-3262-43a2-9787-d4ab8e48c3f3","resolution":{"observed_at":"2026-08-12T14:37:56.818931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.823242Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.823242Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2af1ca3c6c50818e5c2aadc65cda399b0a059bdfaa44695d3d9553ed1d669fb5","observation_id":"203c6aed-dd69-44da-872c-2cc3c2938ed6","resolution":{"observed_at":"2026-08-12T14:37:56.823242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.827291Z","title":"PaLI: A jointly- scaled multilingual language-image model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.827291Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a87e23fb7fd674da7814409524ad9d19b93045fac85b59d1822c4d76b51b7c42","observation_id":"002d7e9c-d335-436e-8bfe-d192d5a83437","resolution":{"observed_at":"2026-08-12T14:37:56.827291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.831414Z","title":"Meta-baseline: Exploring simple meta- learning for few-shot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.831414Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:81aa8b139169c0141b6675c3e6412e63a17481cfbc4c5eea0cfabe0e80916326","observation_id":"1983bc03-c6d4-4a5c-868e-40201bee3ca5","resolution":{"observed_at":"2026-08-12T14:37:56.831414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.835669Z","title":"Remote sens- ing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.835669Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:48ff5e08cf2044287a4f5c862fa74483edc950f8f89af30c8d64a03bd7f1d8de","observation_id":"efd77a6e-def5-4984-8e05-27718a21572b","resolution":{"observed_at":"2026-08-12T14:37:56.835669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.839717Z","title":"Cimpoi, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.839717Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2a270f7340f300068f32d1519cd7d87213e6e8995ec86f288e7a09b9151cf3d9","observation_id":"7cf14394-847a-4cfa-b7e4-d329de04a286","resolution":{"observed_at":"2026-08-12T14:37:56.839717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.843837Z","title":"Embedding arithmetic of multi- modal queries for image retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.843837Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:bd00cae6a1c501cf03b9ea6d25fc55324b279b9a7cec20b0055d92dcd2bfa321","observation_id":"caa77555-f1f3-4b56-a4f5-c5308f884a12","resolution":{"observed_at":"2026-08-12T14:37:56.843837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.847839Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.847839Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8c93e98836a7ce9e3d9ee7ffb5fbebaf1c48e55bb9c7fce31b02515743c3bde7","observation_id":"0aeefcd9-4f7b-48a5-8438-b8a75a987473","resolution":{"observed_at":"2026-08-12T14:37:56.847839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08895","last_updated":"2024-10-11T15:12:30Z","snapshot_observed_at":"2026-08-14T08:26:42.602611Z","submitted_at":"2024-10-11T15:12:30Z","title":"Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08895","snapshot_observed_at":"2026-08-12T14:37:56.851770Z","title":"Calibrated cache model for few- shot vision-language model adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.851770Z"},"links":{"cited_paper":"/paper/2410.08895","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:773b104730d636c041fbeaf93dbe21270e73916672f4b3886db57d4eaa1e2007","observation_id":"be71853a-f6b3-41e6-ac97-e522472987fa","resolution":{"observed_at":"2026-08-12T14:37:56.851770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.856394Z","title":"An im- age is worth 16x16 words: Transformers for image recog- nition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.856394Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:35c50393609a6bafc24763f42bdbb5cba2a6dd8b0e624cfd64719204c0ba4487","observation_id":"48e47d30-883a-4748-a93a-f4daee470184","resolution":{"observed_at":"2026-08-12T14:37:56.856394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.860414Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of vi- sual representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.860414Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2a0371f9eda70f1c1619ddaf84caacf513c274613217fc0fd016ebe655d97aa8","observation_id":"791e29dc-2e3a-4abd-88d3-8197b9bbf257","resolution":{"observed_at":"2026-08-12T14:37:56.860414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05328","last_updated":"2024-10-16T11:43:27Z","snapshot_observed_at":"2026-08-13T05:06:59.404913Z","submitted_at":"2023-12-08T19:26:13Z","title":"Bad Students Make Great Teachers: Active Learning Accelerates Large-Scale Visual Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05328","snapshot_observed_at":"2026-08-12T14:37:56.864270Z","title":"Bad students make great teachers: Active learning acceler- ates large-scale visual understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.864270Z"},"links":{"cited_paper":"/paper/2312.05328","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c4ec6bfe7ade81088673b84f7c92d63fe580a0d2f07184b63636c8d1ce8353d9","observation_id":"b1ab9afa-8d8e-4ce1-a16f-17109cceba86","resolution":{"observed_at":"2026-08-12T14:37:56.864270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17711","last_updated":"2024-06-25T16:52:37Z","snapshot_observed_at":"2026-08-14T10:27:53.583181Z","submitted_at":"2024-06-25T16:52:37Z","title":"Data curation via joint example selection further accelerates multimodal learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17711","snapshot_observed_at":"2026-08-12T14:37:56.868240Z","title":"Data curation via joint example selec- tion further accelerates multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.868240Z"},"links":{"cited_paper":"/paper/2406.17711","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b7b312358a13f5566020e60e1794be312f998a6f8b8b5eb6e00ea8b713976c2f","observation_id":"76b9f8e3-6223-46ff-b754-0bbe8ed0982f","resolution":{"observed_at":"2026-08-12T14:37:56.868240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.872532Z","title":"Data determines distributional robustness in contrastive lan- guage image pre-training (clip)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.872532Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d3396c9a051fa5c22e97c310e1ddb1ed563e3ab836c161f95b5435bcd8602a77","observation_id":"1eebf32f-e751-4382-9dac-0216922ce997","resolution":{"observed_at":"2026-08-12T14:37:56.872532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07396","last_updated":"2022-12-08T14:28:09Z","snapshot_observed_at":"2026-08-14T13:34:29.745958Z","submitted_at":"2022-10-13T22:29:10Z","title":"Caption supervision enables robust learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07396","snapshot_observed_at":"2026-08-12T14:37:56.876708Z","title":"Cap- tion supervision enables robust learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.876708Z"},"links":{"cited_paper":"/paper/2210.07396","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ad6edfc33a614f49b8db052fbbd9616fc2f58d4862f17ad185bdfb4a05d2dd1b","observation_id":"3f82e4a1-ddc8-48d1-a892-5ea3aecd3922","resolution":{"observed_at":"2026-08-12T14:37:56.876708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.881328Z","title":"Context-aware meta-learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.881328Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7082ed438a77c50982ef16c88a6fc90836024fab4bdfe9b768b2277126634753","observation_id":"3344ca7d-cb0b-4469-958f-9d0f9eb12bf9","resolution":{"observed_at":"2026-08-12T14:37:56.881328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.885032Z","title":"Model- agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.885032Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:f60770d0aad093274644763b58e68e5943e2f32fe979585d5f04dc8d4a7bbea0","observation_id":"3ecec771-1e71-44f9-9788-8068b4d7989e","resolution":{"observed_at":"2026-08-12T14:37:56.885032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.889441Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.889441Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:df9425832ceb26a6658cc859bdf0285162259dce270acad3196db92f40ab85e6","observation_id":"4ce5867a-c163-46ac-90e3-90ae46b03a87","resolution":{"observed_at":"2026-08-12T14:37:56.889441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08172","last_updated":"2025-08-13T13:35:19Z","snapshot_observed_at":"2026-08-12T23:03:08.116395Z","submitted_at":"2024-08-15T14:19:13Z","title":"Towards flexible perception with visual memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08172","snapshot_observed_at":"2026-08-12T14:37:56.893039Z","title":"Towards flexible perception with visual memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.893039Z"},"links":{"cited_paper":"/paper/2408.08172","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b6e064af63c3b69346c791ce4ffb58da3a4b210e46b39758dd176f09fdb1a59b","observation_id":"ea69ba92-37d5-4ba2-ae99-f7e68baa6f06","resolution":{"observed_at":"2026-08-12T14:37:56.893039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.896970Z","title":"Cyclip: Cyclic con- trastive language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.896970Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a651f8b5f0f2931cbdeef89c184dd6ae775fdd2d861346528062ea6e37239a23","observation_id":"c1af1f92-3eac-4a0b-91d9-ba0b27715a8d","resolution":{"observed_at":"2026-08-12T14:37:56.896970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.900622Z","title":"kNN-CLIP: Retrieval enables training-free segmenta- tion on continually expanding large vocabularies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.900622Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:858e81279977e4cad78f4d4889033f17b11a1af16470e43929127272ad3bf5d9","observation_id":"9b34ef7e-5e95-4083-9bcb-6d08c7968367","resolution":{"observed_at":"2026-08-12T14:37:56.900622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.904118Z","title":"Calip: zero-shot enhancement of clip with parameter-free attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.904118Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:54791cc116ecd9554039b0ae3661e7fbc07e0cb57186c1befe3b7b39aedca932","observation_id":"72718a6f-1246-4ebd-941a-9664a307b1c3","resolution":{"observed_at":"2026-08-12T14:37:56.904118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.907731Z","title":"Anchor-based robust finetuning of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.907731Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:0a0a2f33ff95301bbc38cd0198580252fee2643006e3182f4acd79d495370e54","observation_id":"c3d15297-de6e-461b-895b-ae9edcc6fb1e","resolution":{"observed_at":"2026-08-12T14:37:56.907731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.911882Z","title":"Dota: Dis- tributional test-time adaptation of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.911882Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:43f1aedc47865b92ad63a204fd1e78690a81130dfa2d3b225f52e2c6702e7da1","observation_id":"73352938-bd53-4430-858a-da6a8b60f17d","resolution":{"observed_at":"2026-08-12T14:37:56.911882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-12T14:37:56.915601Z","title":"Momentum contrast for unsu- pervised visual representation learning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.915601Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8711b2ced4e1aae514c597c2de2a30b3062cbb75ca4cb97c8e2b457a199957a7","observation_id":"31521a41-7721-487b-b3dc-687f24777925","resolution":{"observed_at":"2026-08-12T14:37:56.915601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.919978Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.919978Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ce7c0a8a59a71ec7304b8f71d4c68bd13a085de1df87732fb26c57f9664fbc3a","observation_id":"04fa7485-abd6-4db2-843f-8b06ca16ce79","resolution":{"observed_at":"2026-08-12T14:37:56.919978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.923750Z","title":"Ross, and Alireza Fathi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.923750Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c84b083c4c47090ddc68579100f32b2ddea98082145a65baa32c6a5bd1347e71","observation_id":"0f11c2db-bca9-4a8d-a902-59f97392e053","resolution":{"observed_at":"2026-08-12T14:37:56.923750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08060","last_updated":"2016-04-12T01:26:18Z","snapshot_observed_at":"2026-08-14T22:21:21.617685Z","submitted_at":"2015-11-25T13:51:29Z","title":"An open access repository of images on plant health to enable the development of mobile disease diagnostics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08060","snapshot_observed_at":"2026-08-12T14:37:56.927566Z","title":"Hughes and Marcel Salath ´e","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.927566Z"},"links":{"cited_paper":"/paper/1511.08060","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7e2ee14d799194526ffad7510a62efced6c4e30d6d10b7654c41b54674eb1cb6","observation_id":"712c3c31-e308-433f-b43e-98f09a666d95","resolution":{"observed_at":"2026-08-12T14:37:56.927566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.932485Z","title":"Retrieval-enhanced contrastive vision-text mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.932485Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2cf34003ae07451de352de30dfcd3d6ad7b4c187eb3614e252868ca52fb12aa7","observation_id":"65be5d2f-e5e3-4871-8b7c-c4c697f0b0cc","resolution":{"observed_at":"2026-08-12T14:37:56.932485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.936218Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.936218Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cd16c52b1eba3095014dfc867e5551d4d14af32d35f40c0a669448f40985f917","observation_id":"630f52a3-f4d3-4bba-bc2c-aabb5916cdb2","resolution":{"observed_at":"2026-08-12T14:37:56.936218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.939932Z","title":"Billion- scale similarity search with gpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.939932Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:6f183a8922d6370c8311ad4393fa35d59faa32b2abb05a6dd640427ea8babeef","observation_id":"301c0320-f0e9-4ad3-927e-e8c3da1ea784","resolution":{"observed_at":"2026-08-12T14:37:56.939932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.943995Z","title":"Multi-class texture analysis in colorectal cancer histology","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.943995Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b78bda3e99886cb9568c76365e97a2484e3a283b332a27dccd4158ca6cb30c5a","observation_id":"4e7093eb-6566-4511-bab5-8903fb954295","resolution":{"observed_at":"2026-08-12T14:37:56.943995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.948744Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.948744Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:0ba763ddfc21642e124656f9a791bd4ceaf230666d7ee9803090f90b5d731615","observation_id":"a12c991e-ddef-4b57-b744-3b4c493c9bdd","resolution":{"observed_at":"2026-08-12T14:37:56.948744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.953882Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.953882Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:add370a32c088dbb70f987fc426f38b5df8aec6d53cd948f6e9981f3ec8a4f45","observation_id":"3f0178d9-5fb9-4878-9322-7773ebf4b246","resolution":{"observed_at":"2026-08-12T14:37:56.953882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.958180Z","title":"Datadream: Few-shot guided dataset generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.958180Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2a97b02b1b3334a2a052e0fb4f594fad0889a216db534f1586d9ca615663333c","observation_id":"40bbfb34-0c1b-4bb5-9f79-d237c8071b8b","resolution":{"observed_at":"2026-08-12T14:37:56.958180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.961933Z","title":"Kirchhof, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.961933Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8939283394af10213482c0686891d2a98f073f4c8f4b194b1f37e9e4c32b76cd","observation_id":"8083119b-cd98-48a2-8670-f63045aa784d","resolution":{"observed_at":"2026-08-12T14:37:56.961933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.965448Z","title":"Wilds: A benchmark of in-the-wild distri- bution shifts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.965448Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:851cb573f634e5b6f552466b5c2d427f0eec0c354a97d2d2d696d180c89108cb","observation_id":"21f16633-77be-402c-b7ee-a9f2837d006b","resolution":{"observed_at":"2026-08-12T14:37:56.965448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.969771Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.969771Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7bf8c10d93e08e31dc337e9aec7653c2a1d71665827057fa4b6a53414dc052a2","observation_id":"52bea425-8108-4dfb-bd98-0a052fa4d840","resolution":{"observed_at":"2026-08-12T14:37:56.969771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.342205Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"6066137a-43c2-456b-91f8-e2cd203fe0b7","year":2009},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.973726Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:da49490cb99b5dabe63dd11db77a21f09b09bc518e7f4ad9fd4e62cb18b03326","observation_id":"a56237f0-2a9a-4d2b-b657-7fa37b0660a4","resolution":{"observed_at":"2026-08-12T14:37:58.346155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.331030Z","title":"SentencePiece: A sim- ple and language independent subword tokenizer and deto- kenizer for neural text processing","venue":null,"work_id":"02caab7e-6b84-42b8-927d-99b1713ec59b","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.977722Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:4ae0c2482009ef672ead55aeab8ce7934cd069ba8f8de37e1e7647714de8d545","observation_id":"b070a9d6-f5af-4f61-91b8-64f339a3df6e","resolution":{"observed_at":"2026-08-12T14:37:58.335232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.319061Z","title":"Meta-learning with differentiable con- vex optimization","venue":null,"work_id":"45860b97-85fc-4ed8-9b1b-a121a5f4916c","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.981678Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d702a2ae8edd04bb888b738e1abb0814bf7b46719cf8cd7e44903bc3a3e36afc","observation_id":"84fac99f-09e7-4b1c-99ad-abc348ab5315","resolution":{"observed_at":"2026-08-12T14:37:58.323606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.306887Z","title":"Universal representation learning from multiple domains for few- shot classification","venue":null,"work_id":"0d9d25f6-f7dd-4eaa-a5fd-691dc409c32a","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.986973Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ae818e9230771802c5e65eb8419e7f46c8afc28eb8c53ecd8c57559a62e11934","observation_id":"05d17675-4868-4313-be29-a586dc535122","resolution":{"observed_at":"2026-08-12T14:37:58.310950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09778","last_updated":"2024-04-19T02:19:19Z","snapshot_observed_at":"2026-08-13T10:17:26.370071Z","submitted_at":"2024-04-15T13:30:34Z","title":"The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning","version":2},"cited_work":{"arxiv_id":"2404.09778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09778","snapshot_observed_at":"2026-08-12T14:37:57.456297Z","title":"The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning","venue":"cs.CV","work_id":"b3b3c7d3-446d-47bd-86eb-a4387c583415","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.991378Z"},"links":{"cited_paper":"/paper/2404.09778","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8733d3d01767fbdc58daa123e0d4e50706825073998ff87b62c64601618412e8","observation_id":"cc5f9c01-79bb-4ce3-b473-f5a0519ef951","resolution":{"observed_at":"2026-08-12T14:37:57.462781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.295416Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"e7769ff4-b73e-4ebf-a926-647347fa967b","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.995575Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:606ff00d47dd4a9cf13c410b319cf693ba6f74c940c779c01b5704a7230aff1f","observation_id":"100e03d1-66a3-4846-938d-ae726ac4617d","resolution":{"observed_at":"2026-08-12T14:37:58.299402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.283516Z","title":"A closer look at few-shot classification again","venue":null,"work_id":"9b51338b-6a10-49d0-99e7-1f935fb113bc","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.999335Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a0b678827d80fec619f77180f4403a74af2cc5b8f75674aad5d1947e8461cd7a","observation_id":"64fc52eb-12c5-477a-8321-317b216e4e17","resolution":{"observed_at":"2026-08-12T14:37:58.287880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.270767Z","title":"Efficient and ro- bust approximate nearest neighbor search using hierarchi- cal navigable small world graphs","venue":null,"work_id":"ee454eaf-d185-42c4-b258-3011b3f291ab","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.004285Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:19bd1b1fc51d168d3e306a9c08f0d86156091ce900c7914e0760e3f1cae63ef7","observation_id":"66be19f4-ae75-41fa-a267-c0469a025420","resolution":{"observed_at":"2026-08-12T14:37:58.274989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.258372Z","title":"Visual classification via description from large language models","venue":null,"work_id":"3d8aeccd-c043-43d6-839e-6c607012a5f1","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.008287Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:406046e8584ed896eafd7e3c8314cfd1196ceb9aa12841c5ed0e55935c24366a","observation_id":"4c316190-2606-4644-8e32-d02c12dc136c","resolution":{"observed_at":"2026-08-12T14:37:58.262648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.246141Z","title":"Understanding retrieval- augmented task adaptation for vision-language models","venue":null,"work_id":"22ff1b05-52d5-46b1-98e6-601df29cd738","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.012415Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a52a097aa8c0d7ca23c4367a4a1729602846e759e479663bb32a1308ae2c7bbc","observation_id":"1c6ae813-cfd4-497c-915c-53081821f268","resolution":{"observed_at":"2026-08-12T14:37:58.249862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.234935Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"fe31f2c1-4409-4b56-ba5e-f0a700026a95","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.016068Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:289e2b319b5b7d5448162fc78d68ad38a3baa9c84b3a3d54272715eddcf15977","observation_id":"64f891d0-f16e-4700-9fda-89deececb47a","resolution":{"observed_at":"2026-08-12T14:37:58.238857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02900","last_updated":"2019-12-24T00:21:51Z","snapshot_observed_at":"2026-08-14T14:28:17.382087Z","submitted_at":"2019-08-08T01:43:24Z","title":"iCassava 2019 Fine-Grained Visual Categorization Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02900","snapshot_observed_at":"2026-08-12T14:37:57.019995Z","title":"icassava 2019 fine- grained visual categorization challenge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.019995Z"},"links":{"cited_paper":"/paper/1908.02900","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:1146a362fb0186c2c1384b5eff94a5e242161a729cd92c3f59a04ae67c319444","observation_id":"34267b4b-0cd9-4537-88cb-0d25cf3faaee","resolution":{"observed_at":"2026-08-12T14:37:57.019995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.222337Z","title":"Revisiting knn- based image classification system with high-capacity stor- age","venue":null,"work_id":"70fa2b8c-b77d-421b-aaec-688b406b8ea4","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.023854Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:28a52fa03ce8f4ff754839de6e62d55be6ec31da35a64d815ff2bfa5f02ceae5","observation_id":"6a6f778a-d042-4d47-b99e-0728aea139c9","resolution":{"observed_at":"2026-08-12T14:37:58.227426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02999","last_updated":"2018-10-22T16:11:14Z","snapshot_observed_at":"2026-08-14T19:38:16.450214Z","submitted_at":"2018-03-08T08:29:38Z","title":"On First-Order Meta-Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02999","snapshot_observed_at":"2026-08-12T14:37:57.031237Z","title":"On first-order meta-learning algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.031237Z"},"links":{"cited_paper":"/paper/1803.02999","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:103162ebebab5843154c5f03b5771ec59d634f43a80ffcace0b2190a2f7baafc","observation_id":"a4ba33e8-925d-4752-8028-e3c9221f3ba8","resolution":{"observed_at":"2026-08-12T14:37:57.031237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.198615Z","title":"CHiLS: Zero-shot image classifica- tion with hierarchical label sets","venue":null,"work_id":"aeb67762-ce44-49a4-b800-a84f185ce1b5","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.035558Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:95d686d2d607e80665089addf3d39904542b6898134ad59714f22c4841857ecc","observation_id":"a516c8b1-56ff-49db-ac39-ed9e9667bbbc","resolution":{"observed_at":"2026-08-12T14:37:58.202661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T14:37:57.039478Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.039478Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:f4979a54c8580a90e8be1941ba38657f8d66fbd93b7fbcd3f1c1de0672cc6c0a","observation_id":"ffc3d409-feb7-4a51-9ff2-9f8763f5a71b","resolution":{"observed_at":"2026-08-12T14:37:57.039478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.187010Z","title":null,"venue":null,"work_id":"7f732f5d-80a1-4b51-8ba9-bdb7d67a8d32","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.043705Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c2b3b7a0f302633fb8c5f45ca3d5e24a8ddb58cc887c927b2e9e49150f92ec96","observation_id":"442b0a8e-c71a-4a6a-91e7-640c56d7afa1","resolution":{"observed_at":"2026-08-12T14:37:58.191074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.175053Z","title":"Svl-adapter: Self-supervised adapter for vision-language pretrained models","venue":null,"work_id":"dbe23dc0-3b47-4eb1-9a36-b49614ee7da8","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.047926Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:db9f2d2e068051deee095191fe9d35fd610bdad669bb134ba65ba67dc175759c","observation_id":"b27edba5-7226-4014-bcc7-df36401432a1","resolution":{"observed_at":"2026-08-12T14:37:58.179609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.162934Z","title":null,"venue":null,"work_id":"8eb6ba91-532d-423d-a0c5-e0acb5e5e381","year":2012},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.051654Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:f19d8967250d49443db72fc60835af46c504533c250fadeb65715b4a517dd80f","observation_id":"aad77fb2-7711-4292-a136-f79e59bc68a7","resolution":{"observed_at":"2026-08-12T14:37:58.167209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.149945Z","title":"Moment matching for multi-source domain adaptation","venue":null,"work_id":"414218a6-55f9-4c9c-a518-d1f92a4ffa10","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.056471Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a50ccac68692bd12c815c36a75a1b49853be4b79b15fd039b3fb4318ed36bf7e","observation_id":"fb1fd241-37be-4acc-b86f-2b62a2cce57a","resolution":{"observed_at":"2026-08-12T14:37:58.154247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.139295Z","title":null,"venue":null,"work_id":"b3184cf0-250f-452a-8d5f-163c67b7eb17","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.060344Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:aedc460134a74cea421d855dab3c3d784cc6a2592352faaf50386a355f5bee7d","observation_id":"711b7eb8-5a14-40ff-825d-1fee0f1c1dbc","resolution":{"observed_at":"2026-08-12T14:37:58.142966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09253","last_updated":"2023-11-02T06:06:50Z","snapshot_observed_at":"2026-08-15T15:09:41.817599Z","submitted_at":"2023-05-16T08:03:07Z","title":"Online Continual Learning Without the Storage Constraint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09253","snapshot_observed_at":"2026-08-12T14:37:57.064283Z","title":"Online contin- ual learning without the storage constraint","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.064283Z"},"links":{"cited_paper":"/paper/2305.09253","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:265503dcd7676c050d9c52f6087a69d9d7f785897911ade73e0aae3386d29cb2","observation_id":"a5a555e5-f8dc-4cf2-9f8a-6f8744cc603f","resolution":{"observed_at":"2026-08-12T14:37:57.064283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.127182Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":"32549daf-84c9-4b32-9928-208f80c04494","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.068671Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a7af2457d1ea374cdf3a99f538283e91178ad4639f19871e9bdfe1bd986ab2ef","observation_id":"e006fed8-7986-4efa-a2df-edc5dbae5f72","resolution":{"observed_at":"2026-08-12T14:37:58.131420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.115571Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"742135d8-1dba-40e4-a63a-a3e88f3cb402","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.072389Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:28f52490800132f2a6ecbcf5088d7c2e1d650e1ecff2bcd88c959dcf293b9755","observation_id":"9a24563c-aeb9-4cdb-9f12-218f0817d7ea","resolution":{"observed_at":"2026-08-12T14:37:58.119743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.104574Z","title":null,"venue":null,"work_id":"36dfbf5f-5d39-45e9-ae5e-226a12810154","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.076389Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d8c9ec77e1981901a93df4b769aa4a393795831461a728becdeb8b9d59feded3","observation_id":"17366306-0fec-4a1c-bb20-4dd743293929","resolution":{"observed_at":"2026-08-12T14:37:58.108238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.093063Z","title":"Meta-learning with implicit gradients","venue":null,"work_id":"8d161cd8-b3eb-4171-8080-5c35d96ecd45","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.080772Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2bd04b1e0090f0262dfab0efd2ff6ec03e067bd3bd5f502ed03aefa776577870","observation_id":"11a6dafd-f568-480b-8ea3-4b1e87e4bfd6","resolution":{"observed_at":"2026-08-12T14:37:58.097235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.082355Z","title":"Towards to- tal recall in industrial anomaly detection","venue":null,"work_id":"e14c5288-aee8-4a61-b00c-916a00ce238e","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.084489Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:74a51bf74978f073bc6f849f859792058e78b3e012c70b7075200c8fda16b79e","observation_id":"5a3eec50-6345-4d87-9c7a-e59d352db629","resolution":{"observed_at":"2026-08-12T14:37:58.086217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.071261Z","title":"Sophia Koepke, Oriol Vinyals, Cordelia Schmid, and Zeynep Akata","venue":null,"work_id":"dd3f3d9a-42c3-4729-ae2a-1e15fe522388","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.088022Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:e1372534435bc312e45557bcd35eaffb9b08170ed7c68e19f9c9f3f3b3afeffd","observation_id":"f5547801-b058-45c5-b9aa-41767054ec72","resolution":{"observed_at":"2026-08-12T14:37:58.075211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14471","last_updated":"2024-12-06T18:22:32Z","snapshot_observed_at":"2026-08-13T11:02:48.602530Z","submitted_at":"2024-08-26T17:59:01Z","title":"A Practitioner's Guide to Continual Multimodal Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14471","snapshot_observed_at":"2026-08-12T14:37:57.092746Z","title":"A practitioner’s guide to continual multimodal pre- training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.092746Z"},"links":{"cited_paper":"/paper/2408.14471","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:797580a25f5b91bffcdd6800e9bd3fe812c03c214acdef37da8190f41b05f64a","observation_id":"e2ce42b8-6507-4191-bd56-8497b31970a0","resolution":{"observed_at":"2026-08-12T14:37:57.092746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.060094Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"9ca2c5e1-95d5-4251-a2c0-f59b93e22b5a","year":2015},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.097341Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cdcc72be6e967f67f33be028548d3c6aba3bfdf7f8769117a1834a296dde48b2","observation_id":"03000239-5940-4e84-a6ab-09e07e705872","resolution":{"observed_at":"2026-08-12T14:37:58.063806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.048127Z","title":"Rusu, Dushyant Rao, Jakub Sygnowski, Oriol Vinyals, Razvan Pascanu, Simon Osindero, and Raia Had- sell","venue":null,"work_id":"5ff54f05-12c3-4058-89d3-60639f2c66ad","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.100964Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:0ca2859214a25ecabf65830312aed01338eb1976b7b495691f8f01e6ce8285e0","observation_id":"d6ecb8b8-8445-4d45-9567-e9ac8637df2e","resolution":{"observed_at":"2026-08-12T14:37:58.052211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.037215Z","title":"Is a caption worth a thou- sand images? a study on representation learning","venue":null,"work_id":"061b5a4f-a9c6-4598-9484-82751a5ec9f1","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.104716Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ef12da8688e64fae9aad763074d63fda3c0de81e17004b02ad44ed63b276e6b0","observation_id":"f2d45028-895b-4b9e-93e3-9e2990279037","resolution":{"observed_at":"2026-08-12T14:37:58.041055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.026227Z","title":"Scott, Andrew C","venue":null,"work_id":"1ffea03c-ef9f-4a82-9251-98b239f89e2b","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.109119Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:43ded2e78b2d5ee801d24fb103bfdc36994c3a503006ccb0695a33068df383ae","observation_id":"d93cf45e-2090-402e-95ef-4a92bd597ee6","resolution":{"observed_at":"2026-08-12T14:37:58.030097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.007828Z","title":"statsmodels: Econo- metric and statistical modeling with python","venue":null,"work_id":"69b51e8d-40af-4966-b673-db44cb647a88","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.113383Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:18e6c0a8689fcf44d8fc59f59502adcc91afa572ba1aa48cc24913f0e013fbc0","observation_id":"c9b90e25-f56c-4b06-9818-850fc62b1c62","resolution":{"observed_at":"2026-08-12T14:37:58.012305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.995118Z","title":"Prototyp- ical networks for few-shot learning","venue":null,"work_id":"8ead0ffd-ea62-489e-a9d7-20f7efbeacd9","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.117264Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cb560e853c0182c8853ed4d604eaad3901c4ec06ca867f9cd7629e52b0dc327e","observation_id":"81001eac-2be7-4ef4-a53c-7430a15c25a1","resolution":{"observed_at":"2026-08-12T14:37:57.999678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.971814Z","title":"CLIP models are few-shot learners: Empirical stud- ies on VQA and visual entailment","venue":null,"work_id":"fa9af4f2-dfa8-4a4b-ad83-256337135630","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.124616Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:60cd2ea16306053aa4c2fd1b53e195a25c62a9658883cd0a7333d5c959f52623","observation_id":"b477796c-5448-4111-9aaf-d90044714688","resolution":{"observed_at":"2026-08-12T14:37:57.976059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03186","last_updated":"2022-11-06T17:41:39Z","snapshot_observed_at":"2026-08-13T13:48:36.679270Z","submitted_at":"2022-11-06T17:41:39Z","title":"Momentum-based Weight Interpolation of Strong Zero-Shot Models for Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03186","snapshot_observed_at":"2026-08-12T14:37:57.128358Z","title":"Momentum-based weight interpolation of strong zero- shot models for continual learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.128358Z"},"links":{"cited_paper":"/paper/2211.03186","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:4df8d51599e7f012a3500116573013506edaf2de53413ed2f73af27dd0a49d79","observation_id":"736c5b70-6251-4dd3-aa01-ad1ea67a5694","resolution":{"observed_at":"2026-08-12T14:37:57.128358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.960442Z","title":"Torr, and Timothy M","venue":null,"work_id":"f86409f3-1ecc-48e0-8626-1cb0bbb4ac4e","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.132369Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:07c40928525dcf30fde886a79e35614d4e1e3d72b40566028aa1ba11d6436117","observation_id":"007a8fe0-30bc-4ac9-9eae-401bb59f09b5","resolution":{"observed_at":"2026-08-12T14:37:57.964324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13884","last_updated":"2022-01-06T00:55:00Z","snapshot_observed_at":"2026-08-13T17:08:01.334067Z","submitted_at":"2021-12-27T20:02:10Z","title":"A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13884","snapshot_observed_at":"2026-08-12T14:37:57.136457Z","title":"A fistful of words: Learning transferable visual models from bag-of-words supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.136457Z"},"links":{"cited_paper":"/paper/2112.13884","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ab27d4c825badf08bb32669b3de8a0dd4c366ff051880a1ac505009364447484","observation_id":"95c8b417-a95c-409d-8def-04ac52074166","resolution":{"observed_at":"2026-08-12T14:37:57.136457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.140969Z","title":"Reflecting on the state of rehearsal-free continual learning with pretrained models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.140969Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:12301160abbf2dce656259b7960994058870c7cdf2d5e294ff2ce7139a42590a","observation_id":"dc99c10a-e7c6-494d-817a-f680068153a7","resolution":{"observed_at":"2026-08-12T14:37:57.140969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.948434Z","title":"Tenenbaum, and Phillip Isola","venue":null,"work_id":"9edd335d-c168-4916-8e3a-54effa2bea79","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.145029Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:010607ac8d03b5e60bb52836d81bd632fea6587d0f9543e168760b5c678271fc","observation_id":"2f283015-664d-4491-be18-b0dd2ff33416","resolution":{"observed_at":"2026-08-12T14:37:57.952387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.935596Z","title":"Learning a universal template for few-shot dataset generalization","venue":null,"work_id":"1a18d24b-202d-43c3-a8f2-ab8e43472827","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.149162Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:958e21f5066388f24cabab15ededbbd9d1ad1b9e507965e5b9f26707aa4b7240","observation_id":"723165a3-c8b8-48bf-90e5-3e7bd85928a8","resolution":{"observed_at":"2026-08-12T14:37:57.939953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.922851Z","title":"Sus-x: Training-free name-only transfer of vision-language models","venue":null,"work_id":"e5c79ab0-4b52-498e-bc2d-5a55bb4d088b","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.152895Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c2e579c37287fdcdf281ca17234ff9dcbb887db7845b98e8f1d8d73c99050aa0","observation_id":"3ab390aa-eb50-4dae-a438-3083e747ee7e","resolution":{"observed_at":"2026-08-12T14:37:57.926951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.910859Z","title":"No ”zero-shot” without exponential data: Pretraining concept frequency determines multimodal model performance","venue":null,"work_id":"7675c8dd-a497-4a2e-97c4-a33ccef4dd7e","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.156538Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d90e1a92baf73a6a3a2dfb07cb59e36fd53dc50437c893c92b1f2768aa14d215","observation_id":"dea92e67-8c29-41a8-877e-579c86f2bb22","resolution":{"observed_at":"2026-08-12T14:37:57.914761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.898931Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"010cebf6-ad2a-4262-a307-b33b74c46f74","year":2017},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.160216Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:5938a3aa800ae7b347228ab32de3e5d9e49e5151b29c2f6e240beb917cbdbc0d","observation_id":"82c60407-9136-4ee8-bcb4-085c2e53757a","resolution":{"observed_at":"2026-08-12T14:37:57.903118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.887578Z","title":"Matching networks for one shot learning","venue":null,"work_id":"40be0970-d941-45b2-987b-5f6544718b06","year":2016},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.164036Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d33e7f49417d04104f130a87d30b58f54d9e2eb4bb9e60c0258404b4c4a440a3","observation_id":"9d0d702b-5736-4283-8759-998f518144f6","resolution":{"observed_at":"2026-08-12T14:37:57.891598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.875063Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"49b53194-458b-464c-bf7a-0822da6fbc55","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.167806Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8c9410d5837225def46ffb91b87ff5492fb41e84062d5fb249e9e8cd27eed85a","observation_id":"79ea8769-f9a9-4ad6-932c-235425f2753b","resolution":{"observed_at":"2026-08-12T14:37:57.879394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04623","last_updated":"2019-11-16T00:35:54Z","snapshot_observed_at":"2026-08-14T22:22:39.515577Z","submitted_at":"2019-11-12T00:44:10Z","title":"SimpleShot: Revisiting Nearest-Neighbor Classification for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.04623","snapshot_observed_at":"2026-08-12T14:37:57.172045Z","title":"Simpleshot: Revisiting nearest- neighbor classification for few-shot learning.arXiv preprint arXiv:1911.04623, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.172045Z"},"links":{"cited_paper":"/paper/1911.04623","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c14fbb1960457dec103911aad3a4a403fc1257e526c654e3400ee0eda88ac514","observation_id":"58d52a3f-8c90-4eb9-ba33-21098263e4b3","resolution":{"observed_at":"2026-08-12T14:37:57.172045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.864178Z","title":"A hard-to-beat baseline for training- free CLIP-based adaptation","venue":null,"work_id":"052b3945-d49b-433a-a342-333a50e6580a","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.175826Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7176371cd1c8c0cc2f733d840cb8482229d1751a395bd2080e1ca9aa3baf7354","observation_id":"51f8e675-7350-412a-94a5-0b679013241e","resolution":{"observed_at":"2026-08-12T14:37:57.868102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.853289Z","title":"Welinder, S","venue":null,"work_id":"ad5848a5-d447-4b14-9a1e-b44ba84cc8c3","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.179462Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d3ac55b8d0a798b38438b216b8204a9af2cfa2287a331e340bdcd5023b884c47","observation_id":"181e1fb5-0c3b-47f4-b543-a17c2dd03b85","resolution":{"observed_at":"2026-08-12T14:37:57.857105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.841984Z","title":"Cascade prompt learning for vision-language model adaptation","venue":null,"work_id":"9096f8ba-09b9-4c29-889d-ee73b262caac","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.183149Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a43855b86016a79dfe74850f678dbf565de8207e403cf6f6207525805f11d5c2","observation_id":"c99e5433-c297-4b5d-ba9b-e6f829b23660","resolution":{"observed_at":"2026-08-12T14:37:57.846173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.831184Z","title":"Yu, and Dahua Lin","venue":null,"work_id":"6e2ffefb-0dd7-4871-81ca-187170b49db7","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.186746Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cb438ab4e79befcdfe8e256eb72f392f7a8c17dc2b6670b21c739a4d8e41cf4d","observation_id":"2ef29238-f14e-4282-954b-6baa244b04ed","resolution":{"observed_at":"2026-08-12T14:37:57.835015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.820239Z","title":null,"venue":null,"work_id":"6e40a2f2-d7a7-419c-b357-3305c0b73f9a","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.190332Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3d77874050196d9ffcf898da80f0e5406720baa753f1c01349186a2465d7133c","observation_id":"deb49dfa-4408-4827-811a-446eb5d7debb","resolution":{"observed_at":"2026-08-12T14:37:57.824058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.808805Z","title":"Ra-clip: Retrieval augmented contrastive language-image pre-training","venue":null,"work_id":"d103213e-25ae-4840-aabb-d3e65a6239b1","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.193803Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:882cb621ddd4f4692328402e0d4a5c20ea31ef04dd4346ee1e37f24203b1c9f2","observation_id":"575cea0f-38ef-425c-a187-745270fb36a0","resolution":{"observed_at":"2026-08-12T14:37:57.812976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.797713Z","title":"MetaFun: Meta-learning with itera- tive functional updates","venue":null,"work_id":"7e4ef9fd-6ac8-459b-9085-0cda9f06f1be","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.197717Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:bb6d2d001aaf1ce1726859bef41d677eca1aee273cf45fdf4e376cb70b6dfcfb","observation_id":"e67708da-7c0d-4613-a188-06e4cdf8e229","resolution":{"observed_at":"2026-08-12T14:37:57.801712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.786246Z","title":"Bag-of-visual-words and spatial extensions for land-use classification","venue":null,"work_id":"39168bf2-3100-4164-825e-65c439f8c662","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.201604Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c49b66e8d8f4b891ecbe6ec560e5d59639895095ec699e9a55c877f7f3adfe77","observation_id":"6127758c-8ad4-44f4-9215-885eb7169f91","resolution":{"observed_at":"2026-08-12T14:37:57.790291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.772846Z","title":"TapNet: Neural network augmented with task-adaptive projection for few-shot learning","venue":null,"work_id":"88781c3e-1f64-4947-b4d7-4400e94a7fb5","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.205556Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:e7570566686a631940a470675c12299a03bb5caa8ef5ba6889f469ebba712db9","observation_id":"1b7a84d9-5cdd-41d1-9862-cf12abb957c2","resolution":{"observed_at":"2026-08-12T14:37:57.777850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.760878Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cce9a7d2-e9e0-4eb4-aa69-1f10122dd1f3","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.210229Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:27eb0068c7f3b0c661eb3c3d919014aacaafdfa940c9e8701a498af52a85c66b","observation_id":"df4d8c5c-6d8b-41b0-a767-f9c6521dc099","resolution":{"observed_at":"2026-08-12T14:37:57.765024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.748856Z","title":"Deepemd: Few-shot image classification with differen- tiable earth mover’s distance and structured classifiers","venue":null,"work_id":"693ac5e8-1510-4c50-9b64-f5927aabfbea","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.214117Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:4cdeebb385c176695a23317a105493767f6d2b8fea6be384413743beb88b40da","observation_id":"e6204512-50f0-4d9c-b946-a3f74601fde8","resolution":{"observed_at":"2026-08-12T14:37:57.753232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:07:15.491098Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":44},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 1 inbound Pith citation observation for arXiv:2411.15099."}