{"as_of":"2026-08-19T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73f1facf8095e8e5eef7b086bb5e6ee13f15120a304e9c098f56096816f607d5","coverage":[{"denominator":115,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:24:06.917263Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:02:42.424201Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T06:17:26.610695Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00142","snapshot_observed_at":"2026-08-06T21:02:42.424201Z","title":"Sparse attention vectors: Generative multimodal model features are discriminative vision-language classifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-19T15:33:39.402884Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.424201Z"},"links":{"cited_paper":"/paper/2412.00142","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:1add03c9baf49ba30299236e9646dcfca5cc10ced63437e94f1bbf36831fc957","observation_id":"e87e8d74-2e2e-4461-b28c-1e519c258d34","resolution":{"observed_at":"2026-08-06T21:02:42.424201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00142","snapshot_observed_at":"2026-08-06T14:58:43.281185Z","title":"Preprint, arXiv:2412.00142","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17204","last_updated":"2025-07-23T04:52:58Z","snapshot_observed_at":"2026-08-16T07:19:26.167402Z","submitted_at":"2025-07-23T04:52:58Z","title":"Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:58:43.281185Z"},"links":{"cited_paper":"/paper/2412.00142","citing_paper":"/paper/2507.17204"},"observation_digest":"sha256:c723ca496baced51dec569662e02067bdcc5f16859fcc4939836e694d646d58d","observation_id":"f39de5d2-e178-4293-996e-9311c4bec4e9","resolution":{"observed_at":"2026-08-06T14:58:43.281185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"cited_work":{"arxiv_id":"2412.00142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00142","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse attention vectors: Gener- ative multimodal model features are discriminative vision-language classifiers.arXiv preprint arXiv:2412.00142, 2024a","venue":null,"work_id":"5b62d594-fbbb-4821-a063-fc0bc05abee2","year":null},"citing_paper":{"arxiv_id":"2602.07605","last_updated":"2026-04-27T13:49:08Z","snapshot_observed_at":"2026-08-15T05:01:38.609992Z","submitted_at":"2026-02-07T16:16:51Z","title":"Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T06:13:33.315525Z"},"links":{"cited_paper":"/paper/2412.00142","citing_paper":"/paper/2602.07605"},"observation_digest":"sha256:a947bb6202349c5c70e63572701fa664e89c691fc054ef8125c727553656c078","observation_id":"10332bb5-406a-41c9-a679-076ba29eadbb","resolution":{"observed_at":"2026-05-16T06:17:26.613498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00142/citation-record","integrity":"/paper/2412.00142/integrity","json":"/paper/2412.00142/citation-record.json","paper":"/paper/2412.00142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.494976Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.494976Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b05afc4e0ae18d8aa5b4f4c975e623214688826cb238538cbb91c9dd00d9981b","observation_id":"ac2bcad2-f61d-4522-8da8-0bb0092f96d9","resolution":{"observed_at":"2026-08-12T10:24:06.494976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.499604Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.499604Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:c02a482d5e09bdba2826fe59bf4cac868ab44c77a6abd595e840fca697713952","observation_id":"2b0af4f5-1f9b-4e94-ae4e-48600d8aca7f","resolution":{"observed_at":"2026-08-12T10:24:06.499604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T10:24:06.504091Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.504091Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b2bf2aa88c24d5ada76143ac533ae20157cb6a030ed7f577b088a2471e0f5663","observation_id":"c723246f-b926-4169-b19a-6ad76d6bbf5e","resolution":{"observed_at":"2026-08-12T10:24:06.504091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.508859Z","title":"Autoencoders, unsupervised learning, and deep architectures","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.508859Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b09e43bb395837d12a783c3056de34b060f49c64c45418722050ba15330b43c0","observation_id":"f9217092-aa73-4eb3-8237-d351cacfe238","resolution":{"observed_at":"2026-08-12T10:24:06.508859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.513025Z","title":"When XGBoost outperforms GPT-4 on text classification: A case study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.513025Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:2578888751a2486a088f5b6efbadf7dc4ce6f33991333cf4808d78be624194c0","observation_id":"a2f0c454-b8df-4a3a-b022-b71a48b53d09","resolution":{"observed_at":"2026-08-12T10:24:06.513025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T10:24:06.517399Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.517399Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:dcb9d4f5d6debdd8c0e794c92aa713d473de5e407bf1b807d69725610957d665","observation_id":"2eb0f0be-de19-49d0-b26a-e5c26d488c06","resolution":{"observed_at":"2026-08-12T10:24:06.517399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08660","last_updated":"2024-08-16T15:33:23Z","snapshot_observed_at":"2026-08-18T14:43:22.610308Z","submitted_at":"2024-06-12T21:46:13Z","title":"Fine-Tuned 'Small' LLMs (Still) Significantly Outperform Zero-Shot Generative AI Models in Text Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08660","snapshot_observed_at":"2026-08-12T10:24:06.522307Z","title":"Fine- tuned ’small’ llms (still) significantly outperform zero- shot generative ai models in text classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.522307Z"},"links":{"cited_paper":"/paper/2406.08660","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:dfe681c0eef23a57b1ba57aea35c19aee4cf09ad50774518dbcc3c77a67e17cf","observation_id":"ca244d32-4943-4a39-b712-4a115bbb80ac","resolution":{"observed_at":"2026-08-12T10:24:06.522307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03190","last_updated":"2024-05-27T11:52:56Z","snapshot_observed_at":"2026-08-16T14:21:21.282561Z","submitted_at":"2024-02-05T16:56:11Z","title":"Unified Hallucination Detection for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03190","snapshot_observed_at":"2026-08-12T10:24:06.527276Z","title":"Unified hallucination detection for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.527276Z"},"links":{"cited_paper":"/paper/2402.03190","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:2c87fdbc1c8277579d83b5e94431a86e6e7a81f0bb3ac69f454e160eb70dda49","observation_id":"523fbd7a-de83-4964-8fd9-4630c910dcde","resolution":{"observed_at":"2026-08-12T10:24:06.527276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.531609Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.531609Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:53db50283b985f16f5a5c633975a6245bb286000813bdd440a6a7c7979676a56","observation_id":"bb6aebae-89ec-4ba8-ac22-de904549b4c3","resolution":{"observed_at":"2026-08-12T10:24:06.531609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.535646Z","title":"Llms to the moon? reddit market sentiment analysis with large language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.535646Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:ed6e80bb501cc4d9d9d71fb50e067e180f5995e6f1d4d8314115ab9032210e97","observation_id":"fb04a755-f9d4-495d-8378-f998781e6d2e","resolution":{"observed_at":"2026-08-12T10:24:06.535646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.539633Z","title":"Virtex: Learning vi- sual representations from textual annotations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.539633Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:3d8dbd013d635182138b015f72d76808a9f7418b9b62478bf9fbff8a692bdca1","observation_id":"f3e23a81-ccd2-4f07-9be7-d0e605ac8e6f","resolution":{"observed_at":"2026-08-12T10:24:06.539633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T10:24:06.543840Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.543840Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:68beea28cbaa6aa7fd4209533f4824df7cad626000c8ec95ab23ed9b7efd090f","observation_id":"9f2c5cdc-a32c-49f0-9f38-1a2faea766c4","resolution":{"observed_at":"2026-08-12T10:24:06.543840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12736","last_updated":"2024-07-17T08:13:02Z","snapshot_observed_at":"2026-08-16T14:08:23.910130Z","submitted_at":"2024-03-19T13:53:37Z","title":"Towards Multimodal In-Context Learning for Vision & Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12736","snapshot_observed_at":"2026-08-12T10:24:06.548314Z","title":"Towards multimodal in-context learning for vi- sion & language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.548314Z"},"links":{"cited_paper":"/paper/2403.12736","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:5053daa999369a82361fae762ccf41e0af996cc630fdd6b28d4164ce55812fd1","observation_id":"eb58b3b7-75ea-4df7-8a7e-2fbf7cb6eb02","resolution":{"observed_at":"2026-08-12T10:24:06.548314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05644","last_updated":"2021-02-10T18:56:41Z","snapshot_observed_at":"2026-08-16T18:46:24.124538Z","submitted_at":"2021-02-10T18:56:41Z","title":"Training Vision Transformers for Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05644","snapshot_observed_at":"2026-08-12T10:24:06.552631Z","title":"Training vision transformers for image re- trieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.552631Z"},"links":{"cited_paper":"/paper/2102.05644","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:6c763f093b77e8a4517eee2b4edc3290537cdab210aa9118df9006a34a2a3108","observation_id":"df53f3e3-8d29-42fe-9603-2fec24dae47a","resolution":{"observed_at":"2026-08-12T10:24:06.552631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-12T10:24:06.557031Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.557031Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:7d6266f944064cc9c70be2bfdc37713ccb14061998baf7106a9be3057d349692","observation_id":"5194c9a0-ac5f-40ad-8991-e8ae836711df","resolution":{"observed_at":"2026-08-12T10:24:06.557031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.561574Z","title":"Behr, and Nancy Kan- wisher","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.561574Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:9fd6a0710b42ea791b2388fffa66c2040635f72486d354ddb0baadfef52caadf","observation_id":"d461ff02-49ca-4f0f-b995-dd15e6850e4e","resolution":{"observed_at":"2026-08-12T10:24:06.561574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-19T03:51:01.804369Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-12T10:24:06.565408Z","title":"Blink: Multimodal large lan- guage models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.565408Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:acaedbd23816db56ee6242f1a38bec4915fc67d08e2d1d3015e4d25ec4b9db0a","observation_id":"e878cf0e-87c1-4f84-935a-a03c82514ac9","resolution":{"observed_at":"2026-08-12T10:24:06.565408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-12T10:24:06.569011Z","title":"Simcse: Simple contrastive learning of sentence embeddings.ArXiv, abs/2104.08821, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.569011Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:a3b56280e55a54c1b446a47b0c29a0a1dcba1b766b0c52386afc298010776f63","observation_id":"8a04b953-ddb6-4016-954f-60eab479891d","resolution":{"observed_at":"2026-08-12T10:24:06.569011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.573075Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.573075Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:f91b0667cf3926b8a324603a1394ea2f777f14db46ffd1ad33e7fd5f26c6b465","observation_id":"ba3caaae-440e-4a34-952d-de863883b8e9","resolution":{"observed_at":"2026-08-12T10:24:06.573075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12508","last_updated":"2024-10-16T06:25:50Z","snapshot_observed_at":"2026-08-16T13:33:27.900852Z","submitted_at":"2024-07-17T11:45:02Z","title":"MERLIN: Multimodal Embedding Refinement via LLM-based Iterative Navigation for Text-Video Retrieval-Rerank Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12508","snapshot_observed_at":"2026-08-12T10:24:06.576490Z","title":"Merlin: Multimodal embedding re- finement via llm-based iterative navigation for text-video retrieval-rerank pipeline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.576490Z"},"links":{"cited_paper":"/paper/2407.12508","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b54383d60b2701b8685a556ac3cf58bb6bb4d763ddab7277f31e36b978a9cac3","observation_id":"0d28298b-388f-478a-9ab5-b897417304ed","resolution":{"observed_at":"2026-08-12T10:24:06.576490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.580093Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.580093Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:9c8be580d4a86752ae8287c8177ead4c968aa374b5780c0617958053ae0c7716","observation_id":"9451e03c-4b15-4071-9043-e8152a9dd315","resolution":{"observed_at":"2026-08-12T10:24:06.580093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-17T03:03:22.868290Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-12T10:24:06.587897Z","title":"In- context learning creates task vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.587897Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:8c613c345c8497f37878ec50716e580b074e4186e8fc177015034d1829e81b15","observation_id":"4d606d26-7a71-4abf-93d3-d203d269c733","resolution":{"observed_at":"2026-08-12T10:24:06.587897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.591537Z","title":"Incorporating structured representations into pretrained vi- sion \\& language models using scene graphs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.591537Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:fbd07e4bce227d1121842f2edc79fb3531ac11340c54ffe934f6b7c2b6865470","observation_id":"e74514f7-cbf2-4859-8909-dd1f81a646db","resolution":{"observed_at":"2026-08-12T10:24:06.591537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.595634Z","title":"Hinton G, van der Maaten","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.595634Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0caa5ba2f096a91f5bef15006b376908f149ccb07cfc9fad277b61775c91ea7c","observation_id":"aeda20c5-fa01-45f1-808a-bce0fd2ad5f2","resolution":{"observed_at":"2026-08-12T10:24:06.595634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.599489Z","title":"Finding visual task vectors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.599489Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:39b5c80e53697ec636e8222581b2d354af5f5d565e0d1c392f6af367ca211252","observation_id":"b3daabcc-1716-4cd4-a045-f9f13176563e","resolution":{"observed_at":"2026-08-12T10:24:06.599489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14610","last_updated":"2023-06-26T11:35:22Z","snapshot_observed_at":"2026-08-16T15:21:08.886812Z","submitted_at":"2023-06-26T11:35:22Z","title":"SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14610","snapshot_observed_at":"2026-08-12T10:24:06.603506Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.603506Z"},"links":{"cited_paper":"/paper/2306.14610","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:5d03d86c662f21808392c3893a510200256f4e111fec4b6a04b03aafc48e602c","observation_id":"74179b86-648b-4da6-a344-f76e81323af5","resolution":{"observed_at":"2026-08-12T10:24:06.603506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T10:24:06.607573Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.607573Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0891379db786b0d0f969304964359c0d166d0f612687ac2253b4096a56fa028f","observation_id":"4b4a7ca8-970e-422b-9686-e7b598e922e9","resolution":{"observed_at":"2026-08-12T10:24:06.607573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-19T13:03:41.721170Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-12T10:24:06.611337Z","title":"Multimodal task vectors enable many-shot multimodal in-context learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.611337Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:d371bd56e4206d61318b0d96b70b152fdb78f765142066c09704da1570979cd6","observation_id":"5be0f649-ec2a-418a-abd1-682a70217bc8","resolution":{"observed_at":"2026-08-12T10:24:06.611337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.615370Z","title":"Llm2clip: Powerful language model unlock richer visual representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.615370Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b3cffa2f46ea00269084829b4214d435cdb22f42f41803cec1d95b8fac039236","observation_id":"f7998ba8-cbd3-4ebe-a15e-14b1a6eadab3","resolution":{"observed_at":"2026-08-12T10:24:06.615370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.619429Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.619429Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:061d717fddf64ad71cd6bcdf09c6404036a2b1b0dbdcc393587406572c507f5a","observation_id":"1d62f176-d6c9-4df6-91af-6e84b65d0a47","resolution":{"observed_at":"2026-08-12T10:24:06.619429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14558","last_updated":"2020-09-30T10:59:20Z","snapshot_observed_at":"2026-08-16T19:16:55.363242Z","submitted_at":"2020-09-30T10:59:20Z","title":"Learning Object Detection from Captions via Textual Scene Attributes","version":1},"cited_work":{"arxiv_id":"2009.14558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.14558","snapshot_observed_at":"2026-08-12T10:24:07.458189Z","title":"Learning Object Detection from Captions via Textual Scene Attributes","venue":"cs.CV","work_id":"91ba64b4-4a4d-4a48-a070-be12b287145a","year":2020},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.623314Z"},"links":{"cited_paper":"/paper/2009.14558","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:05f1322d6b35ab7e424e6d97ef3780e43a85a0200ae72f0afed5a975cf361d9b","observation_id":"5bce9494-9555-495c-83a8-a5e40749a083","resolution":{"observed_at":"2026-08-12T10:24:07.463692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.627346Z","title":"Promptbert: Improving bert sen- tence embeddings with prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.627346Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:4775ceb577a505cb0f19eda399db69202625a81524e44dcae797bad80088a754","observation_id":"39148b52-46c9-476e-8be6-5ee3e96d056b","resolution":{"observed_at":"2026-08-12T10:24:06.627346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16645","last_updated":"2023-07-31T13:26:03Z","snapshot_observed_at":"2026-08-16T16:55:15.546882Z","submitted_at":"2023-07-31T13:26:03Z","title":"Scaling Sentence Embeddings with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16645","snapshot_observed_at":"2026-08-12T10:24:06.631097Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.631097Z"},"links":{"cited_paper":"/paper/2307.16645","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:5167c8a949f6c3b28cb581e8b4181c221d079cea7bf3b9b9a5a1b1765a06322d","observation_id":"c6802af6-95e4-4021-927d-ee99eaa91656","resolution":{"observed_at":"2026-08-12T10:24:06.631097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-17T17:47:50.871594Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-12T10:24:06.635140Z","title":"E5-v: Universal embeddings with mul- timodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.635140Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:7ec4e0ab96f3d2dc2460497de915bbda095886d21d129aa39f84f95525ccfa45","observation_id":"237a0d01-dcd2-4b71-b099-f69379f6f25c","resolution":{"observed_at":"2026-08-12T10:24:06.635140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.639187Z","title":"Domain specificity in face perception","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.639187Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:94f58ac66321457188d9f1087a407e730f8f7ee647ea7b4368209f969a0d595f","observation_id":"d7af35b5-88f0-4098-8bdf-6118b18bba8f","resolution":{"observed_at":"2026-08-12T10:24:06.639187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.642868Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.642868Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b730bc4a2f8987dd4af6b59d122b803c4142b11332357a844b74a42f20caf8ae","observation_id":"382a63d8-e84e-4863-bc52-dfba30d2f81f","resolution":{"observed_at":"2026-08-12T10:24:06.642868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T10:24:06.646670Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.646670Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:a7887dca94685f13abbc121a7bcaab4e9a08d4734e5d0dc72bfd8f21f63527a0","observation_id":"83ef24da-f997-4211-8e96-2834f6894f9c","resolution":{"observed_at":"2026-08-12T10:24:06.646670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.651010Z","title":"Autoregressive image generation us- ing residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.651010Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:539bfde68a90ae745878ec2313f880a7fbdff2d0870916168be6545e89cc2f80","observation_id":"910264f5-b8ec-440c-a391-c7395233d91d","resolution":{"observed_at":"2026-08-12T10:24:06.651010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.654901Z","title":"Meta-task prompting elicits embeddings from large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.654901Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:edce4ef151ee2d3ac2d9d7a5dc68ae1e4d482c5c640192f1e59b72bbba94b539","observation_id":"d4161a6d-6e21-4c15-95eb-f4aebf9e4a94","resolution":{"observed_at":"2026-08-12T10:24:06.654901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.659016Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.659016Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:aeef4e130ebfda72f2e52ffbfe66ba0c28fbaee532d67710e513cc4b80dca5dd","observation_id":"9690ea70-a02c-469a-9577-a87499e1b821","resolution":{"observed_at":"2026-08-12T10:24:06.659016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T10:24:06.662505Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.662505Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:1c38f6f1729f5e6d9c5c54686ad96535b3b5c44674e741cc1e96a46e7ca0dae9","observation_id":"9c700684-3f0a-4297-863e-d216f8f1f69c","resolution":{"observed_at":"2026-08-12T10:24:06.662505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14669","last_updated":"2025-06-10T09:47:04Z","snapshot_observed_at":"2026-08-16T13:07:56.671921Z","submitted_at":"2024-10-18T17:58:21Z","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14669","snapshot_observed_at":"2026-08-12T10:24:06.666386Z","title":"Natural- bench: Evaluating vision-language models on natural ad- versarial samples","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.666386Z"},"links":{"cited_paper":"/paper/2410.14669","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:ea1328dd97124353afb0309358ed3e6bbdb51744f54472ff31baea7d0a28ba63","observation_id":"17c967a0-1d3c-453f-b983-174d6b3af53b","resolution":{"observed_at":"2026-08-12T10:24:06.666386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T10:24:06.670488Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.670488Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0f2bf68cc302f324656dbab0ffee79053076b4e44e3f0ba3bf4cae5c0ff5cf1d","observation_id":"ac48e6c0-5c35-4fbb-8baf-fb982d627ce6","resolution":{"observed_at":"2026-08-12T10:24:06.670488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-18T14:15:48.297060Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T10:24:06.674598Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.674598Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:79042cc323d1d780e60e81b7e385149ef539cd3be7fea8418248b2a431ef0d8b","observation_id":"eed1a4c1-c4c0-487e-837b-c911053a739d","resolution":{"observed_at":"2026-08-12T10:24:06.674598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.678514Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.678514Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:17cc15e2a488ef4903c85a80b6a90382a40e9e478be22b4dc64eb355bd89e591","observation_id":"a0f68e6c-677c-4fd6-98cc-0496d8fdf931","resolution":{"observed_at":"2026-08-12T10:24:06.678514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15710","last_updated":"2024-08-29T14:47:37Z","snapshot_observed_at":"2026-08-16T13:23:14.561633Z","submitted_at":"2024-08-28T11:18:06Z","title":"Conan-embedding: General Text Embedding with More and Better Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15710","snapshot_observed_at":"2026-08-12T10:24:06.682186Z","title":"Conan- embedding: General text embedding with more and better negative samples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.682186Z"},"links":{"cited_paper":"/paper/2408.15710","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:1cc306ff81833757a1ffe00b082c2326515a66436a0972cad00f5d4ae3b2f71b","observation_id":"417cda0d-77b3-4fe0-b33d-6b42dddfdb36","resolution":{"observed_at":"2026-08-12T10:24:06.682186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-12T10:24:06.686196Z","title":"Prefix-tuning: Optimiz- ing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.686196Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:a88d972c6b6653fe73af8f7ef11b0ee32279b4cf4b01fe666ec9040e6cd66228","observation_id":"14dceaea-d9d6-4ae5-9a85-08b932e4f859","resolution":{"observed_at":"2026-08-12T10:24:06.686196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.690378Z","title":"Scaling language-image pre- training via masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.690378Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:c7e179c7e2f4872a41477bf8498c474f418d1e4b1c40cb7406b105a24e8a002c","observation_id":"42edebf6-d422-4266-9906-fe60478ae4e0","resolution":{"observed_at":"2026-08-12T10:24:06.690378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10814","last_updated":"2024-10-16T02:00:24Z","snapshot_observed_at":"2026-08-16T13:09:28.896716Z","submitted_at":"2024-10-14T17:59:44Z","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10814","snapshot_observed_at":"2026-08-12T10:24:06.698630Z","title":"Your mixture-of-experts llm is secretly an embedding model for free","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.698630Z"},"links":{"cited_paper":"/paper/2410.10814","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:586fa3a44b68b504371f3da07b26b4c00579b47747ede1f2f1ae16bf9fdb9da5","observation_id":"970b216e-bf6d-4868-a1c3-aa7efe0d6b62","resolution":{"observed_at":"2026-08-12T10:24:06.698630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11235","last_updated":"2025-02-11T03:32:09Z","snapshot_observed_at":"2026-08-16T13:09:20.782776Z","submitted_at":"2024-10-15T03:40:20Z","title":"GT2Vec: Large Language Models as Multi-Modal Encoders for Text and Graph-Structured Data","version":2},"cited_work":{"arxiv_id":"2410.11235","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11235","snapshot_observed_at":"2026-08-12T10:24:07.326298Z","title":"GT2Vec: Large Language Models as Multi-Modal Encoders for Text and Graph-Structured Data","venue":"cs.CL","work_id":"b542ec28-53c0-4524-ab4f-8b387be87e4c","year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.702316Z"},"links":{"cited_paper":"/paper/2410.11235","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:60ce6846bce0b3ee4e1de359e386b09a3bc59f30adb0c457fb0786e548086a39","observation_id":"d6aef712-9564-4205-a949-f92b788859cd","resolution":{"observed_at":"2026-08-12T10:24:07.330290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.707493Z","title":"Maire, Serge J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.707493Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0efeb77391b1f31651bf439b26f3bad63aa4dd46270ac4fd5b7c99248d276c05","observation_id":"fecdeb87-71e5-4db3-b77f-bc6f4f83444f","resolution":{"observed_at":"2026-08-12T10:24:06.707493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-08-16T15:27:00.450500Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-12T10:24:06.711881Z","title":"Revisiting the role of lan- guage priors in vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.711881Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:f346359510f0a05b954a172a4fbf9fb7537687d0eae6757f00941a597e25a2b8","observation_id":"32744962-ab80-4aa2-9641-9069a427bd09","resolution":{"observed_at":"2026-08-12T10:24:06.711881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.716359Z","title":"Multimodality helps unimodality: Cross- modal few-shot learning with multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.716359Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:ca4dbd86f76e62ebef92fb870c19061f3eb18bcd388801b88865190d83d0a532","observation_id":"7eae4df1-b646-42d4-9a84-4703e2aef339","resolution":{"observed_at":"2026-08-12T10:24:06.716359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.720415Z","title":"Evaluating text-to-visual generation with image- to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.720415Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:c272e31a1c77f144622cdcda56056246ad2f8c329f07ed379ed76e396bd243fe","observation_id":"f529054a-834f-4495-80b8-93c892edf478","resolution":{"observed_at":"2026-08-12T10:24:06.720415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.724414Z","title":"Evaluating text-to-visual generation with image- to-text generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.724414Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:a437a639ebfc3dec3cd174d40f3cffa68e87115132a4a606f1c66853fc5c2494","observation_id":"f3642c95-4b37-43e5-a23d-d6fa293ad50b","resolution":{"observed_at":"2026-08-12T10:24:06.724414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.728782Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.728782Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:e9d86ae4832a21fa90d04479223a1af5b0ce2f3c13deb3613c08e3bc12a09037","observation_id":"0ac9665c-8893-4879-a96f-923ed2e325ab","resolution":{"observed_at":"2026-08-12T10:24:06.728782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.733026Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.733026Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:e6000cd345ac9d3e2bf7fc733af0393b9c9156974773f5eb4869e37cb9c37368","observation_id":"61d8578c-b584-4850-a45e-76d8c05952fc","resolution":{"observed_at":"2026-08-12T10:24:06.733026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18348","last_updated":"2023-11-29T05:32:24Z","snapshot_observed_at":"2026-08-16T14:49:54.620099Z","submitted_at":"2023-10-23T04:35:58Z","title":"Meaning Representations from Trajectories in Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18348","snapshot_observed_at":"2026-08-12T10:24:06.737206Z","title":"Meaning representations from trajectories in autoregressive models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.737206Z"},"links":{"cited_paper":"/paper/2310.18348","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:d4aea7aa633a996ccedc8bca4161d7de7157ecae94743237aa21c0fe472c3c34","observation_id":"81031fed-02db-49cf-93c1-094d24034ad3","resolution":{"observed_at":"2026-08-12T10:24:06.737206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.741457Z","title":"Decision-making with auto-encoding variational bayes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.741457Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:46fd993b4ae9efb61f868f198a5c7a16f89c481160f0a450e56363c8a9c1e026","observation_id":"3808aeeb-1ae9-4b0e-bee6-da5ed897c2b9","resolution":{"observed_at":"2026-08-12T10:24:06.741457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.746257Z","title":"Decision-making with auto-encoding variational bayes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.746257Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:d80993de550d6c9ae3f523858517ed2508c19b02fb48f83aaa101fcf64e6b3ca","observation_id":"860f3a34-4cc4-46b0-a8e6-eba528d8b32f","resolution":{"observed_at":"2026-08-12T10:24:06.746257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T10:24:06.750576Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.750576Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:8dff9c4e70c00a535e016621f8946d9e32f08924c55444e42f66db4b9a7d2a3e","observation_id":"10691041-26b8-4e48-b5e5-e17e4edce9ba","resolution":{"observed_at":"2026-08-12T10:24:06.750576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.754674Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.754674Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:5feea180439f78fb7d271eae86ce2997e2deb87441821314712db794a8cb60ac","observation_id":"10a89739-248d-433c-a1cc-7c3a993b0531","resolution":{"observed_at":"2026-08-12T10:24:06.754674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.758709Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.758709Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b92478ba5cafbb5ba575def95e866e6dd876afadbb6e451368de98a079214c5c","observation_id":"a571fcb7-0b4d-464c-90b0-d04a4c02e882","resolution":{"observed_at":"2026-08-12T10:24:06.758709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.762358Z","title":"Compositional chain of thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.762358Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:e2af20b513231b3ab425d5640dd132b2d68a710f2f3943fc9f0f05777c2a8793","observation_id":"a0e5e3f9-82ab-4d97-b0c0-b574445b0d8f","resolution":{"observed_at":"2026-08-12T10:24:06.762358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.766043Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.766043Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:6a48dd8ddb92bd1b56365ac47c252640108b2326674dacacb52e812c94f262c6","observation_id":"defbcfcb-9ee4-4916-a941-7e112781b921","resolution":{"observed_at":"2026-08-12T10:24:06.766043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08877","last_updated":"2021-12-14T06:19:33Z","snapshot_observed_at":"2026-08-16T18:02:11.360736Z","submitted_at":"2021-08-19T18:58:02Z","title":"Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08877","snapshot_observed_at":"2026-08-12T10:24:06.770554Z","title":"Hall, Daniel Matthew Cer, and Yinfei Yang","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.770554Z"},"links":{"cited_paper":"/paper/2108.08877","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b25bbd7bbd3d28eb8fc624748ae4ba75263679f7cb25e28b86541e7951134227","observation_id":"fc664de4-3dde-4be6-9293-770fa48bb75d","resolution":{"observed_at":"2026-08-12T10:24:06.770554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07899","last_updated":"2021-12-15T05:33:27Z","snapshot_observed_at":"2026-08-16T17:34:32.967211Z","submitted_at":"2021-12-15T05:33:27Z","title":"Large Dual Encoders Are Generalizable Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07899","snapshot_observed_at":"2026-08-12T10:24:06.775124Z","title":"Hall, Ming-Wei Chang, and Yinfei Yang","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.775124Z"},"links":{"cited_paper":"/paper/2112.07899","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:746e726a723aa31457a0caeec4f2f1e39bfcd7271a4bc4d70c560997b91063fc","observation_id":"3091e1f7-985f-49cf-8c5c-7448981a64db","resolution":{"observed_at":"2026-08-12T10:24:06.775124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.779744Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.779744Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:b8e9e3952c0996af2db7e3e9d72a9d82e88acb8e240541a3bf17bf4f254fc953","observation_id":"0670cd0b-a8c1-446e-9b06-3a9ee455f178","resolution":{"observed_at":"2026-08-12T10:24:06.779744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-18T21:12:50.808922Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-12T10:24:06.784087Z","title":"In- context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.784087Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:9635de58bd81d3cfa8a81cb634157f4b59962d4df6d2f12cb444dc0ea995ebed","observation_id":"0e46d77f-b919-4518-9962-f5637ed0830b","resolution":{"observed_at":"2026-08-12T10:24:06.784087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T10:24:06.787678Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.787678Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:f217708f4525ce0e6378904b247a4720e65be10734ab6a8854f137c2c2078199","observation_id":"5c1338aa-59ca-4408-93e8-256fda08462f","resolution":{"observed_at":"2026-08-12T10:24:06.787678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-12T10:24:06.791666Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sand- hini Agarwal, Katarina Slama, Alex Ray, John Schul- man, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.791666Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:fbf3d09d68eb9b30a9e4c19681a9ae154087d4e26c5b2bfdab5aeb4750cee7c1","observation_id":"010f9609-f6f2-46f5-abea-2eb796dc0a0d","resolution":{"observed_at":"2026-08-12T10:24:06.791666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:23.002705Z","title":"Cats and dogs","venue":null,"work_id":"0a397cc2-9d2e-4ade-a4f0-6c14ab1747f8","year":2012},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.796238Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:e2d91fd33966ff5fb0af864c0dff724f60f44d363df94bcea586aa79d5b6d1ea","observation_id":"8a400b89-6cda-4ef6-ba50-1a486ee49972","resolution":{"observed_at":"2026-08-12T10:24:23.006907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.800059Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.800059Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:fafcaad89f0f6d9843b06ffb0d4d93b3736371f88a5fe2f5c07eb67a640e33e2","observation_id":"f67ca58f-9e22-46dc-9068-2da43c2402c9","resolution":{"observed_at":"2026-08-12T10:24:06.800059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.982630Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"2f708dbc-ae97-46ec-99d4-1897a5d72766","year":2014},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.803994Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:bf6ddc3ccf1b861bd517d47fb13410fab86aa4c6461314c9b8b07ac7ebcc2b67","observation_id":"01b999a2-0cd5-4f0e-a976-53c2eaa49278","resolution":{"observed_at":"2026-08-12T10:24:22.986807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.808370Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.808370Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:badb7b75d5a5f48c042334e8cf29b3504e80cb97f5cd86bff20a060d65db072c","observation_id":"9e6dcf0b-c3ac-441d-ae24-280d741e57fb","resolution":{"observed_at":"2026-08-12T10:24:06.808370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.962061Z","title":"Direct 11 preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"3c30d5d4-5920-43b4-934a-62a37441161e","year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.813146Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:41e007ad0268bad4665bdc35e23a3517a855b5b6609012cae9e975c63f1296bc","observation_id":"d8c24296-ec00-47bb-a410-22800db5ee67","resolution":{"observed_at":"2026-08-12T10:24:22.966833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T10:24:06.817705Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.817705Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:bfa4efa6f06dc10d9191a565ded86583cf67e26ee005b59eccc61855f4f2fa59","observation_id":"8cbff334-af6f-467b-8790-ad45513f619c","resolution":{"observed_at":"2026-08-12T10:24:06.817705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.950192Z","title":"Sentence-bert: Sen- tence embeddings using siamese bert-networks","venue":null,"work_id":"7a435ea5-aeb8-4dce-8f4a-4cfc2d5bc3bf","year":2019},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.822626Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:4f3d00e54b27d428e7743f5e5f83e74f30f5d3989ee5de3452440c0237709e3b","observation_id":"3d3e79ea-988c-4ebf-82db-4d101074fea0","resolution":{"observed_at":"2026-08-12T10:24:22.954210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.937526Z","title":"Parallel distributed processing, volume 1: Ex- plorations in the microstructure of cognition: Foundations","venue":null,"work_id":"9ef08e97-dc54-4413-a9c3-40cf2d85c20e","year":1986},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.826447Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:ecfa50070202b25d3cfdde584fdfe0f61c90bf3e1ca393fc53eb215e9d797dcf","observation_id":"d5dc1b9c-c76a-4329-a7d7-cba5c40cfc19","resolution":{"observed_at":"2026-08-12T10:24:22.942255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.924362Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":"7fe6c872-e656-4d9e-a081-9faaefc54029","year":2015},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.830396Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:7ffe362e077a5bd64ada65447b6ca9e138d9279d3763b0a6a6b1f1264691b0f7","observation_id":"a95d2ca8-ef8d-456d-b84a-7e01e8fe4a4e","resolution":{"observed_at":"2026-08-12T10:24:22.928840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:06.833951Z","title":"Understanding machine learning: From theory to algorithms","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.833951Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:af035a3f8a63166359e6ee9894347e0de68cc9db1824e53e70ede28a9d12c71a","observation_id":"48d7cab2-082e-4b9d-95a3-2acea89ca86c","resolution":{"observed_at":"2026-08-12T10:24:06.833951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.904364Z","title":"Towards vqa models that can read","venue":null,"work_id":"37ce1eac-b6a0-45be-9f4d-7150ce050f8c","year":2019},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.837472Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:02b788979dd4a3bcd98980523a3e555d1ff2cdbbd86feb36b53c1a51182ebfd3","observation_id":"a23325ca-107e-444b-bcef-bb2ae5f3046d","resolution":{"observed_at":"2026-08-12T10:24:22.908716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.891370Z","title":"Singh, Stephanie C.Y","venue":null,"work_id":"2fb2f291-d52d-4976-a449-058cfe01adf0","year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.841166Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:88ac9ff56a84236c52eae05dcf16db2c242d9e31e7be5a5a53f289de1090245b","observation_id":"b7abfb13-0a01-44e0-a800-cbe89f29c988","resolution":{"observed_at":"2026-08-12T10:24:22.895527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.877469Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"496986f7-428d-49b0-86a9-2143185f2682","year":2013},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.845605Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:47aaf1e8cac2bb6be3943b44137c02dff42acc8c8a4e685e65bd8b00f9c8c1a3","observation_id":"0e01f113-c27c-4648-8f9c-c3b1c9469ffb","resolution":{"observed_at":"2026-08-12T10:24:22.882259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.863657Z","title":"Text classification via large language models","venue":null,"work_id":"29f660d0-e25a-48d6-926a-bace24add448","year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.849767Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0da1dbd860527800cdcbe688d7443ee6512887b7d3b3aac826902a19f3364192","observation_id":"bac12034-a2ca-4b81-bad1-062acff02f6b","resolution":{"observed_at":"2026-08-12T10:24:22.868199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T10:24:06.853805Z","title":"Gemini 1.5: Unlocking multimodal un- derstanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.853805Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:6f10c997a996cb270e0d990cba3d959a68647b595a934f92ed737cc1d79d1762","observation_id":"d04e8732-fb87-4c32-a3a7-1fe897211233","resolution":{"observed_at":"2026-08-12T10:24:06.853805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T10:24:06.857635Z","title":"Gem- ini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.857635Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:524444ecc332ce240ca34b24b06f99ac6aa17d8418d8ca48b0d4dbc012c034cc","observation_id":"72b9cea0-707c-416a-9982-4fed9c1b8160","resolution":{"observed_at":"2026-08-12T10:24:06.857635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.851018Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":"0eadc493-f841-4de8-a48c-9978db036ccf","year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.861672Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:a002fdadb9a8f2d4ac2c8544622ea26db25fdaf8d0da5fcfa4760a7ec3b76f7f","observation_id":"1a2f1d75-2de5-4269-b006-4b69ab2ba907","resolution":{"observed_at":"2026-08-12T10:24:22.855299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-19T06:08:25.062288Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-12T10:24:06.870004Z","title":"Func- tion vectors in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.870004Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:d6ccae5ae451f733a515db82fce459d57b37af003f8979450ab0c4cd99e32da6","observation_id":"d86023fd-50ae-405b-9975-d5d6ab24ea65","resolution":{"observed_at":"2026-08-12T10:24:06.870004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.838570Z","title":"Turk and Alex Pentland","venue":null,"work_id":"e95beafc-485e-44ce-9254-2178925491e3","year":1991},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.873678Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:7ab0a2e96c637a360240e73174a8589ea100ce2fcb14a8fef509c108db773c5b","observation_id":"a6f4c5bb-3d3e-4510-b508-11423e45f1ac","resolution":{"observed_at":"2026-08-12T10:24:22.842687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-14T20:17:29.355571Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-12T10:24:06.877742Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.877742Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:e34e2af249009cf2ae09c626b99fe4edf5cf9c5fb702a5e9c62a68280584b2be","observation_id":"442f34b2-5397-4270-beb1-0e3f5c570d8c","resolution":{"observed_at":"2026-08-12T10:24:06.877742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:24:22.825289Z","title":"Belongie","venue":null,"work_id":"0fb68e1c-0c98-4ea1-b6bc-32320328c849","year":2011},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.882343Z"},"links":{"citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:31ed76acc7bf01669d21473bf7029edd505b2b8f1f463595df85b51083514de7","observation_id":"3ddc2d99-ec51-42ac-87b4-7135453d20db","resolution":{"observed_at":"2026-08-12T10:24:22.829462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00368","last_updated":"2024-05-31T07:22:01Z","snapshot_observed_at":"2026-08-16T14:30:41.754354Z","submitted_at":"2023-12-31T02:13:18Z","title":"Improving Text Embeddings with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00368","snapshot_observed_at":"2026-08-12T10:24:06.886211Z","title":"Improving text embed- dings with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.886211Z"},"links":{"cited_paper":"/paper/2401.00368","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0c5cd2a48068e1e3c86f25567fa685e8f5334948f2fff8e5f0feb9abcb63485e","observation_id":"61fa933b-adb0-4852-9c4e-78fca8c13fe9","resolution":{"observed_at":"2026-08-12T10:24:06.886211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T10:24:06.890364Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.890364Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:65c86b0ad47b09cd6319e1426422f4ea9e3337545bc1b6539b56932af62cc52c","observation_id":"bc3887f1-26e9-417d-b89f-df56945ae432","resolution":{"observed_at":"2026-08-12T10:24:06.890364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11206","last_updated":"2024-01-20T10:41:03Z","snapshot_observed_at":"2026-08-19T06:38:15.589047Z","submitted_at":"2024-01-20T10:41:03Z","title":"InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11206","snapshot_observed_at":"2026-08-12T10:24:06.894730Z","title":"Inferaligner: Inference-time alignment for harm- lessness through cross-model guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.894730Z"},"links":{"cited_paper":"/paper/2401.11206","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:0abb39d94a80d2a4e3579e689ecc5f52a7f4181697215b8f83baa5fb4854ce5c","observation_id":"72088dc8-cff8-4351-bf27-2a52e4338ed0","resolution":{"observed_at":"2026-08-12T10:24:06.894730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-18T18:30:18.105306Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-12T10:24:06.899322Z","title":"Internvideo2: Scaling video foundation models for multi- modal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.899322Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:91ce976e0c16aed9dcf4b4899d279cf7b2e432accb1aff8c6a566f72f5a13f70","observation_id":"3493a6be-8d70-4e44-b9ac-0abe3377e6cf","resolution":{"observed_at":"2026-08-12T10:24:06.899322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01044","last_updated":"2023-12-02T06:33:23Z","snapshot_observed_at":"2026-08-18T06:04:14.832506Z","submitted_at":"2023-12-02T06:33:23Z","title":"Large Language Models Are Zero-Shot Text Classifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01044","snapshot_observed_at":"2026-08-12T10:24:06.903563Z","title":"Large language models are zero-shot text classifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.903563Z"},"links":{"cited_paper":"/paper/2312.01044","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:ff9a998ef31723feb12e5ce2b667b9516bba593f25a7ebc0ddf70cd7b9de86bf","observation_id":"66ed4700-903a-41f0-b7e8-53b3b5f642c3","resolution":{"observed_at":"2026-08-12T10:24:06.903563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-12T10:24:06.907862Z","title":"Dai, and Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.907862Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:8e9117178cf07bc205d59c95c8ae6f005afa6985ac6c3e321124cc0b84c1bc42","observation_id":"8f5c77e1-fc00-44cd-9ae4-3bf37f86797e","resolution":{"observed_at":"2026-08-12T10:24:06.907862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-12T10:24:06.912216Z","title":"Xia, Quoc Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.912216Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:73140ad6f30acd4ca66fb8c6c22f6af7f22ec754e3ef1542b05da4c9467b94ec","observation_id":"e0cd3042-7589-4866-b072-5179448ce79b","resolution":{"observed_at":"2026-08-12T10:24:06.912216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15765","last_updated":"2024-05-24T17:58:38Z","snapshot_observed_at":"2026-08-16T13:49:38.853346Z","submitted_at":"2024-05-24T17:58:38Z","title":"Scaling Laws for Discriminative Classification in Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.15765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15765","snapshot_observed_at":"2026-08-12T10:24:07.073355Z","title":"Scaling Laws for Discriminative Classification in Large Language Models","venue":"cs.CL","work_id":"0df4f0cd-e834-4b35-9fb5-b3cffddc18dd","year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.917263Z"},"links":{"cited_paper":"/paper/2405.15765","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:ece6084de9291cc6469f347fc145914e52dc4ffdc2fd8af274c17054903f3ca0","observation_id":"0a9b37a6-4528-40d3-ab9f-fb380a97fed8","resolution":{"observed_at":"2026-08-12T10:24:07.079988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":115},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 115 outbound references and 3 inbound Pith citation observations for arXiv:2412.00142."}