{"as_of":"2026-08-13T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5544bbec312078e9a57df03b0aaa4c2d31d33038e2a1ba49b0fde7089784434d","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:47:52.532503Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.19289/citation-record","integrity":"/paper/2412.19289/integrity","json":"/paper/2412.19289/citation-record.json","paper":"/paper/2412.19289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.337518Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.337518Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:3ac26b41896edbcae1152281b9421aa79af5ebedc033284c83a998831e6d1d2a","observation_id":"226f241b-a6e8-4021-897a-0b4095f4c58e","resolution":{"observed_at":"2026-08-11T00:47:52.337518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.342475Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.342475Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:aa0552b8606837b04dfb048c7091ca46c3ea7da8fb36802e2eed3f38f076d00b","observation_id":"0dae187d-1325-49b4-b159-77c04d02c43b","resolution":{"observed_at":"2026-08-11T00:47:52.342475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.347000Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.347000Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:4e4d8f1881beb24dcec7358a45d8d006e176898393db519a0b907ad1a7e78bea","observation_id":"7a818e42-d0de-4553-b90a-7c042df8278c","resolution":{"observed_at":"2026-08-11T00:47:52.347000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08822","last_updated":"2016-07-29T14:26:27Z","snapshot_observed_at":"2026-08-13T00:07:09.124752Z","submitted_at":"2016-07-29T14:26:27Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08822","snapshot_observed_at":"2026-08-11T00:47:52.350966Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.350966Z"},"links":{"cited_paper":"/paper/1607.08822","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:52c295969f43641f0c28f9db71529e3c34eb82d38ea1392ddc0188311fdd55f3","observation_id":"cff45548-ce89-437c-9505-aa5874459687","resolution":{"observed_at":"2026-08-11T00:47:52.350966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-13T16:10:42.555436Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-11T00:47:52.355230Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.355230Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:c02c718e8e9a07a7041754f6dc09bbf23ebd0264b62efd9090114ab7658770c6","observation_id":"d878a7b6-5845-47db-b99b-6ce4702cdc54","resolution":{"observed_at":"2026-08-11T00:47:52.355230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10492","last_updated":"2022-02-21T19:04:46Z","snapshot_observed_at":"2026-08-13T16:37:07.716150Z","submitted_at":"2022-02-21T19:04:46Z","title":"CaMEL: Mean Teacher Learning for Image Captioning","version":1},"cited_work":{"arxiv_id":"2202.10492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.10492","snapshot_observed_at":"2026-08-11T00:47:52.928433Z","title":"CaMEL: Mean Teacher Learning for Image Captioning","venue":"cs.CV","work_id":"6adf8e1f-5245-4f65-90c3-7b47e6ab5b82","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.359461Z"},"links":{"cited_paper":"/paper/2202.10492","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:89c5c7955b2dfc89e6bc2c518148c97ee47c162da6c33790fe9cff0d40f2b0c5","observation_id":"28adb247-1126-4345-9a50-40070c3b7b43","resolution":{"observed_at":"2026-08-11T00:47:52.932804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T00:47:52.363799Z","title":"K.; Riquelme, C.; Steiner, A.; Angelova, A.; Zhai, X.; Houlsby, N.; and Soricut, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.363799Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:fab600e868d925c7164fe43722d9d02bc55f3fe9ec3af9b47e9f5c2265653efb","observation_id":"a8898f81-acc2-45bb-a3c5-fa492e59170d","resolution":{"observed_at":"2026-08-11T00:47:52.363799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.367994Z","title":"E.; Stoica, I.; and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.367994Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:7ecdf88b984db8a4ee0c65b4431a48fa17c64795b7c4b5205c7e1722cfd2bcc6","observation_id":"e671ddb3-7ad5-420c-9562-2c709005c4c4","resolution":{"observed_at":"2026-08-11T00:47:52.367994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.049971Z","title":"J.; and Lavie, A","venue":null,"work_id":"88dc4c31-4147-4183-9424-f7db6d8bb1ff","year":2014},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.372139Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:eafd1e9ec9f8660f7def5dd428d55cd1772e5f9e913aaf103610d775578da633","observation_id":"8aa8e136-3c00-4fcf-9234-2aebaf9832a4","resolution":{"observed_at":"2026-08-11T00:47:53.053822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16525","last_updated":"2023-07-31T09:47:06Z","snapshot_observed_at":"2026-08-13T10:44:20.365928Z","submitted_at":"2023-07-31T09:47:06Z","title":"Transferable Decoding with Visual Entities for Zero-Shot Image Captioning","version":1},"cited_work":{"arxiv_id":"2307.16525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16525","snapshot_observed_at":"2026-08-11T00:47:52.902949Z","title":"Transferable Decoding with Visual Entities for Zero-Shot Image Captioning","venue":"cs.CV","work_id":"7e1fa52c-e237-4123-9301-9c5f736e8c4f","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.377156Z"},"links":{"cited_paper":"/paper/2307.16525","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:f78695f86cc25af04792dbc4c9eef129fecb5886082b59a52f2dfb034386ae95","observation_id":"023456da-f5ef-4eab-86e7-e8132b51b89e","resolution":{"observed_at":"2026-08-11T00:47:52.907331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15723","last_updated":"2021-06-02T12:41:36Z","snapshot_observed_at":"2026-08-10T05:00:18.764813Z","submitted_at":"2020-12-31T17:21:26Z","title":"Making Pre-trained Language Models Better Few-shot Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15723","snapshot_observed_at":"2026-08-11T00:47:52.381700Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.381700Z"},"links":{"cited_paper":"/paper/2012.15723","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:b724b65f068486295516abfa441fd03b7d3fd34f639e689bf812af76cfcc44cb","observation_id":"b9500f88-5c56-4d37-8c59-36dc115bd496","resolution":{"observed_at":"2026-08-11T00:47:52.381700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01998","last_updated":"2024-03-31T22:58:09Z","snapshot_observed_at":"2026-08-13T05:10:18.425060Z","submitted_at":"2023-12-04T16:22:06Z","title":"Language-only Efficient Training of Zero-shot Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01998","snapshot_observed_at":"2026-08-11T00:47:52.386106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.386106Z"},"links":{"cited_paper":"/paper/2312.01998","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:5200c0e80be566de5dfa23a98ca4c482cfad7b7c52f7cc969ae5e830092723bc","observation_id":"49d42f1d-8228-409b-9826-da1b7e270051","resolution":{"observed_at":"2026-08-11T00:47:52.386106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12233","last_updated":"2022-03-26T02:02:42Z","snapshot_observed_at":"2026-08-13T17:28:43.930843Z","submitted_at":"2021-11-24T02:30:22Z","title":"Scaling Up Vision-Language Pre-training for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12233","snapshot_observed_at":"2026-08-11T00:47:52.390168Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.390168Z"},"links":{"cited_paper":"/paper/2111.12233","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:67f756b552f8eb3f520263f50fdbe2af84e4a181425a5177aaca189742a9b6f1","observation_id":"f8c9a401-df39-491f-bc5d-a55c981f36aa","resolution":{"observed_at":"2026-08-11T00:47:52.390168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05221","last_updated":"2023-04-03T08:32:39Z","snapshot_observed_at":"2026-08-13T13:24:19.427486Z","submitted_at":"2022-12-10T06:17:56Z","title":"REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05221","snapshot_observed_at":"2026-08-11T00:47:52.394111Z","title":"A.; and Fathi, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.394111Z"},"links":{"cited_paper":"/paper/2212.05221","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e8cbb0a73558b1415acdab00ad7c6267cba9b5bff8111d01279fdde6ed00798f","observation_id":"0d0790bb-0b6f-4354-a632-5587ddb2eefb","resolution":{"observed_at":"2026-08-11T00:47:52.394111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-11T01:45:10.663640Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T00:47:52.398127Z","title":"V.; Sung, Y.; Li, Z.; and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.398127Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:3cbc24c1a540e68a8de0a23ddac745f848378bba56ac8e5dd5199f9a2e08d83b","observation_id":"cdcd0b62-1ac9-42fd-beca-718e10dd8200","resolution":{"observed_at":"2026-08-11T00:47:52.398127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12119","last_updated":"2022-07-20T15:47:22Z","snapshot_observed_at":"2026-08-13T16:17:35.945896Z","submitted_at":"2022-03-23T01:17:16Z","title":"Visual Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12119","snapshot_observed_at":"2026-08-11T00:47:52.402265Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.402265Z"},"links":{"cited_paper":"/paper/2203.12119","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:b3b9027d4a8fcbfa4aac314d92e5ea123078e08950d153ecb00ae306c6fab64a","observation_id":"68cfa15d-5001-412c-8014-6bba038e47b0","resolution":{"observed_at":"2026-08-11T00:47:52.402265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08734","last_updated":"2017-02-28T10:42:31Z","snapshot_observed_at":"2026-07-06T05:31:42.551086Z","submitted_at":"2017-02-28T10:42:31Z","title":"Billion-scale similarity search with GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.08734","snapshot_observed_at":"2026-08-11T00:47:52.406187Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.406187Z"},"links":{"cited_paper":"/paper/1702.08734","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:990484abbcb50c5b1cc06bbe50a081773fc00c034a4379580f6f0e6bf743f0ac","observation_id":"f6844831-ca97-454d-923c-9795e2a6a256","resolution":{"observed_at":"2026-08-11T00:47:52.406187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.2306","last_updated":"2015-04-14T05:02:53Z","snapshot_observed_at":"2026-07-06T04:02:50.341299Z","submitted_at":"2014-12-07T02:36:07Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.2306","snapshot_observed_at":"2026-08-11T00:47:52.410230Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.410230Z"},"links":{"cited_paper":"/paper/1412.2306","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ca8834b165c8a6b6eac0ae8f9c8acf04f029e9c5576873b0ad5f92fed77b3375","observation_id":"fbf6f1ea-74aa-4474-9dad-76ac4b4f5126","resolution":{"observed_at":"2026-08-11T00:47:52.410230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T00:47:52.414573Z","title":"P.; and Welling, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.414573Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:f0d073399fcf050ba8456e390052ed16c08d26a3c6deccbd7be8e9f6fc278224","observation_id":"2e8b41ff-a450-4e9c-af0d-c5631d105fa0","resolution":{"observed_at":"2026-08-11T00:47:52.414573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-11T00:47:52.418671Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.418671Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:8ff4614a986f4c9128f95a39670081658b3302d3ceaa3d8e488c438bc1a8b1cb","observation_id":"778da2bf-ee88-4ffc-a9d5-3a556e13dc02","resolution":{"observed_at":"2026-08-11T00:47:52.418671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T00:47:52.422712Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.422712Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:7c015671da1171befdbb08dff5d20c4214b361d43e0477af0005fb8872ed543e","observation_id":"59ca8558-0ed1-43ae-bf88-aa1a3ad6f4a5","resolution":{"observed_at":"2026-08-11T00:47:52.422712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15879","last_updated":"2024-04-07T14:43:38Z","snapshot_observed_at":"2026-08-13T05:16:59.604916Z","submitted_at":"2023-11-27T14:51:37Z","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15879","snapshot_observed_at":"2026-08-11T00:47:52.426766Z","title":"M.; Sugimoto, A.; and Nakayama, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.426766Z"},"links":{"cited_paper":"/paper/2311.15879","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ed17bd6b8b9fba9a7c0f30e81ad95cfa4cbdfd76f7ca2c2c1ad32cad4afa97d2","observation_id":"230e9ed6-070d-49f1-8d6d-6f975a8b0aa3","resolution":{"observed_at":"2026-08-11T00:47:52.426766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.037789Z","title":null,"venue":null,"work_id":"698ddc26-2136-4714-a7dd-6c3d11ed202f","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.430620Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:69fd0def1bab05c3bc4297c902292940358d3901a6df881c5d019c588eb3a196","observation_id":"a9f4eac5-2562-4f10-b109-2dda3ee40556","resolution":{"observed_at":"2026-08-11T00:47:53.041629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.06165","last_updated":"2020-07-26T00:46:46Z","snapshot_observed_at":"2026-08-09T03:42:28.505858Z","submitted_at":"2020-04-13T19:18:10Z","title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.06165","snapshot_observed_at":"2026-08-11T00:47:52.434115Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.434115Z"},"links":{"cited_paper":"/paper/2004.06165","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:2de82a6a5cb2ff82cdcbfc5aed54fd544f2ce4f54052ccc82337e78738f98a3f","observation_id":"fd13970e-17f6-4ac2-becd-daad3b68fff5","resolution":{"observed_at":"2026-08-11T00:47:52.434115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-11T00:47:52.437835Z","title":"L.; and Liang, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.437835Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:8c41c53c5d73474a3e4b3269c00437ca1d6dee9f6b2df9fdd8169cdded632a3c","observation_id":"0395bd76-e967-4b2f-b5fd-f7a6b66007e1","resolution":{"observed_at":"2026-08-11T00:47:52.437835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-11T00:47:52.441953Z","title":"L.; and Dollár, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.441953Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:744be8d97fbcb6d024c21370dc830704c0db2ff2464a2c8bb67dc02b20f40c9f","observation_id":"434cd9d7-14b2-4a18-83bf-708115380476","resolution":{"observed_at":"2026-08-11T00:47:52.441953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10668","last_updated":"2022-11-10T07:01:42Z","snapshot_observed_at":"2026-08-13T05:35:34.752896Z","submitted_at":"2021-12-20T16:52:35Z","title":"Few-shot Learning with Multilingual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10668","snapshot_observed_at":"2026-08-11T00:47:52.446185Z","title":"V.; Mihaylov, T.; Artetxe, M.; Wang, T.; Chen, S.; Simig, D.; Ott, M.; Goyal, N.; Bhosale, S.; Du, J.; Pasunuru, R.; Shleifer, S.; Koura, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.446185Z"},"links":{"cited_paper":"/paper/2112.10668","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:c43391bb177878b1566790bc579cb04267ff77d9f4694a6d22e226b4a392749b","observation_id":"2f665086-7745-455f-ac61-ae254c66e6c2","resolution":{"observed_at":"2026-08-11T00:47:52.446185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T00:47:52.450290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.450290Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:c1f216f2d2e4190f9ec8ce2d39fe637892cd07bf6e6de440ede6da2168cc3825","observation_id":"93255380-34c1-443d-88a2-11ec4e3a7bee","resolution":{"observed_at":"2026-08-11T00:47:52.450290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06574","last_updated":"2023-03-13T05:51:27Z","snapshot_observed_at":"2026-08-13T16:41:56.895438Z","submitted_at":"2022-02-14T09:36:50Z","title":"I-Tuning: Tuning Frozen Language Models with Image for Lightweight Image Captioning","version":3},"cited_work":{"arxiv_id":"2202.06574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06574","snapshot_observed_at":"2026-08-11T00:47:52.723546Z","title":"I-Tuning: Tuning Frozen Language Models with Image for Lightweight Image Captioning","venue":"cs.CL","work_id":"9d4a5452-6277-4a4b-9f11-bc08e729c51d","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.454181Z"},"links":{"cited_paper":"/paper/2202.06574","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:a1000985dd8d6ac1babd97fa6c8639deae1bb5a0c78581d507051bef91a81f72","observation_id":"226c086b-add0-4e3f-839c-d969a4be0fc6","resolution":{"observed_at":"2026-08-11T00:47:52.727828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07179","last_updated":"2023-03-15T00:02:06Z","snapshot_observed_at":"2026-08-13T14:05:48.493753Z","submitted_at":"2022-10-13T17:02:23Z","title":"MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07179","snapshot_observed_at":"2026-08-11T00:47:52.458002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.458002Z"},"links":{"cited_paper":"/paper/2210.07179","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:2ea9722b3d0812f74023c62eb33bc18c750f550a0ef9636a95b6856b881b50b6","observation_id":"230a2993-3479-4c04-8728-416ccb573566","resolution":{"observed_at":"2026-08-11T00:47:52.458002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-13T13:33:48.501765Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-11T00:47:52.461697Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.461697Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:0f31a6379f1e8cbe346f82c9ea82f4c3e33dff7f867a5e03851d4bd1931fc89f","observation_id":"6f40e8af-c06c-4d64-87db-5b4eb3febfb7","resolution":{"observed_at":"2026-08-11T00:47:52.461697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.026774Z","title":null,"venue":null,"work_id":"6674b3e6-b26b-46d9-9654-022cce7a42c4","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.465468Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:3df3f75d183d335a5ed22beef6c3de8ae52ca30c2365465e8c7142b8769ffd14","observation_id":"e739e8bb-f0fe-4bc1-b724-fd797411b8b6","resolution":{"observed_at":"2026-08-11T00:47:53.030299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.014693Z","title":null,"venue":null,"work_id":"2ad714c4-4657-42b0-a0d8-3a20dfe2b0d0","year":2002},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.468715Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ab31e182277c338c16943d17f490fdd58babcb7694f663bd3c0edaadaa9e359d","observation_id":"e56161bb-1edb-48aa-b691-edaf369245f4","resolution":{"observed_at":"2026-08-11T00:47:53.018872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-10T10:15:15.424631Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-11T00:47:52.472320Z","title":"A.; Wang, L.; Cervantes, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.472320Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:2ccdc099a62bd50a901692de4271b052705e5a014e539a78e4aafbf301bbd9cb","observation_id":"5841e810-0639-45f3-bec8-1f34f573c01e","resolution":{"observed_at":"2026-08-11T00:47:52.472320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T00:47:52.476285Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.476285Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:28159c5879693e205ae8081caacc298a191dd5c0341b2905464b00533a70453b","observation_id":"afa7388d-2396-49cc-b606-d7566f664077","resolution":{"observed_at":"2026-08-11T00:47:52.476285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.003299Z","title":null,"venue":null,"work_id":"9d0c1a2e-1a99-4291-b67e-2e9ff224c3d6","year":2018},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.480296Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:6eb02c38669d3bd1fcd28d8a275aa86f2c4e34866353508b34cf128949344adc","observation_id":"982a31ea-aaee-44bb-8600-1f34d2273480","resolution":{"observed_at":"2026-08-11T00:47:53.007004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19821","last_updated":"2023-05-31T13:03:17Z","snapshot_observed_at":"2026-08-13T11:28:28.597112Z","submitted_at":"2023-05-31T13:03:17Z","title":"LMCap: Few-shot Multilingual Image Captioning by Retrieval Augmented Language Model Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19821","snapshot_observed_at":"2026-08-11T00:47:52.483794Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.483794Z"},"links":{"cited_paper":"/paper/2305.19821","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:cd85c75f5e5907ec65b87b53fc0d2d97a16d93711ceb437b7a793d4e08ed3463","observation_id":"3ea24812-6756-427b-9c9a-6a89fb70bec9","resolution":{"observed_at":"2026-08-11T00:47:52.483794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15323","last_updated":"2023-03-28T12:04:49Z","snapshot_observed_at":"2026-08-13T14:15:40.372229Z","submitted_at":"2022-09-30T09:03:22Z","title":"SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation","version":2},"cited_work":{"arxiv_id":"2209.15323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15323","snapshot_observed_at":"2026-08-11T00:47:52.656358Z","title":"SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation","venue":"cs.CV","work_id":"e5815b3d-77e0-4132-a6b6-f6b0f2309b6c","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.487763Z"},"links":{"cited_paper":"/paper/2209.15323","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:1e73a009ee1141d163ab6745568b59f01157fd7196a8974d0e41bfd481c8afc8","observation_id":"a5fbff30-4ddb-4018-9f30-1e344aa2a986","resolution":{"observed_at":"2026-08-11T00:47:52.660913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.992574Z","title":"P.; Elliott, D.; and Martins, B","venue":null,"work_id":"6b42e871-dec0-48e7-b7a6-acdc0de539e6","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.491626Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:245e6c817e11dc853a18e5c1b7410f05504cf268178804412340f69b6421a739","observation_id":"658f9a71-d444-4e33-b749-0caa9763f830","resolution":{"observed_at":"2026-08-11T00:47:52.996295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-11T00:47:52.495100Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.495100Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:36e4c0bed3e231658d34f667ceb0d8ba4568e8f226e9f4023458e8b257225508","observation_id":"54b2ca25-4afb-4bff-91d4-045daf8eb7ad","resolution":{"observed_at":"2026-08-11T00:47:52.495100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.981274Z","title":"L.; and Parikh, D","venue":null,"work_id":"d05499f8-cf47-4e85-8124-c3dfec3ca91d","year":2014},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.498807Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:fb71c7298091d8c84071698344ad10fb1356861634827a0077ded1a4ce0c17a4","observation_id":"99d81053-2031-459e-a814-9b90d8503bfb","resolution":{"observed_at":"2026-08-11T00:47:52.985218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.970708Z","title":null,"venue":null,"work_id":"c555cf2f-ef52-42b5-906e-6c3800f4cea2","year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.502607Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:86995dd634585c775b9433fd7e37389ec369c39b41800b36c2ae7485a82261f3","observation_id":"049e45b1-06fd-41c7-9935-b80f1758c45c","resolution":{"observed_at":"2026-08-11T00:47:52.974325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.959923Z","title":null,"venue":null,"work_id":"40f0d9b6-4118-4a01-a704-8754eb011a49","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.506044Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:d0dcea5c4074fa6261b4fad9fed29c804cc5688ac10ceb1c939de66fc72411e3","observation_id":"cda9c693-6e3a-4b49-84b7-35ea6863a103","resolution":{"observed_at":"2026-08-11T00:47:52.963583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:47:52.509718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.509718Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e548708b0ab3eb703a63b3a78c16ce70fcedf9d217f6d63ee25b51922fd57950","observation_id":"e4514247-2ebd-4ed2-bc74-e7053b154cfd","resolution":{"observed_at":"2026-08-11T00:47:52.509718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-11T00:47:52.513342Z","title":"W.; Dai, Z.; Tsvetkov, Y.; and Cao, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.513342Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:6353af099ae8f82e8a830500dd1f2074b8e528485dedbfd5c8fe43510a5ca1f8","observation_id":"d03c0505-7d79-4c8e-a6d6-0fb2112b0a24","resolution":{"observed_at":"2026-08-11T00:47:52.513342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.04799","last_updated":"2022-08-05T11:26:06Z","snapshot_observed_at":"2026-08-13T16:04:48.500025Z","submitted_at":"2022-04-10T23:36:55Z","title":"DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning","version":2},"cited_work":{"arxiv_id":"2204.04799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.04799","snapshot_observed_at":"2026-08-11T00:47:52.611019Z","title":"DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning","venue":"cs.LG","work_id":"a6a0507b-90b5-4637-8d67-b77c79380cb5","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.517018Z"},"links":{"cited_paper":"/paper/2204.04799","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:22bea82fe619c59752048f8aa6ffbfd5b92dddf8f07eff5775a848259bac0106","observation_id":"9268e79b-dd81-410f-803d-edb3aa4c880f","resolution":{"observed_at":"2026-08-11T00:47:52.615222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04858","last_updated":"2023-10-22T04:18:00Z","snapshot_observed_at":"2026-08-13T12:47:51.917884Z","submitted_at":"2023-02-09T18:57:56Z","title":"Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04858","snapshot_observed_at":"2026-08-11T00:47:52.520772Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.520772Z"},"links":{"cited_paper":"/paper/2302.04858","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:58a050f7731a05c2f59ec0b58afa07261e81560f117dbcd3acd564b9f4ae1702","observation_id":"91256ac0-9dd6-41e1-9938-660fafd9122c","resolution":{"observed_at":"2026-08-11T00:47:52.520772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03715","last_updated":"2024-03-06T14:00:31Z","snapshot_observed_at":"2026-08-13T04:02:15.514893Z","submitted_at":"2024-03-06T14:00:31Z","title":"MeaCap: Memory-Augmented Zero-shot Image Captioning","version":1},"cited_work":{"arxiv_id":"2403.03715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.03715","snapshot_observed_at":"2026-08-11T00:47:52.583947Z","title":"MeaCap: Memory-Augmented Zero-shot Image Captioning","venue":"cs.CV","work_id":"4edb6add-d99f-4263-914f-61f8060a968c","year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.524701Z"},"links":{"cited_paper":"/paper/2403.03715","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:b52971945900c03c181227c01c4222f00a3ef887c47a58d315af73b736af7770","observation_id":"c8eb9d5e-d19c-4e4b-bd0c-15a77cdf443e","resolution":{"observed_at":"2026-08-11T00:47:52.590167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T00:47:52.528543Z","title":"V.; Mihaylov, T.; Ott, M.; Shleifer, S.; Shuster, K.; Simig, D.; Koura, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.528543Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:1ff4c295b7aa63634849bc6cfff19ee45a8ce3147fb802491baa3fb08407ff5e","observation_id":"a85aaa13-e464-4ee1-90cf-551ff68e6e21","resolution":{"observed_at":"2026-08-11T00:47:52.528543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T00:47:52.532503Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.532503Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:8e32813d1f3e10f64c0e0d68e7d02c30814bd982afd2ab8e1b515661b7e0480e","observation_id":"a0fcaac9-22ea-4392-b6f1-fb1b67373a17","resolution":{"observed_at":"2026-08-11T00:47:52.532503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:02:32.543601Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2412.19289."}