{"as_of":"2026-08-14T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:657f8b7428658cf9603e1b57d8eda412238e3ab2b46b49e4d40d4dda6f5e965c","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:43:43.115768Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:35:11.654114Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:06.852265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"cited_work":{"arxiv_id":"2412.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01115","snapshot_observed_at":"2026-07-03T23:59:06.852265Z","title":null,"venue":null,"work_id":"b4e9223e-0ce0-433c-89d7-bd7e49d71c57","year":2024},"citing_paper":{"arxiv_id":"2606.18553","last_updated":"2026-06-17T00:08:17Z","snapshot_observed_at":"2026-08-02T08:54:19.234906Z","submitted_at":"2026-06-17T00:08:17Z","title":"Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T21:35:11.654114Z"},"links":{"cited_paper":"/paper/2412.01115","citing_paper":"/paper/2606.18553"},"observation_digest":"sha256:7fcadd5425e305a9045fe01911b4ecacaef9895c6cc2203cfdf2216d289d308b","observation_id":"d9f57b73-834e-4c94-ab03-233692c9035c","resolution":{"observed_at":"2026-07-03T23:59:06.853907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01115/citation-record","integrity":"/paper/2412.01115/integrity","json":"/paper/2412.01115/citation-record.json","paper":"/paper/2412.01115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.567953Z","title":"nocaps: novel object caption- ing at scale","venue":null,"work_id":"5afcd7b6-dd7c-4a9e-94e1-e68ee0bce374","year":2019},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.969444Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:f58dc937d04d9c8bc5cfaad8d09141beed22bf05d19357d55a1613543097ccc1","observation_id":"9f629a68-5eaf-4176-9847-00c3feca6a4f","resolution":{"observed_at":"2026-08-12T04:43:43.571606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.557219Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"f50570f9-11aa-49ad-96bb-a1febe26395a","year":2022},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.973506Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:9fa6db3de245fc08da95962961406aaffbbcbf2826dd5a900cd1268c11317c26","observation_id":"9f9f82b4-414e-4f83-b87e-562ca87c7941","resolution":{"observed_at":"2026-08-12T04:43:43.561109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:42.977330Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.977330Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:be061b02597f57284f964f7efd59d7034ec368c79459ff0f182bec3925e13682","observation_id":"57d7ef26-e5f3-44a2-b7b0-7e8fc9d1ff88","resolution":{"observed_at":"2026-08-12T04:43:42.977330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.540741Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"789becae-3e64-469d-bdb9-dab972629dc7","year":2018},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.981044Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:e7476a7fe30db3f007a165a21de9b5755ec45991d0385a2fbe4020273f1d6c81","observation_id":"1f7c5749-991c-47f2-9ceb-fc3d0c0c42b7","resolution":{"observed_at":"2026-08-12T04:43:43.544373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.530543Z","title":"Self-RAG: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":"c5a4a143-2dfd-4c10-9853-f1098dd3fd2c","year":2024},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.984854Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:718b27ee51d08ae6134c3912d62b11e95ba3497304404391f10cb26e93e8b634","observation_id":"30a10b3f-81e1-4cba-8d5d-d70e843ade48","resolution":{"observed_at":"2026-08-12T04:43:43.533738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:42.988626Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.988626Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:db5d09ba17aeab6a8f85e8653f471104232d8de2c06a3bf153e258f60fdc2106","observation_id":"ecb6e715-0921-4fd6-b787-51d1bfb5ca57","resolution":{"observed_at":"2026-08-12T04:43:42.988626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:42.992524Z","title":"Label-efficient se- mantic segmentation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.992524Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:fe0660b8078b513fc118ffb685cf9304ccb9eb7b489905b6889b7fad8a5d9225","observation_id":"ecef8cc7-b673-4a9d-8e07-6a4f5e973bd6","resolution":{"observed_at":"2026-08-12T04:43:42.992524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:42.996694Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:42.996694Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:10c113842307fdc21408590b417c44fe20a28eed84c4808f02fd4a560518d112","observation_id":"1e84edba-05ad-4dfe-a235-6f95d7f901fb","resolution":{"observed_at":"2026-08-12T04:43:42.996694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.000178Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.000178Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:7d25fa4780389c4115d60c75d83fb6a5753b65116eb3cabef422c4e581770656","observation_id":"bc5d7ae1-ded4-44ad-a8e3-f1e9c200255c","resolution":{"observed_at":"2026-08-12T04:43:43.000178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T04:43:43.003606Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.003606Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:bc0b35e752cc02700705ccc8ec3935fb695504e19720f94e46c23cd451255966","observation_id":"01a069d3-cc53-4cba-9933-d41d3c84939f","resolution":{"observed_at":"2026-08-12T04:43:43.003606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.496886Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"15588e1f-ddc9-412a-997b-036d8302edc5","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.007173Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:1bd35dbb1cd061d93de078d695b9446aa271ef25ec9991c2090ffc6d3d846eb6","observation_id":"f371f76e-ab92-458d-88a9-3b40d79e0f92","resolution":{"observed_at":"2026-08-12T04:43:43.500292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.487598Z","title":"Transferable decoding with visual entities for zero-shot image captioning","venue":null,"work_id":"b6d1a94a-d98b-429f-8577-da2bc2d179b3","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.010597Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:17361a8793dfb87cd599861c80ffb642947300ac6d5cd97bc90a52da88eb2c9a","observation_id":"46911fbe-c54e-4344-8cec-a9485f6ff6a2","resolution":{"observed_at":"2026-08-12T04:43:43.490657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.477352Z","title":"Retrieval augmented language model pre- training","venue":null,"work_id":"42417501-f1a2-4a9f-92f4-344fb96d8aca","year":2020},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.013976Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:833ac3c4f32a72b61c459f9cba65a5e1f7dd63291cece166c5c8ff0eb3a9422d","observation_id":"df0c99a1-a8ec-433c-a900-bf03106f9c36","resolution":{"observed_at":"2026-08-12T04:43:43.480829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.466818Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"30342833-e45d-4d3d-9c0c-1a206589126f","year":2015},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.017333Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:9efd7e526d842d4cd5e02ae3af11380fc63830ce293310d59f2edb7a1f15a873","observation_id":"68be8fe1-8976-446d-ad40-1bac41046606","resolution":{"observed_at":"2026-08-12T04:43:43.470359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.455768Z","title":"Do you remember? dense video captioning with cross-modal memory retrieval","venue":null,"work_id":"16b69607-80c1-4af5-8f47-d647765d0fe6","year":2024},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.020118Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:0fb1ba999907fa4792b29c6730e6f437337ca2c1f91855ffa5ef8f907505b309","observation_id":"990f8361-e9b3-431c-9c96-a3b7cd12cf5e","resolution":{"observed_at":"2026-08-12T04:43:43.459814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.444737Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"c0dbb0a3-5657-4713-92a8-6dde5a386104","year":2020},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.022706Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:090f8286a7fd682e4ae68d6508a7077d32f235837bc9a1d40bdfb6de19ca5c74","observation_id":"060a5ffb-ae1f-4927-aa25-9e78b8e0d6b5","resolution":{"observed_at":"2026-08-12T04:43:43.448584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.433667Z","title":null,"venue":null,"work_id":"d6b42af2-dfab-4111-912f-9ee414b41a0a","year":2022},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.025459Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:ababe10dbf5b080e047fe639bf337872e451592cd3c07da01cfbc0474c19b358","observation_id":"d3069805-a769-4317-a2b8-317d9d593d0f","resolution":{"observed_at":"2026-08-12T04:43:43.437301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.422907Z","title":null,"venue":null,"work_id":"acc63ea5-0f96-4c29-8372-b06760451ffa","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.028165Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:d690cbc49f4a8c2767e5e1be027c67351bbd536b52a8dfe5ea61a7adfcecaa5a","observation_id":"8fc193d5-96b3-4f32-a045-2baea68f0b4b","resolution":{"observed_at":"2026-08-12T04:43:43.426406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.411957Z","title":"Evcap: Retrieval-augmented image captioning 9 with external visual-name memory for open-world compre- hension","venue":null,"work_id":"81344783-5954-45a0-909e-836e08aad798","year":2024},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.030855Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:83491a9ec2dc88efaf018a0f273a5c7da47b3ba9dda25e40bdf247389daa31ab","observation_id":"f5ab841b-bc38-4beb-92ea-b6fb5748a5ff","resolution":{"observed_at":"2026-08-12T04:43:43.415912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.401275Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"c13a2974-0062-4ae5-bc76-c4f958597e10","year":2014},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.033636Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:8b615134d695f8eab72957e89611706c5ba7b1642a464499427104cec46f92e8","observation_id":"f13e7679-7e75-4b19-a8cc-bc9b645dce1f","resolution":{"observed_at":"2026-08-12T04:43:43.405063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04965","last_updated":"2023-10-17T01:30:57Z","snapshot_observed_at":"2026-08-13T10:17:14.309378Z","submitted_at":"2023-09-10T08:55:24Z","title":"Prefix-diffusion: A Lightweight Diffusion Model for Diverse Image Captioning","version":2},"cited_work":{"arxiv_id":"2309.04965","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.04965","snapshot_observed_at":"2026-08-12T04:43:43.214826Z","title":"Prefix-diffusion: A Lightweight Diffusion Model for Diverse Image Captioning","venue":"cs.CV","work_id":"788d34c3-d74d-4f61-97a6-1d028dd9f434","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.036329Z"},"links":{"cited_paper":"/paper/2309.04965","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:b29a3b9cee5f5f654df5ae4fee31384346f71484a97409f9b17574310313bd0b","observation_id":"b1c281d9-abeb-4985-a3b9-559479573ca0","resolution":{"observed_at":"2026-08-12T04:43:43.218984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.039463Z","title":"Diffusion hyperfeatures: Searching through time and space for semantic correspondence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.039463Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:ba23a379b591a92e30a7f399607ab6d2848faf4027f1e96389b4888a6250d3c9","observation_id":"87e8123a-ffa7-4a86-bc32-a52cfb937224","resolution":{"observed_at":"2026-08-12T04:43:43.039463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.384150Z","title":"Semantic-conditional dif- fusion networks for image captioning*","venue":null,"work_id":"81a9c400-1713-4c94-ab88-467e6bc7955e","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.042841Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:4c005072cdbc77ecbd156f66cff5e37cebbd80613593f9434a5105b28f42fd31","observation_id":"37b683c8-40c7-4fa8-a99d-f42add8cdb4c","resolution":{"observed_at":"2026-08-12T04:43:43.387994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-13T13:33:48.501765Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-12T04:43:43.046108Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.046108Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:6f6bcaa88bea9a631617849d5e540b319f7b54ace746ed5db37d64dbd80f4766","observation_id":"b02820e3-6aaa-4279-9d01-d0fb14dfdd77","resolution":{"observed_at":"2026-08-12T04:43:43.046108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.374329Z","title":null,"venue":null,"work_id":"7c938f8b-f3d2-4a77-98b6-7ee41a77127a","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.049896Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:7784f7a1492c3287bba955f466b76e0ed254e92b2bb876501dffe6348cec26cc","observation_id":"77d9f822-b9da-4672-bc68-362f4d09f598","resolution":{"observed_at":"2026-08-12T04:43:43.377272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.364641Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"a1de83d2-59f2-41f7-a685-f77b85bd4183","year":2002},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.053181Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:1252b34a93466021b39ed2556a42962c01b3567a96a5217693cba282ab6425f6","observation_id":"78176fae-007c-4638-9723-60ddb8d68179","resolution":{"observed_at":"2026-08-12T04:43:43.368069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.056659Z","title":"Plummer, Liwei Wang, Christopher M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.056659Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:8f6b3c6324701e8c4b83c212a141ba00bb6a27b83b6396ad4e733d662a462008","observation_id":"bacbc150-f363-4b77-b62f-9772b5d8ae9c","resolution":{"observed_at":"2026-08-12T04:43:43.056659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16102","last_updated":"2023-11-29T20:12:28Z","snapshot_observed_at":"2026-08-13T05:16:05.862615Z","submitted_at":"2023-11-27T18:59:53Z","title":"Diffusion-TTA: Test-time Adaptation of Discriminative Models via Generative Feedback","version":2},"cited_work":{"arxiv_id":"2311.16102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.16102","snapshot_observed_at":"2026-08-12T04:43:43.189990Z","title":"Diffusion-TTA: Test-time Adaptation of Discriminative Models via Generative Feedback","venue":"cs.CV","work_id":"95cb9a30-29ea-4f0f-998b-a0ca2b2f66aa","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.060391Z"},"links":{"cited_paper":"/paper/2311.16102","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:c1bc1369b311e2a26965cae76840135f9d5450adc572ab33761437b6ca20d4e9","observation_id":"e05529d1-9cac-4d33-ad06-481455ac4446","resolution":{"observed_at":"2026-08-12T04:43:43.193514Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.348763Z","title":"Smallcap: Lightweight image captioning prompted with retrieval augmentation","venue":null,"work_id":"6a70c01f-63dd-45c8-8ab0-85be73649dab","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.064268Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:0a27e413220c7c0abd5a06df27776f9817a0ebb0b4232554aa50afbec7936bbb","observation_id":"5d5504fc-006a-4c5f-9704-c28e55b879ad","resolution":{"observed_at":"2026-08-12T04:43:43.351786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.339020Z","title":"Retrieval-augmented image captioning","venue":null,"work_id":"d8e754e5-12a3-4bd6-9374-3eefc34bf053","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.067476Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:e71c88905fb2636956955dc3ca683e668d5f042811f401b8a1639d57099c0c8d","observation_id":"c8d15c66-6239-4ae0-87ac-bf3fec9ec12b","resolution":{"observed_at":"2026-08-12T04:43:43.342752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.328607Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":"47390fd3-bcc1-457a-a470-46ec20a73363","year":2022},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.070857Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:76e8d43721944a81793a48b2de31cc2c0c44045121ab6f84906aed8aeb8b8a95","observation_id":"e3fa4a6b-4244-4dea-881c-8092ac8c8d57","resolution":{"observed_at":"2026-08-12T04:43:43.332357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.318006Z","title":null,"venue":null,"work_id":"2eb917f2-ad83-4a4e-9bd6-7fe085b41cac","year":2011},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.074187Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:8a6ced942165dc6b2fbe1499a06e327438b6f9e09d64f77a22f96f265a905de0","observation_id":"bb2682d7-8688-4452-983d-7a195fbb5094","resolution":{"observed_at":"2026-08-12T04:43:43.321676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.077492Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.077492Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:599aea39648f9c07c25613ba960df19fb98a2eb3764e0483008422551a83ed79","observation_id":"21eeccbb-b9d7-4fa4-947a-e2117a12272c","resolution":{"observed_at":"2026-08-12T04:43:43.077492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.300600Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"d29e059d-120b-4512-a7f4-9a717950e11e","year":2015},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.080756Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:8764a27fe7296fe98445916467e15384b0b01ea66bc836748a908735628d5823","observation_id":"cbef04e2-0d9d-4e0c-953d-8c56f6d35f8b","resolution":{"observed_at":"2026-08-12T04:43:43.304232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20171","last_updated":"2024-08-24T03:55:36Z","snapshot_observed_at":"2026-08-12T23:12:40.280328Z","submitted_at":"2024-07-29T17:00:09Z","title":"Diffusion Feedback Helps CLIP See Better","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20171","snapshot_observed_at":"2026-08-12T04:43:43.084063Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.084063Z"},"links":{"cited_paper":"/paper/2407.20171","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:958247bd18f928dd09dc21bbe8110013386c6a82ab7378247efa05af3b6de3e4","observation_id":"4caaeb35-510d-492e-bdbf-e610e37fbe19","resolution":{"observed_at":"2026-08-12T04:43:43.084063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10747","last_updated":"2022-10-13T06:32:37Z","snapshot_observed_at":"2026-08-13T15:39:29.168889Z","submitted_at":"2022-05-22T05:18:27Z","title":"Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners","version":4},"cited_work":{"arxiv_id":"2205.10747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.10747","snapshot_observed_at":"2026-08-12T04:43:43.164504Z","title":"Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners","venue":"cs.CV","work_id":"e529fb92-10cc-4b0b-b231-a298f4039e4b","year":2022},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.087911Z"},"links":{"cited_paper":"/paper/2205.10747","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:42bf896d5f34d5f7c14542da97d19d4c2ab6ed424130190e901a84a221add6d7","observation_id":"7512b51a-6713-43c6-b7af-c16252e6c7c7","resolution":{"observed_at":"2026-08-12T04:43:43.169825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.289953Z","title":"Re-vilm: Retrieval-augmented visual lan- guage model for zero and few-shot image captioning","venue":null,"work_id":"88ba6cae-6e34-415e-a3d0-88f3244da0e0","year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.091386Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:cf7c9c5cf67122f866eafdaa14a81484da3ef8665dadb36e147135da9221eb6d","observation_id":"7a0fe769-fa90-434a-b4e1-470feae52d14","resolution":{"observed_at":"2026-08-12T04:43:43.293734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12561","last_updated":"2023-06-06T00:28:34Z","snapshot_observed_at":"2026-08-13T13:37:08.088461Z","submitted_at":"2022-11-22T20:26:44Z","title":"Retrieval-Augmented Multimodal Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12561","snapshot_observed_at":"2026-08-12T04:43:43.094591Z","title":"Retrieval-augmented mul- timodal language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.094591Z"},"links":{"cited_paper":"/paper/2211.12561","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:02dd754f5d8fbb8350ec260354b46abdab204e94c03faba1ff72d257704eef9f","observation_id":"4bd4f742-490c-4586-ad62-57946d644bb2","resolution":{"observed_at":"2026-08-12T04:43:43.094591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.278703Z","title":"Meacap: Memory-augmented zero- shot image captioning","venue":null,"work_id":"07458391-2817-4018-b82b-ae08f84fe809","year":2024},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.098031Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:641a6ac6926724f881e44f33c91ab110a34a0ffeb5d2e6ead3d30aec74508b4b","observation_id":"8784c95e-fd2f-40c9-ac84-bbc64046fefa","resolution":{"observed_at":"2026-08-12T04:43:43.282125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T04:43:43.101124Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.101124Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:aad2020afa9280a9f6d4714e7df44c295c28000aea300aa64258b1f3987e663f","observation_id":"d024bdf6-d798-44ee-83c2-2af253e33ae1","resolution":{"observed_at":"2026-08-12T04:43:43.101124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.268767Z","title":"This approach significantly reduces memory and processing requirements while preserving critical visual information","venue":null,"work_id":"d7377cfe-6e8b-44bc-86f2-c295f8496507","year":null},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.104667Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:ffe56099be11803bc83a82be50ca9f39a4a3b3baaf857360e4d21e84a7e7dfad","observation_id":"1b6e84c1-05cd-4793-8439-9237cb32bf36","resolution":{"observed_at":"2026-08-12T04:43:43.272484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.258653Z","title":"NOUN” or “PROPN","venue":null,"work_id":"4f90fe79-7bd0-49e1-bbf4-7c34aa54724c","year":null},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.108226Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:7f17a14b833b91f00a4380bf601bf59c8dfc240cf7ea3369bfbf1e0fb63751e2","observation_id":"7a14cb31-2e90-4280-a9c6-13e52123753a","resolution":{"observed_at":"2026-08-12T04:43:43.262215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.248543Z","title":"While the SPICE scores remain similar across different top- n values, the CIDEr scores exhibit more noticeable variation","venue":null,"work_id":"1af74fc2-eafa-436a-af8a-443e06f7b332","year":null},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.111732Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:82cd06c1e6ff39ef939274ac865661bc5e934d0e94f51e0fa1f357988de0fbe8","observation_id":"541524c1-893b-4906-a1f7-df5bdb574aad","resolution":{"observed_at":"2026-08-12T04:43:43.251968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:43:43.238127Z","title":null,"venue":null,"work_id":"7425e070-1b09-417c-8707-6b4a140a0014","year":null},"citing_paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:43:43.115768Z"},"links":{"citing_paper":"/paper/2412.01115"},"observation_digest":"sha256:15668366c377dad75d56555592ed351208d133bd5bd6720fed28e2a96e6bbdba","observation_id":"593fb9af-9731-449e-85a6-ee2bda005b6c","resolution":{"observed_at":"2026-08-12T04:43:43.241682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01115","last_updated":"2024-12-02T04:39:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:38:29.199733Z","submitted_at":"2024-12-02T04:39:17Z","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2412.01115."}