{"as_of":"2026-08-10T06:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:803015710b97351b9af1eed7cb75fea66e8974649e9104fea6fff70cb9210e18","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:46.278075Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23358/citation-record","integrity":"/paper/2505.23358/integrity","json":"/paper/2505.23358/citation-record.json","paper":"/paper/2505.23358"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:38.225153Z","title":"Anderson, X","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.225153Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:4730b00a47021eacd0369614ecc61d54f971a5ce2b7aee3aa848b6678dd9509a","observation_id":"e70c888e-fa71-4752-9764-9110e71fe033","resolution":{"observed_at":"2026-08-07T12:52:38.225153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:58.551083Z","title":"Cornia, M","venue":null,"work_id":"a9202c44-8f76-42d2-9b16-f3835ac6b4b4","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.329252Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:44d9b11300e0854893ff73d9ab5fbf1736723a771c96478f5343e7b9437af64d","observation_id":"4888885c-d95a-475b-9753-6f939a93b7e2","resolution":{"observed_at":"2026-08-07T12:52:58.633849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:58.279098Z","title":"Vinyals, A","venue":null,"work_id":"e3e8a84a-12bf-41c2-8a9f-1e01f1322a83","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.400669Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:a460dc8e5987d7057a023bbe1482d67535f0c692b0ab96574f74b445ce8a2997","observation_id":"1e9e79fd-4936-415a-bfc2-6d29ce0e0484","resolution":{"observed_at":"2026-08-07T12:52:58.403872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:57.889400Z","title":null,"venue":null,"work_id":"770fd15f-880a-4aa9-a892-fb36293096ed","year":2024},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.489602Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:46458b5ccf0291ecce28578735feb1054444ee88ac1d5a7f1b1907b7cc787bac","observation_id":"e7a65481-e849-446c-9b33-c414de9c311c","resolution":{"observed_at":"2026-08-07T12:52:58.054236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:57.538175Z","title":null,"venue":null,"work_id":"0a62a0e7-644f-4091-a803-af1b4b010af5","year":2024},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.569375Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:9dfc7c527667ab4ca001e73d74c20d3b83a9b48aa9f830183ad0548efbcb5071","observation_id":"f9435839-2957-4c63-9835-47d5448e576c","resolution":{"observed_at":"2026-08-07T12:52:57.704900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:57.238073Z","title":"Stefanini, M","venue":null,"work_id":"0c910307-8e59-44f9-a7aa-2ed961990d7e","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.647327Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:46c300cf90fd5254bafe6e08bddc28f90ecbb184e6e26cee81b14535a5b563d8","observation_id":"f6af9ec9-d65a-4cc5-a68e-deaa09cf7908","resolution":{"observed_at":"2026-08-07T12:52:57.397582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2023/697","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"b2ed5b90-0a51-4036-b17a-956ddf160b78","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.727922Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:e470c480df274e8dd7983db6d5d533aca3dc8d247e23573b90d9259839b5eaef","observation_id":"fef9e153-5601-4eaf-968a-29db34242249","resolution":{"observed_at":"2026-08-07T12:52:46.868814Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08106","last_updated":"2021-05-17T18:35:24Z","snapshot_observed_at":"2026-08-04T07:02:06.418166Z","submitted_at":"2021-05-17T18:35:24Z","title":"Multi-Modal Image Captioning for the Visually Impaired","version":1},"cited_work":{"arxiv_id":"2105.08106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.08106","snapshot_observed_at":"2026-08-07T12:52:48.847429Z","title":"Multi-Modal Image Captioning for the Visually Impaired","venue":"cs.CL","work_id":"20488bcb-0b7d-42bb-861b-72e085f8ecfc","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.796139Z"},"links":{"cited_paper":"/paper/2105.08106","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:69115cf18a91a1d975b7c5a02315c4ce3b6361c26eb488fcfb425cd39a56db33","observation_id":"785ad6f3-02cf-40b6-ae2b-bfaed1889868","resolution":{"observed_at":"2026-08-07T12:52:48.959440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11696","last_updated":"2021-06-19T00:16:56Z","snapshot_observed_at":"2026-07-06T10:26:41.869841Z","submitted_at":"2020-12-21T21:48:18Z","title":"Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge","version":2},"cited_work":{"arxiv_id":"2012.11696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.11696","snapshot_observed_at":"2026-08-07T12:52:48.634903Z","title":"Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge","venue":"cs.CV","work_id":"eff2928f-4394-4c58-ba2d-7490087206dc","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.871685Z"},"links":{"cited_paper":"/paper/2012.11696","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:fbb32ad6fab02a2ce496ed97fb5c08e4b0af1a0b35cbc114d768993c7d6d9d51","observation_id":"029b2ba3-8538-4874-a84c-66bbcea5383d","resolution":{"observed_at":"2026-08-07T12:52:48.712342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08565","last_updated":"2020-07-15T15:48:35Z","snapshot_observed_at":"2026-08-08T11:48:03.885616Z","submitted_at":"2020-02-20T04:36:39Z","title":"Captioning Images Taken by People Who Are Blind","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08565","snapshot_observed_at":"2026-08-07T12:52:38.976502Z","title":"Gurari, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.976502Z"},"links":{"cited_paper":"/paper/2002.08565","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c382c90736f1506e058831858197934ef86515e8db46dbd8d55437f2fb710088","observation_id":"75d3e471-50d6-41aa-b64f-e410ff65e797","resolution":{"observed_at":"2026-08-07T12:52:38.976502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.11591/ijai.v12.i3.pp1104-1117","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Faurina, A","venue":"IAES International Journal of Artificial Intelligence","work_id":"e35d4f9c-1143-4432-8718-b2faf7e623b5","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.078368Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:309c030284f0b4a03d3143e25cbe762c439916eb24fd9c3aa4c2bbe7035d6022","observation_id":"f159e2fb-340f-4bf6-957e-dfbea85de435","resolution":{"observed_at":"2026-08-07T12:52:46.561064Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.933025Z","title":null,"venue":null,"work_id":"62cbc0f6-8ecd-40c1-bb1e-847df208da68","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.151464Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:18e34b0651a57b63f100c2217f948f18deea41239af5f0551a6134535b32c77a","observation_id":"ac40d6e8-8e45-4d00-b667-8e002468660b","resolution":{"observed_at":"2026-08-07T12:52:57.078394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.655964Z","title":"Nikiforova, T","venue":null,"work_id":"f97ae557-ea87-4d7f-8892-57062d55b727","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.232914Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:529e61203f8cc9ddaceaf157542c16b323369e1b08becd5580ffd23d69734589","observation_id":"be2580ea-5407-4093-a27d-0affbbdd62ab","resolution":{"observed_at":"2026-08-07T12:52:56.773631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08876","last_updated":"2019-06-20T21:51:48Z","snapshot_observed_at":"2026-07-06T08:01:50.383586Z","submitted_at":"2019-06-20T21:51:48Z","title":"Informative Image Captioning with External Sources of Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08876","snapshot_observed_at":"2026-08-07T12:52:39.321919Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.321919Z"},"links":{"cited_paper":"/paper/1906.08876","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:83f0dd911f5e57ea6ba6c47ff4c699630a367e4537cc1d352f855ad5bdaaf3dc","observation_id":"dd4c3f21-c962-4f7f-b8a0-c02c1272136c","resolution":{"observed_at":"2026-08-07T12:52:39.321919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14499","last_updated":"2022-03-28T04:59:16Z","snapshot_observed_at":"2026-08-06T14:37:23.609927Z","submitted_at":"2022-03-28T04:59:16Z","title":"NOC-REK: Novel Object Captioning with Retrieved Vocabulary from External Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14499","snapshot_observed_at":"2026-08-07T12:52:39.390400Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.390400Z"},"links":{"cited_paper":"/paper/2203.14499","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d2050c58d07828ff44be95330c7d42029cc14c36646e88af1960885a4f90b762","observation_id":"5d799102-8f3a-42d4-bca7-8b91f9706c54","resolution":{"observed_at":"2026-08-07T12:52:39.390400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.11970","last_updated":"2021-07-26T05:50:41Z","snapshot_observed_at":"2026-07-06T11:32:23.938810Z","submitted_at":"2021-07-26T05:50:41Z","title":"Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph","version":1},"cited_work":{"arxiv_id":"2107.11970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.11970","snapshot_observed_at":"2026-08-07T12:52:48.384177Z","title":"Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph","venue":"cs.CV","work_id":"67c510dd-5459-4014-a4f3-f7ff91e53af3","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.476170Z"},"links":{"cited_paper":"/paper/2107.11970","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:bf2930e34594eb16b4c822cec706fbddf532179c66568be1d253af4c04c3734f","observation_id":"5fd0f2c5-6556-4c46-9c11-51f0167ff03a","resolution":{"observed_at":"2026-08-07T12:52:48.458488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07889","last_updated":"2018-11-07T04:12:38Z","snapshot_observed_at":"2026-08-08T17:45:51.440871Z","submitted_at":"2018-04-21T04:40:10Z","title":"Entity-aware Image Caption Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07889","snapshot_observed_at":"2026-08-07T12:52:39.553652Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.553652Z"},"links":{"cited_paper":"/paper/1804.07889","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:9dcbbbf094bde67aa67fda6606327970c6f6d64ab2a80ea57602571f100d3dc4","observation_id":"60d63913-eb1e-4af9-abd2-d5caaf9684ea","resolution":{"observed_at":"2026-08-07T12:52:39.553652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15879","last_updated":"2024-04-07T14:43:38Z","snapshot_observed_at":"2026-07-06T16:53:05.949503Z","submitted_at":"2023-11-27T14:51:37Z","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","version":2},"cited_work":{"arxiv_id":"2311.15879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15879","snapshot_observed_at":"2026-08-07T12:52:48.118883Z","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","venue":"cs.CV","work_id":"548be183-e5e7-4b43-8111-76f5cb9e5bae","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.641589Z"},"links":{"cited_paper":"/paper/2311.15879","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:3e44c82a78c36418eae47d3b0633a4c892b25a8e263ec36b7122c6170e0dd324","observation_id":"bbb191e8-7261-4676-8baf-c2bd74b465ac","resolution":{"observed_at":"2026-08-07T12:52:48.254957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.349977Z","title":null,"venue":null,"work_id":"52d40e88-3100-4d12-9d94-c94305cdf749","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.752067Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:6c5cef2ca0fb0b7b11e6b762d2642f671b6f0a1f048ba970cc6de87e31d389a6","observation_id":"87ec3b0d-016b-4d07-a39a-87c165e74893","resolution":{"observed_at":"2026-08-07T12:52:56.473669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.067098Z","title":"Zhang, X","venue":null,"work_id":"9d16317f-7f1e-42a3-9a34-0b210dc9b1bf","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.866012Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:5df3d4089885a0ab8bead98caaa76a3c05a48ecda0ef40351046d850228ba123","observation_id":"0b82bc37-5fdc-46fd-8889-aa1c7f230e41","resolution":{"observed_at":"2026-08-07T12:52:56.216551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:55.734758Z","title":"Ayesha, J","venue":null,"work_id":"03b40c57-acc7-41b3-adb1-d7fd47fdf1d7","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.022083Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:a016137f89985889762e439595b835c66e4e1d7960b51ae3df7831d659c2a1ae","observation_id":"903d26c9-c6ec-40ce-8b66-e5489d9accc2","resolution":{"observed_at":"2026-08-07T12:52:55.875785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08389","last_updated":"2018-05-22T04:41:37Z","snapshot_observed_at":"2026-07-06T06:40:27.094331Z","submitted_at":"2018-05-22T04:41:37Z","title":"Joint Image Captioning and Question Answering","version":1},"cited_work":{"arxiv_id":"1805.08389","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.08389","snapshot_observed_at":"2026-08-07T12:52:47.982764Z","title":"Joint Image Captioning and Question Answering","venue":"cs.CL","work_id":"fe468388-2462-46db-9ae4-e4830dda3e55","year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.177749Z"},"links":{"cited_paper":"/paper/1805.08389","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:59ebe48ac003c731193b845cfdb03e96727f5fb63974bef2bc64563fad9f6992","observation_id":"f931b5b8-6cc6-44b8-9613-0f4090991634","resolution":{"observed_at":"2026-08-07T12:52:48.040856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:55.484587Z","title":null,"venue":null,"work_id":"4bcfafbf-cbbf-43b1-8880-e1cdc035fb92","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.237589Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:e27e2512e9c1a81b9d1237dfd5a47e63162eed45327f931448ce97badaac814c","observation_id":"554effaf-be40-4e95-9c68-f3535c39c000","resolution":{"observed_at":"2026-08-07T12:52:55.602175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:55.175640Z","title":"Salaberria, G","venue":null,"work_id":"e8a0594c-c671-40cc-9352-3c183c8a39d9","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.385666Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:a36964387ca825381ceb98431fa6459259ac8a9f108bf1f2d6ab01ce8787dccc","observation_id":"54812251-928e-4475-90ea-ce0238a75fe7","resolution":{"observed_at":"2026-08-07T12:52:55.352987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08589","last_updated":"2024-04-12T16:35:23Z","snapshot_observed_at":"2026-07-06T17:59:25.200363Z","submitted_at":"2024-04-12T16:35:23Z","title":"Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts","version":1},"cited_work":{"arxiv_id":"2404.08589","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.08589","snapshot_observed_at":"2026-08-07T12:52:47.762048Z","title":"Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts","venue":"cs.CV","work_id":"85daa49a-7bd7-4517-b6ce-d1ab80f51470","year":2024},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.470416Z"},"links":{"cited_paper":"/paper/2404.08589","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:e598c13bb64959977ca3144c7bbee68c4dd4aa7723467412a5d043d223ef3cfb","observation_id":"7c0678fa-8fff-4c8a-b8d4-380ad916ee57","resolution":{"observed_at":"2026-08-07T12:52:47.869346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.02814","last_updated":"2016-12-16T11:44:34Z","snapshot_observed_at":"2026-07-06T04:48:52.708353Z","submitted_at":"2016-03-09T08:56:45Z","title":"Image Captioning and Visual Question Answering Based on Attributes and External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.02814","snapshot_observed_at":"2026-08-07T12:52:40.597487Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.597487Z"},"links":{"cited_paper":"/paper/1603.02814","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:5b2635bac260229e386de223e61b86af363c5ceee9f50dc91e433c3e06bbdecd","observation_id":"62d4644b-8acb-453a-ba90-f045a5abbfc8","resolution":{"observed_at":"2026-08-07T12:52:40.597487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.862175Z","title":null,"venue":null,"work_id":"60026604-fde4-492d-8b9a-a568d98d21ab","year":2016},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.746781Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:11af99d40f6077456cec9b33d0eca071b1d12162f577a2db39b978a7fcaa77ea","observation_id":"5c33a43f-692b-48c9-a3a5-187a92206d95","resolution":{"observed_at":"2026-08-07T12:52:55.015213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.632901Z","title":"Whitehead, H","venue":null,"work_id":"da349813-7ff9-465a-a7a2-2470ad7f08b0","year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.912671Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:2e4e6cf70fa99844e2eb055bcff2d41d87dcde78891ce3883636428a98354ac4","observation_id":"bdc05ffb-3341-4d4f-a6b6-b089287f8993","resolution":{"observed_at":"2026-08-07T12:52:54.736213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.454137Z","title":null,"venue":null,"work_id":"3e8f0b6e-9e4a-4e69-8272-6352203cc69f","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.044280Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:50d4f722170e5955405fe86d0f47fc838fe26ccb1c4f981556b87d3bad6035a4","observation_id":"f3755080-71f4-45c2-9779-3bd814c6b63d","resolution":{"observed_at":"2026-08-07T12:52:54.551892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.287269Z","title":"Radford, J","venue":null,"work_id":"cbfef91e-a1fc-499f-bff1-30269475fa72","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.156367Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:9a9d030777d2423382ed9605aace209a2bee941356eecea1c8d8179980211528","observation_id":"785807f6-025b-422a-9fd9-ac259b927aaa","resolution":{"observed_at":"2026-08-07T12:52:54.357001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.024427Z","title":null,"venue":null,"work_id":"28f65b7b-cb87-40db-8e57-4275456aca5c","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.242756Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d9d571804ea92d3732f98ada3681bb5e755a478e3fe5ce812947e7b252c7f815","observation_id":"9ca17ee5-e151-4c6a-83e3-e9bf56c682a4","resolution":{"observed_at":"2026-08-07T12:52:54.188963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.834488Z","title":null,"venue":null,"work_id":"7a2422c0-7a38-4b6e-a5b6-55c6c5cb779d","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.347860Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:b99f6df297aa383d127d061a6a2f7f0e0ff5d0e248732dedd4b06d17ff927815","observation_id":"9bbf83b5-4d06-42c1-a951-73890c52ff38","resolution":{"observed_at":"2026-08-07T12:52:53.939757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T12:52:41.477507Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.477507Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:ba1ddb98a3011d3b2cea31c768269d1d213493d1fd5c09bdcc369ee9a46edbb9","observation_id":"77bd1637-6379-4ef3-8d25-928d3b36ff97","resolution":{"observed_at":"2026-08-07T12:52:41.477507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.592465Z","title":"Zhang, X","venue":null,"work_id":"e9f79e98-dddf-451a-b189-1d8e4d9889eb","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.620139Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c9eaa52aa85abb202a9543fff3437d2392d31ab66efc5183e5414ecf3c00a654","observation_id":"c5dbae6e-3d28-445d-a8a7-7d60e9ac6351","resolution":{"observed_at":"2026-08-07T12:52:53.718800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.737519Z","title":"Cheng, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.737519Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:6bfa9cf40dbb3c79460d733ccaee8d1b6f718427517d6d41e677155f4f62b69d","observation_id":"e21a4c6f-2011-4bb3-83f2-fca4edc42986","resolution":{"observed_at":"2026-08-07T12:52:41.737519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.863756Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.863756Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:f5f2c88859e78c3d26c569e125d743fa978618f365c65f0b900df89de212ffb2","observation_id":"63038f23-68e0-4cf7-b811-4a6d07d8714b","resolution":{"observed_at":"2026-08-07T12:52:41.863756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.67890","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.253513Z","title":null,"venue":null,"work_id":"23ac2fe4-4a13-499e-9ac5-d44d53cb6a34","year":2025},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.935467Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:0fec9d7b49cd7c0ab949f0a6012648dffbc2a5292686b6746890475d66582e7b","observation_id":"9bf901f3-42d4-4796-b3f9-57dca0f93082","resolution":{"observed_at":"2026-08-07T12:52:47.355468Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.077219Z","title":"Cheng, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.077219Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:7caf325e5846e9084bacd4c8f1b9333a9a90f21bbc34a83277ae344faa9db876","observation_id":"aa067ddc-360f-49ec-ac90-0e63bab9460a","resolution":{"observed_at":"2026-08-07T12:52:42.077219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.430763Z","title":null,"venue":null,"work_id":"9dc29663-cd93-4399-99c1-d53fad109261","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.260304Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:e1a7712cbd6f7f62d4ca6e42591d3a8bab1c2a74fb8123e7cb32e8338ed9e451","observation_id":"e94ec38d-69ec-4738-a967-b5faadbeec74","resolution":{"observed_at":"2026-08-07T12:52:53.500630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.186878Z","title":"Zhang, Z","venue":null,"work_id":"50003a46-1da8-438b-adbe-8dacf9e706b9","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.414916Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:6b5621c477fda5bb43c05a16c0f9d20871aeed3b2118668fe8cf3745c20c44cf","observation_id":"bb68489d-5d11-41d8-9982-ea5f287d7e21","resolution":{"observed_at":"2026-08-07T12:52:53.308178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.021431Z","title":null,"venue":null,"work_id":"9032ffde-ed9b-4dad-9fb4-17a3a184ccd6","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.564442Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:dc8ab83fdc363f71ee62d132cc6c990d3ab3fe4accbfb65f24a92e415794ea74","observation_id":"317e716f-d6f1-4b0d-b7e0-5c577690f75f","resolution":{"observed_at":"2026-08-07T12:52:53.118429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.813788Z","title":null,"venue":null,"work_id":"f49ef2c0-29ea-4079-b617-aac6f8d271f1","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.746129Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:604ebaa8a2d437cf093d69b53c85b10974fb979df697776cbc0a1818e2b6e1ec","observation_id":"ead8fbd5-99c9-4163-9a60-66e4898bc5d6","resolution":{"observed_at":"2026-08-07T12:52:52.872374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.615166Z","title":null,"venue":null,"work_id":"78db5161-b0d1-43ad-9963-68175525208e","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.902878Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:5ea4f6543ee7d840a46d9d4ee7917175bc38f1553277146a53d353b3003aae0b","observation_id":"2ad7f8fa-a2e5-4653-9fc5-a25fb201a9c9","resolution":{"observed_at":"2026-08-07T12:52:52.726239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.431665Z","title":"Huang, W","venue":null,"work_id":"7b9f733a-2575-4a56-a6cb-3140ce20414f","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.080542Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:f4c22811e45bb2b185fc93da6ffe776fb0d3e8d13938f1b370f88575a5e11963","observation_id":"a1497428-a809-49e1-ba46-d42f066e3c26","resolution":{"observed_at":"2026-08-07T12:52:52.516230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.291761Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.291761Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:4385df8c3d336416f8eb3a3a9f3bd9b699e1b02e314b86ee45da16396f2a975a","observation_id":"7eb8d239-1849-4376-b212-2f30817b08e1","resolution":{"observed_at":"2026-08-07T12:52:43.291761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.218266Z","title":null,"venue":null,"work_id":"6e37d0d2-499b-4102-b32d-fd6cef997380","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.376452Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:417d1015e0ef5e964507a205b04988a1fd6a14ad4db54c29b1f3c06071f416bc","observation_id":"939a91d4-e703-4647-8e57-dbec012f5be4","resolution":{"observed_at":"2026-08-07T12:52:52.328504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.028436Z","title":"Devlin, M.-W","venue":null,"work_id":"5df9df54-83ce-4821-b389-0add07cee05a","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.502994Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:7389dbfffca152a832411aa59d822b0786a14ff9514253f98c140fed9fbf5228","observation_id":"83882436-fe97-4f28-b95c-1947616b957c","resolution":{"observed_at":"2026-08-07T12:52:52.113059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.790812Z","title":null,"venue":null,"work_id":"e8ca05d2-adf0-4886-aa94-506d7c453445","year":2017},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.665941Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:6cf9cfaabe24b86a70d674e7db1d7f9426981048846bb67f1bafee91d6157ad4","observation_id":"0c5efa97-c4d9-4a2a-a5ba-41674afba9bc","resolution":{"observed_at":"2026-08-07T12:52:51.880237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.591152Z","title":null,"venue":null,"work_id":"cbdf97e3-3f9a-446e-a539-8fbbda4044b3","year":2017},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.799953Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c09c527952d017887cd7ce5fdb32064d8154826fa5ad97c0a7bf5f336d2c6664","observation_id":"68447c61-88fc-49cb-8413-4300f61ddb0a","resolution":{"observed_at":"2026-08-07T12:52:51.717387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.397606Z","title":"Radford, J","venue":null,"work_id":"fcd2319a-0169-488c-baa3-cde54f89f3cb","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.943310Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:31cfed92b456f280addcd302adeb1bb099b204c2d3d5cd37a6d326ae0dff0480","observation_id":"e97e983c-750b-499f-b0fe-c605f3f115da","resolution":{"observed_at":"2026-08-07T12:52:51.485927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T12:52:44.090056Z","title":"Mokady, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.090056Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:327dac3edf8ac308a65d5c2aabd3f7cc3b551beca111b131a31054d0fcd2ae65","observation_id":"ab95742f-af91-4837-a8be-418c7492f131","resolution":{"observed_at":"2026-08-07T12:52:44.090056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.205491Z","title":null,"venue":null,"work_id":"d3f8d0ab-cccb-4370-b4fb-6dce82378cd2","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.217497Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:f2c23a0a7963d572aee7200b2c30b43c7014bf358022b559ee961517f318662e","observation_id":"583f908b-8132-4b1d-a22e-58bdab4df765","resolution":{"observed_at":"2026-08-07T12:52:51.296324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T12:52:44.360480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.360480Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:f6d4f882da8c7f6e376bbf3a071e4f3af58fce770a85a4b2b492990ed80981aa","observation_id":"d6987114-ce4b-4866-b9c4-b3af430e460a","resolution":{"observed_at":"2026-08-07T12:52:44.360480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.075416Z","title":null,"venue":null,"work_id":"c460fb48-1c61-4097-ad64-04591c48cf88","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.524819Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:69515be3b1115afb0551d505598d13448f9dbc2d7d8667fe7abdaac0767cd1ed","observation_id":"f33e1d90-fa99-4a87-ba0d-ebb038698a5e","resolution":{"observed_at":"2026-08-07T12:52:51.143213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.851093Z","title":"13035–13045","venue":null,"work_id":"0649c37c-441a-480f-9cf0-aa5c9eabe0cb","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.675623Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:7b9a0dad5d412e7edb9321a4a259627676229fe1110e73c30b47f33efd44cc51","observation_id":"619ce196-557d-4234-a37b-8be37228eae5","resolution":{"observed_at":"2026-08-07T12:52:50.963362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.703719Z","title":null,"venue":null,"work_id":"8277e04a-d49c-47ff-be38-3ee0a923d8b7","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.829181Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:78b43e7953a20416e525d4f7ecf71f48fe63c38763521fa395f8601a73532c70","observation_id":"771492b5-9dd1-4e5a-908c-30499c358417","resolution":{"observed_at":"2026-08-07T12:52:50.768170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.950358Z","title":"Changpinyo, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.950358Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:8ea16b6247ec8d2659c6181b20c455bbbcaa5372d711c05b80e36fd855445319","observation_id":"eaa26ee6-5c18-4998-ad25-3464b4440290","resolution":{"observed_at":"2026-08-07T12:52:44.950358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.493293Z","title":"Kullback, R","venue":null,"work_id":"11a728cc-70db-4531-89eb-924562fd09d0","year":1951},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.091862Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:89990b30d09f8d2933c1e20d63f07e4c2952b4cef51d977e97a9004a36ad343e","observation_id":"1faceee6-58c1-42c1-a747-6b0968ee5f17","resolution":{"observed_at":"2026-08-07T12:52:50.556760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T12:52:45.252289Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.252289Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:79c3f134f5d05c838fde52947a004593dc3d8dee184c272d9866c4751707fa98","observation_id":"a9da7bcf-96d6-4e97-aa27-d303f3179f4c","resolution":{"observed_at":"2026-08-07T12:52:45.252289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.329937Z","title":"Papineni, S","venue":null,"work_id":"459230d5-990c-477a-93db-3eceea94b380","year":2002},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.322179Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:73a202da224f5b741d67e28111f06462c840d1871e9c8ba191b17181035f5c38","observation_id":"7632d89f-de66-4896-af43-b06f96587e43","resolution":{"observed_at":"2026-08-07T12:52:50.405269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.117541Z","title":"Banerjee, A","venue":null,"work_id":"dca051c2-1979-42fd-89a9-2ef710c18a17","year":2005},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.478971Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c4739b5b5ae2793b2a0dbfcfac0a8fe8ca6122d9a020801be3df217b9780370c","observation_id":"3504e205-b35a-4e11-a653-83c1f2407f11","resolution":{"observed_at":"2026-08-07T12:52:50.178964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.884092Z","title":"Lin, Rouge: A package for automatic evaluation of summaries, in: Text summarization branches out: Proceedings of the ACL-04 workshop, 2004, pp","venue":null,"work_id":"f20ee895-2059-485a-bb1c-834505a26d8b","year":2004},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.626619Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:28e2be6e2ea8d8618dda35820b39b574aba84ceb6b9649cd92af469cd8308e43","observation_id":"1aea2639-4e4d-4a37-ba4e-f76a1944a962","resolution":{"observed_at":"2026-08-07T12:52:50.009788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.711661Z","title":"Vedantam, C","venue":null,"work_id":"06b78192-0a21-4cb4-8e7a-6b4fd9b6fb14","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.757986Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:81a78a1d8442fc5e90e0354d0968a2e847b808edbb063ca3530c9be374eeffac","observation_id":"9225c830-2bce-45e3-a697-43c60fdde696","resolution":{"observed_at":"2026-08-07T12:52:49.793273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.463481Z","title":"Kirkpatrick, R","venue":null,"work_id":"c1e969c0-c69e-44cf-858f-7025325ad57d","year":2017},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.859012Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:31a265a83d120d0d0f3d97dfce9fe6f3c7129bd6fd38bf4c4bdd3a3b0399b49f","observation_id":"301c5f23-0b3f-4bc1-8635-bf8b1b7805f3","resolution":{"observed_at":"2026-08-07T12:52:49.605423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.255738Z","title":null,"venue":null,"work_id":"0bd5ec6f-83a9-4b12-91b8-e89461865063","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.945542Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:00338c496c536d56070bfe33a11a4249d40e28d0e233bc35f195237d3b738e77","observation_id":"210021e2-202f-45f3-968e-251efdbd32d1","resolution":{"observed_at":"2026-08-07T12:52:49.376017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.060362Z","title":null,"venue":null,"work_id":"ed3f51aa-457f-4dad-8e85-ec8c341d2be9","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:46.100120Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:e72b53fc0c7d060db1e30ed617c4dbfcb7c3c87fc3ab28394e6c5a4f0396e19f","observation_id":"57f827d0-533d-40e0-9a1d-80b3884f9dbc","resolution":{"observed_at":"2026-08-07T12:52:49.146830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-09T19:43:52.666104Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T12:52:46.278075Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:46.278075Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:845b68de6dd73556faaaab1cc8358e9aab59103eb371f09bd74e17cc36388640","observation_id":"e0bfc597-ddae-4ac7-9bf9-2bf7e9f83ac8","resolution":{"observed_at":"2026-08-07T12:52:46.278075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T03:21:47.198031Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":8,"verified_fuzzy":21},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.23358."}