{"as_of":"2026-08-18T08:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a980c1e7dec5bf9565e7ea1babd7cc398886c4d05a2168939c69bfbe220b2d05","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:18:51.876640Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08710/citation-record","integrity":"/paper/2507.08710/integrity","json":"/paper/2507.08710/citation-record.json","paper":"/paper/2507.08710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.535507Z","title":"Learning cnn-lstm architectures for image caption generation,","venue":null,"work_id":"963887a1-30d8-4570-b2bc-f2c17dc8bafb","year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.496453Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:1bfac999b3588753e926ead358a87b30daa965602caec19cb2a0d38857a6a566","observation_id":"af9e9b67-ed51-43f0-a289-8f9970342520","resolution":{"observed_at":"2026-08-06T18:19:58.538709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.524145Z","title":"Image captioning through image transformer,","venue":null,"work_id":"82f333e8-df4f-4f43-972d-9e9627de4327","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.581263Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:d2f72812b84e3190809af6c8f09e4ef86fd7a7b25059d70a958f6232e56f8bf9","observation_id":"98920df9-8da1-4c92-b48d-4e976d93e013","resolution":{"observed_at":"2026-08-06T18:19:58.528365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.512171Z","title":"Meshed-memory transformer for image captioning,","venue":null,"work_id":"9f306b7d-1461-4f01-984f-b80c944554c2","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.763308Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:096f07eb2408e4e0cf1b88616dec4df5f21ca111f29a03f90732d4d638f38712","observation_id":"2b78848c-363e-4dbb-818d-7779191acc0b","resolution":{"observed_at":"2026-08-06T18:19:58.517298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.499876Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"758c64a9-edb0-4526-848c-9be3d4c18917","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.883631Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:284805b73ef23c1f5d3bf1e4e28f7d8d5c184f159a4e68b927472a56c36984b2","observation_id":"724a695d-4006-446b-b5d5-c6b7680e669c","resolution":{"observed_at":"2026-08-06T18:19:58.505011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.008929Z","title":"Self- critical sequence training for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.008929Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:aa6e783e925e6ed40c1231b56692c3b14ff99141cc4bc50c557ba6439daab0f1","observation_id":"3a749b07-904b-437b-a0b3-6be7fa4d1177","resolution":{"observed_at":"2026-08-06T18:18:45.008929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.478264Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":"50127bcb-7db6-4849-996e-b94f9d68c43b","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.151174Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:da2178848b81a0444c8f5f9dafd39bd6a6fef1c9883dc9e96127b0f7c4d8036b","observation_id":"21ca654c-8798-4748-ae07-cac4c4654afa","resolution":{"observed_at":"2026-08-06T18:19:58.482559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.215989Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.215989Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:40a0be3b5f7b7b0e975f04862152f91f89d0ffb1cbe31426497cec170ba72c30","observation_id":"6233736e-00d0-45bb-a043-a7cba9c56470","resolution":{"observed_at":"2026-08-06T18:18:45.215989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.325805Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.325805Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:196853e7e9131f4072b6364175c404430d20751bb6841ba2412da673e9a3fdb8","observation_id":"8fe3c809-e63e-4f17-ae2a-7ed19de952a0","resolution":{"observed_at":"2026-08-06T18:18:45.325805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.401247Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.401247Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:16851a0af4ed3c423e94d71601c4d68e8aa1b4dcbe60e550b4c50baf086f2d27","observation_id":"c7189918-21d6-4020-a0d7-b828d7412d6d","resolution":{"observed_at":"2026-08-06T18:18:45.401247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.448732Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":"b961a284-ed9f-4b14-9eab-245ca4fdc81f","year":null},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.492571Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:3c2c8bd05f5ba3e47b9c25253b78765cd5278b75a67c14e37cafc775e11a7738","observation_id":"1a1376e0-81c8-435b-9c09-1c69de0c4497","resolution":{"observed_at":"2026-08-06T18:19:58.451864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.439444Z","title":"What you see is what you read? improv- ing text-image alignment evaluation,","venue":null,"work_id":"d904ecb4-0dad-4593-bef1-6023f1fa8e4b","year":2023},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.585156Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ee2553cad4597df27931f8437f0b5a9eae1deba94ff048b67d96ff95b7577b47","observation_id":"196d3fa2-6bb0-4897-a325-0db460aa2a3f","resolution":{"observed_at":"2026-08-06T18:19:58.442462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.429631Z","title":"Fast, accurate, and lightweight memory-enhanced embedding learning framework for image-text retrieval,","venue":null,"work_id":"bf5b5233-7507-48e3-bd52-f6c61e7f32fa","year":2024},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.683674Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ebaaafbf7af9ec20bfc5c7e214294256db6b0f5a3b50fe313fb2936851b94d39","observation_id":"738d87d5-2d8d-40ca-a429-d349426f4e66","resolution":{"observed_at":"2026-08-06T18:19:58.432955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.412282Z","title":"Vilbertscore: Evaluating image caption using vision-and-language bert,","venue":null,"work_id":"30e3c2bd-b379-4cc7-8bfb-fbed878e8eeb","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.769679Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:d2d380b0622422a21dad52f98ff295e5eba1843c8da17b5aad0aef9b7fcf8686","observation_id":"34fd9183-3893-4f64-bb97-884567a1abe8","resolution":{"observed_at":"2026-08-06T18:19:58.421682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.390397Z","title":"Image-text alignment and retrieval using light-weight transformer,","venue":null,"work_id":"f7822d92-6865-4758-9911-c629232eb339","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.864014Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:72a5ba8e69f7d23253a8203bf50152f77ad008d7efe8cdcedcd5cc60b86656eb","observation_id":"16462428-c0fa-474d-a16c-51ad33ce8d5e","resolution":{"observed_at":"2026-08-06T18:19:58.396031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14019","last_updated":"2021-06-26T13:27:14Z","snapshot_observed_at":"2026-08-16T18:14:18.939615Z","submitted_at":"2021-06-26T13:27:14Z","title":"UMIC: An Unreferenced Metric for Image Captioning via Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14019","snapshot_observed_at":"2026-08-06T18:18:45.987661Z","title":"Umic: An unreferenced metric for image captioning via contrastive learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.987661Z"},"links":{"cited_paper":"/paper/2106.14019","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:00703bc833df83d4f17a33e418937538019be5aec4721c45e6a6e19b55930cc8","observation_id":"b86d9278-ae41-4bd3-929a-1f025224a9f0","resolution":{"observed_at":"2026-08-06T18:18:45.987661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.378386Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":"cdd60c32-b7c8-4e6d-a43c-44dc5ac0dd90","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.060303Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:e0a0fbe071536da0930d477cf604b45f7f5c4a8d86a335cc1ddded877cd275ab","observation_id":"b11e06f7-676b-404a-b3d5-0d11a036e1a1","resolution":{"observed_at":"2026-08-06T18:19:58.382031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.362626Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":"bcc35bda-a582-4088-b4fa-3836db8063b9","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.129387Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:a7e8f654cf0f59e4fd9570c8af0396df779ed91adbcd52c7c51b233861f573d5","observation_id":"523b857d-58f0-4d9e-94a8-81e3b919172a","resolution":{"observed_at":"2026-08-06T18:19:58.369989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.342548Z","title":"Quality estimation for image captions based on large-scale human evaluations,","venue":null,"work_id":"0fa4e095-04a3-43d5-b0b3-fad6332e534b","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.244803Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:84cc02c4e9bebff203523a2d1201b3c0ae5e18f5aee2a1b0ac8158e7f5402b73","observation_id":"10672b9f-a868-466f-8a6c-b1c479216c38","resolution":{"observed_at":"2026-08-06T18:19:58.346489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.325145Z","title":"Revealing the dark secrets of bert,","venue":null,"work_id":"a3d08933-d890-4f43-b935-296816d849bd","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.370999Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:f220f864912c4d9d303f52afb213b7a66e145e34a4339fb70f706d033149a5af","observation_id":"067683fa-cef1-4c83-811c-27ee9be55865","resolution":{"observed_at":"2026-08-06T18:19:58.328710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.311681Z","title":"Minivit: Compressing vision transformers with weight multiplexing,","venue":null,"work_id":"f6d828fb-a853-43b1-b164-1ad0078916fa","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.521919Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:953f2fb9d7573d034616dd91a7e58b3a9ff941501ddc10aed6ebeaa60431d23f","observation_id":"104ac830-39ae-4fed-9f7f-ce993210402d","resolution":{"observed_at":"2026-08-06T18:19:58.318090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-08-18T01:27:11.590348Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-06T18:18:46.607900Z","title":"Albert: A lite bert for self-supervised learning of language representa- tions,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.607900Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:651a24fa68155493d7d2b9b3ae0f2387c2ebdbd9806b5ee8546277078db266e8","observation_id":"8ad54b67-70ec-4ebe-9c0d-6cd9ca908c74","resolution":{"observed_at":"2026-08-06T18:18:46.607900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.264467Z","title":"Enabling multimodal generation on clip via vision-language knowledge distilla- tion,","venue":null,"work_id":"b6b17e39-ed63-4dcf-ba1b-0daf67ceacea","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.699499Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8be6642d6d7f5456df83c42ab84ca9937f059e5320fc635f9f1c5503b72e7507","observation_id":"ee9aa492-63a3-4d64-b84b-55e70a95c154","resolution":{"observed_at":"2026-08-06T18:19:58.291873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05729","last_updated":"2022-12-28T20:07:58Z","snapshot_observed_at":"2026-08-16T17:28:13.569049Z","submitted_at":"2022-01-15T01:54:01Z","title":"CLIP-TD: CLIP Targeted Distillation for Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05729","snapshot_observed_at":"2026-08-06T18:18:46.816291Z","title":"Clip-td: Clip targeted distillation for vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.816291Z"},"links":{"cited_paper":"/paper/2201.05729","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:21fa9dfabce9220d1e3b2ebbb24fefa2506ada4f4a6130a7f95beb3bf14ab5ec","observation_id":"65ec115c-e93a-478d-a9bb-c43a8a8ca597","resolution":{"observed_at":"2026-08-06T18:18:46.816291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:46.902472Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.902472Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:b5889cd360989dcb3ed33ad2c9f23f6907d38bba2fb4e8578b5e738e280b00f7","observation_id":"60ba08d4-fc9b-4506-a040-d906a169dae3","resolution":{"observed_at":"2026-08-06T18:18:46.902472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.215242Z","title":"Sca-cnn: Spatial and channel-wise attention in convolutional networks for image captioning,","venue":null,"work_id":"6ee045b1-f8ee-464d-b6ba-bb921ce1fc31","year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.017461Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:a4df7c65efc7e8c5ec1df6aaa7665d23cbb74d0dcffd0dfbcb03791ff2094f24","observation_id":"c0f769db-72fa-4407-b8cd-bcbe1e6ffbd3","resolution":{"observed_at":"2026-08-06T18:19:58.226808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.159954Z","title":"Knowing when to look: Adaptive attention via a visual sentinel for image captioning,","venue":null,"work_id":"77264519-a93a-40d0-b4b4-d13dc733da6a","year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.108684Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:277bd63b061f45276fa7830424f0e24a89199f0699e7db6c5c6d48812f043d91","observation_id":"571e6b59-0e11-4213-bfca-acffcc3b3899","resolution":{"observed_at":"2026-08-06T18:19:58.182859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:57.318086Z","title":"Know more say less: Image captioning based on scene graphs,","venue":null,"work_id":"f6513a60-18b0-4dcf-b343-76272d65ea00","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.214435Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:7802115c5db49a5560a4191cb8502fe21a905c56cdf40c28c963c92b13579485","observation_id":"c435e904-4efc-468e-90e1-77a151c923e6","resolution":{"observed_at":"2026-08-06T18:18:57.441150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:57.044815Z","title":"High-quality image cap- tioning with fine-grained and semantic-guided visual attention,","venue":null,"work_id":"909df86f-8b76-4f8b-85d1-ac019ac59fcb","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.379950Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:31a7cc42cf4507d944a7236fd57dd46da305ed31acb01421a54f8d4e50b72c67","observation_id":"9192a4e7-23b4-4c75-aad3-0e2a41fc051a","resolution":{"observed_at":"2026-08-06T18:18:57.142395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.857544Z","title":"Multimodal transformer with multi- view visual representation for image captioning,","venue":null,"work_id":"d3e34999-5a7f-41e8-aaaf-64969bea5642","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.450394Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8e0c4132cea4ee0cb54158cb0f8da87279b6853f81bd036402c33935e56c895f","observation_id":"45cf7118-9da8-4cb3-b021-9ce38f332a1e","resolution":{"observed_at":"2026-08-06T18:18:56.954306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.682345Z","title":"Compact bidirectional transformer for image captioning,","venue":null,"work_id":"06b7a8cb-a4f6-490c-8b9d-c25059704f8c","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.571278Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:f32d7af29edee4a6432f3f957154a25f42cdf0d76d4eca8db10c6c2d93d20990","observation_id":"9dbb5512-162e-4619-b482-2081258a674a","resolution":{"observed_at":"2026-08-06T18:18:56.756704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.413672Z","title":"Task-adaptive attention for image captioning,","venue":null,"work_id":"5fb2fb87-d728-4649-8cf9-1510e4735cbd","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.661175Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:5cd240090b3e841615a2740c29b2c46ffc2a0d7167f6a7e8428fa1b16c4237f6","observation_id":"58c688ad-e4fc-45fb-a40f-f41e3ad78348","resolution":{"observed_at":"2026-08-06T18:18:56.571741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.146463Z","title":"Textual context-aware dense captioning with diverse words,","venue":null,"work_id":"6b71c162-42e7-460c-80c2-b7e8fd36548d","year":2023},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.728248Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:91987626ecc596e7095e9e77ca0693fc9a402849f647357fe5949919f35780f8","observation_id":"b8faab56-4325-4121-a7fa-e0fc61873d7c","resolution":{"observed_at":"2026-08-06T18:18:56.262369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:47.800623Z","title":"Meteor: An automatic metric for mt evalua- tion with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.800623Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ad3d7f75a7b93d8598c6c93b3d2549757b38b9838f52d488d1c04536c6903828","observation_id":"46457da1-e0aa-4070-8373-e2adfac91838","resolution":{"observed_at":"2026-08-06T18:18:47.800623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:47.891704Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.891704Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:2a820d775f66eb90c5c4b53f1fefb99c80d462c19698fde3c8eb5718d4791a5c","observation_id":"a5722b42-588b-466a-be6c-900b74189f3e","resolution":{"observed_at":"2026-08-06T18:18:47.891704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:47.956604Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.956604Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:23209a6e4310a5b4408bac60338897ac07881c6ac40a5ed813d6f40a26f7aec4","observation_id":"b440dc69-0d02-42c1-a27d-3735867b32a8","resolution":{"observed_at":"2026-08-06T18:18:47.956604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T18:18:48.077301Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.077301Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:d665a347ee2e2af9c4636747360a79d92f27bbbf3df2cb841449381b682ec6c2","observation_id":"9266a018-e0eb-40f0-a5ec-d9b3eb341cf1","resolution":{"observed_at":"2026-08-06T18:18:48.077301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.887518Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":"8e89bd9c-1d42-4028-9728-eb55d8898fc0","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.194780Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:7cffe2d691ff34a64cae87a99306571bcc819338df5a39ea81c9b304578eaf99","observation_id":"ac99a651-3121-4d31-8668-a42d84296387","resolution":{"observed_at":"2026-08-06T18:18:55.989883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.610754Z","title":"Tiger: Text-to-image grounding for image caption evalua- tion,","venue":null,"work_id":"a7f60590-4383-4410-8608-6fe1f42b7a9a","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.326568Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:96038dfc2d2a7d0463830e57066819c6fc6b9cfd6a92a47b75db15a9a20451c1","observation_id":"9e56f2de-0a44-46f0-8363-b3366ecad143","resolution":{"observed_at":"2026-08-06T18:18:55.753289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.406854Z","title":"Em- score: Evaluating video captioning via coarse-grained and fine-grained embedding matching,","venue":null,"work_id":"dbd7a6c2-32b9-42d2-be9a-0c15d33131aa","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.435085Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:920689d9983a361ea4d958783b5b96acdff810461f78518a47b99ffedd6ccfa2","observation_id":"473024b0-5264-48ed-91fa-011520487af3","resolution":{"observed_at":"2026-08-06T18:18:55.505044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:48.555233Z","title":"Gpt-3: Its nature, scope, limits, and consequences,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.555233Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:45bb1ed4935565e31394424a3d878a8bf675f099313f10d0af9d292a794ecb13","observation_id":"2bebff7b-075d-4dc3-9477-81a543bc9c20","resolution":{"observed_at":"2026-08-06T18:18:48.555233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.121439Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehen- sion,","venue":null,"work_id":"42085db5-2462-48de-b6b3-751305c57f85","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.636684Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:3a5e8206cae4a02f33a08454caa3a3da6e3587b859e622ad584a5ff2491046b5","observation_id":"0e0d5cf6-ec6d-4216-9234-d04b0fb41152","resolution":{"observed_at":"2026-08-06T18:18:55.274386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:48.724702Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.724702Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:50b602e7a8531657780b8dfb8a20ca49d8f09cae9161ffa382f1c9e2bb2d5286","observation_id":"1b91fbc6-9386-456e-9543-9953ab43f225","resolution":{"observed_at":"2026-08-06T18:18:48.724702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-16T16:37:39.300058Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-06T18:18:48.992310Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.992310Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:c31e30ed8c1b116ba400533d22aed5fbc05fa390050cf6f46e8b3432bd367817","observation_id":"2f07502a-6d12-430e-8cbe-bf26a807362b","resolution":{"observed_at":"2026-08-06T18:18:48.992310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-06T18:18:49.108576Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.108576Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:e6b642d31076ef6307f7cd25d58a7945c16ebaef037a394a1aa86bb5179489fa","observation_id":"e4c820e8-97fb-4d58-8dae-ad870c5dcfc1","resolution":{"observed_at":"2026-08-06T18:18:49.108576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.849343Z","title":"Slip: Self-supervision meets language-image pre-training,","venue":null,"work_id":"f98bd169-3449-4643-b404-027c75b9d90a","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.294938Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6a8b034d83146b361fc388813b65374372ae70d1ea3f753bf019ece5a1bfff7c","observation_id":"671a853a-d350-4185-a7bd-c000fcfee516","resolution":{"observed_at":"2026-08-06T18:18:54.996841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.08710","last_updated":"2017-03-10T17:57:56Z","snapshot_observed_at":"2026-08-14T21:42:03.106939Z","submitted_at":"2016-08-31T02:29:59Z","title":"Pruning Filters for Efficient ConvNets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.08710","snapshot_observed_at":"2026-08-06T18:18:49.439407Z","title":"Pruning filters for efficient convnets,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.439407Z"},"links":{"cited_paper":"/paper/1608.08710","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:c83f831cee7ce123cc6ce5e8c346b9f6b4ddf9eaec25e9765c40203a4887abc8","observation_id":"d5a17254-2f11-44e3-be44-f90bd97b8975","resolution":{"observed_at":"2026-08-06T18:18:49.439407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08500","last_updated":"2021-08-14T06:06:37Z","snapshot_observed_at":"2026-08-16T18:30:54.894095Z","submitted_at":"2021-04-17T09:49:24Z","title":"Vision Transformer Pruning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08500","snapshot_observed_at":"2026-08-06T18:18:49.586224Z","title":"Vision transformer pruning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.586224Z"},"links":{"cited_paper":"/paper/2104.08500","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:b6a27e45fe40bbdfc955a8bcd65c2c71a792e889bb7264cc2cd6846b37f73d31","observation_id":"ede5327c-922a-4ed8-9555-cb7fb26c0b0c","resolution":{"observed_at":"2026-08-06T18:18:49.586224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.568318Z","title":"Post-training quantization for vision transformer,","venue":null,"work_id":"97f4807d-0e77-48c0-be77-afddd227086e","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.787638Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:26320db5a36bb7fce41c46eda221ce697efc1a85830af2f629a888df09012672","observation_id":"df4b184b-157f-4be5-a4cf-3c00dbcc0f2f","resolution":{"observed_at":"2026-08-06T18:18:54.652256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.343780Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers,","venue":null,"work_id":"8679dd88-972f-44de-bb0d-15e317e1aa15","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.905742Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:2d5b5992a314c30c5046b243594620dac99c9560f9267072a6006d4846dd1a89","observation_id":"0505ab65-2ef6-496c-98ae-c4ec38866818","resolution":{"observed_at":"2026-08-06T18:18:54.444617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.199508Z","title":"Tinybert: Distilling bert for natural language understanding,","venue":null,"work_id":"237c99d2-2519-457e-b09e-9bc523192764","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.076329Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6b696b44710269bac5b601197089ca9e41371581d79acb8aefffa464417d166a","observation_id":"0b0011c6-d04c-4753-abb2-3a5bdf78d27f","resolution":{"observed_at":"2026-08-06T18:18:54.259692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-06T18:18:50.162524Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.162524Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6a15d6609e9a2b3850517a6d55e5b30f5d8c617e795300fb3b8d9f43ef52dada","observation_id":"2b89c3d1-403f-4093-b9d5-8456c1de0eb0","resolution":{"observed_at":"2026-08-06T18:18:50.162524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:50.303885Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.303885Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:3c5f6e026e75dc165c09195967516c9ecd30a5e7481b0dbe4e45a7425efc1433","observation_id":"b39e71e5-76e7-4887-a9a7-cdab83f87c18","resolution":{"observed_at":"2026-08-06T18:18:50.303885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:50.460291Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.460291Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:531cbc4e478d53863d2ef6d8b3d5acb35e42ae7ae98259fbd269a44b8f3ecc01","observation_id":"57e846a7-95fc-4f08-b549-f0006eaa6703","resolution":{"observed_at":"2026-08-06T18:18:50.460291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:18:50.608287Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.608287Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:e9d3652862a4255bc249ddc9bdc835d77a11c99be7aa16e95e6219d5b464574c","observation_id":"507da7cf-40af-4f7e-b50a-a3421316f702","resolution":{"observed_at":"2026-08-06T18:18:50.608287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.992303Z","title":"Bag of tricks for image classification with convolutional neural networks,","venue":null,"work_id":"f3eda01d-2f93-4a0d-bcc6-acd66a71dda2","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.761420Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:247e75d070d10c1d4fbda7bdad14bb71063049b572263ce8acd7e2fb42b2ea43","observation_id":"6b05c5f1-1756-47bf-91a4-56717f2c1ae2","resolution":{"observed_at":"2026-08-06T18:18:54.104734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.707353Z","title":"Making convolutional networks shift-invariant again,","venue":null,"work_id":"d2243788-3703-4c20-83a5-58cd5f1d24b5","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.886873Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8c7b58b0ab0ea08366e54e5d32a97d1d09fb3bc9cdfc3511da0fbd4118cf7c20","observation_id":"4af3bb92-6134-416d-b4aa-62c6937a5550","resolution":{"observed_at":"2026-08-06T18:18:53.800069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.397261Z","title":"Discriminability objective for training descriptive captions,","venue":null,"work_id":"7cf8aad8-fea5-46b6-8fbe-15e5b44a5f82","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.986021Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:1ab60931ca336078b2c82de03a41d8a867d243321297bfb1e2048ea602928401","observation_id":"20d691ff-b298-4771-935b-70f04e205385","resolution":{"observed_at":"2026-08-06T18:18:53.570868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:51.056134Z","title":"ImageNet Large Scale Visual Recognition Challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.056134Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:0b01db373ce0da4dc2291032648622cfb385c5c4ef7f0483c1672ad1968126b0","observation_id":"07f51bdc-c850-49b2-81e8-fb98b53f422f","resolution":{"observed_at":"2026-08-06T18:18:51.056134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.185664Z","title":"Framing image description as a ranking task: Data, models and evaluation metrics,","venue":null,"work_id":"c75a2b59-dc15-4d92-a073-d5e15db0affd","year":2013},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.171017Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:da984f631d2b2de81568568633bcf942aa91303873c435b50585ee647b64ce90","observation_id":"2ba5db4d-d95c-41f0-a492-b0611a25abff","resolution":{"observed_at":"2026-08-06T18:18:53.266631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03292","last_updated":"2015-11-10T21:14:51Z","snapshot_observed_at":"2026-08-15T08:14:16.255380Z","submitted_at":"2015-11-10T21:14:51Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03292","snapshot_observed_at":"2026-08-06T18:18:51.241514Z","title":"From im- ages to sentences through scene description graphs using commonsense reasoning and knowledge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.241514Z"},"links":{"cited_paper":"/paper/1511.03292","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4492827b599f2fff0c4c4c3ea0403a00c34e8d2a127a27aaa7ac221e1f788156","observation_id":"fa8cb4f5-4a9b-4e46-b2d8-af3aa3151a8b","resolution":{"observed_at":"2026-08-06T18:18:51.241514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.874512Z","title":"Consensus-based image description evaluation,","venue":null,"work_id":"ca082268-5e1c-4763-8653-c4dc04bb7a03","year":null},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.305407Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:11d892830c59534da54789325fe7c1d9e513dc36e1056f75692a3bd30c2d2822","observation_id":"b5ca7f10-23d0-4445-9220-275089ddd46e","resolution":{"observed_at":"2026-08-06T18:18:53.042948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.606334Z","title":"Foil it! find one mismatch between image and language caption,","venue":null,"work_id":"0f0a225e-b11f-4c67-8a2e-0c69320a6b9f","year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.395791Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:78e6bcc0b5db9c72d5f170bff4952654175b1ac53c57c5e72d4c5e10cc8d17f9","observation_id":"0433243b-fd85-4fcc-af24-11e652ff5144","resolution":{"observed_at":"2026-08-06T18:18:52.700175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.483763Z","title":"Deep visual-semantic alignments for gen- erating image descriptions,","venue":null,"work_id":"2d627b73-945b-4217-8848-762c209cbe7f","year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.477940Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8148c17a45071cef93eb2b51553854ce7e928e0accead59d6fb4739803a5fb47","observation_id":"6705d649-e7d7-4e3f-9634-a4129066491c","resolution":{"observed_at":"2026-08-06T18:18:52.538573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.330490Z","title":"Vinvl: Revisiting visual representations in vision-language models,","venue":null,"work_id":"b65bb24e-22be-48d4-beaf-18c860d3864b","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.554693Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8eb6c258e0e26387e080917f5357a54433f2e41be8199474e5dd7e1179cc110f","observation_id":"24f8f060-4a72-4d69-a4fb-4b7d196df7b4","resolution":{"observed_at":"2026-08-06T18:18:52.392262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.197324Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"90213cf7-82e5-4cdb-b92f-3cef9eeb4dd1","year":2014},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.640789Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ece13ffb443cf863c7ecb3a83f48eaa6028020edf59799041410a0e139703c70","observation_id":"8dd056fb-e566-42b9-a6c3-2a426bbf0ca9","resolution":{"observed_at":"2026-08-06T18:18:52.258827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.080141Z","title":"Improving image captioning evaluation by considering inter references variance,","venue":null,"work_id":"fb2c3078-0396-412b-b33b-6fc17cde5917","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.705906Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6da99a7dd590e090dfe7d950f907986b48c14fd7f64b6ac28935020b50b25f94","observation_id":"fc4aa0b8-2168-462a-8dd9-58111a0fc563","resolution":{"observed_at":"2026-08-06T18:18:52.129394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T18:18:51.809319Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.809319Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ce5b3c44aafe5a7dea29e84ffd9349f378b86fd7a7f11e04225b10bbcd33cc6c","observation_id":"380b0f08-6362-4ce7-8203-5776db952ae8","resolution":{"observed_at":"2026-08-06T18:18:51.809319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04549","last_updated":"2024-07-05T14:34:50Z","snapshot_observed_at":"2026-08-16T13:36:45.837914Z","submitted_at":"2024-07-05T14:34:50Z","title":"Spontaneous Reward Hacking in Iterative Self-Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04549","snapshot_observed_at":"2026-08-06T18:18:51.876640Z","title":"Spontaneous reward hacking in iterative self-refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.876640Z"},"links":{"cited_paper":"/paper/2407.04549","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:a427173124296013b924d7d66ea6084016b04741e875a6c813b5f79da4d876e0","observation_id":"61a01979-bf04-494a-9ff6-eac046908ce5","resolution":{"observed_at":"2026-08-06T18:18:51.876640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T16:56:26.959271Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2507.08710."}