{"as_of":"2026-08-21T08:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3e25e26c014144f03a0fb6a77b259b535c7dd82a69f8f5be839fd0230aa772a","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:15:57.460723Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09155/citation-record","integrity":"/paper/2501.09155/integrity","json":"/paper/2501.09155/citation-record.json","paper":"/paper/2501.09155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.242575Z","title":"Springer New York, New York, NY, 2008","venue":null,"work_id":"3708177a-8100-4532-8f55-85cbc8ec8cf9","year":2008},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.247270Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:1742accddbd70ff8e2d832b4a64edadb597696dfc545082fe3cd7cda001295bc","observation_id":"65ebb3eb-4f73-4310-9b5b-8d357fb65d47","resolution":{"observed_at":"2026-08-10T20:15:58.247236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.226702Z","title":null,"venue":null,"work_id":"17da527a-010f-4352-b0d8-8f7f1b7892f4","year":2020},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.254697Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:ff05c597d54c799a6bc2ec349fa41e6654a2a93ab833ec2ab7bfd81406b19431","observation_id":"5b4598df-9a43-4ffe-ab77-63c431e97c4a","resolution":{"observed_at":"2026-08-10T20:15:58.231343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.210171Z","title":"Aditya, Y","venue":null,"work_id":"bb7431c4-9233-4a05-b73b-b3497d8a4fa0","year":2018},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.260749Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:686794d64128fe493680396bea86b981bb43c3f9d41ff54f2e6f4d47cc2b4524","observation_id":"b3fa7de7-5b49-4dff-8a8b-3d8b58925a7f","resolution":{"observed_at":"2026-08-10T20:15:58.216537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.188627Z","title":"Anderson, B","venue":null,"work_id":"04ba2de7-b86d-455d-b4d3-6263bf5f48ad","year":2016},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.266727Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:e3bef016fdef19ad8947a26294e0e4355296eb5d6cdc9883004898bb51a4fd5c","observation_id":"557d2f3c-7760-4969-879f-2403280692a4","resolution":{"observed_at":"2026-08-10T20:15:58.194350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.167079Z","title":"Aneja, A","venue":null,"work_id":"ce83fd0c-6eb8-4629-8e31-a96633c9ddf0","year":null},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.271352Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:16beb9d88ab9f339cd34fd3cf58b0f2f34a850216f4122c7508dd0d486f05448","observation_id":"f1beebc2-8f8e-43ee-9d06-28f57e4153f8","resolution":{"observed_at":"2026-08-10T20:15:58.174182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.150953Z","title":"Carion, F","venue":null,"work_id":"e8e91e2d-6fcc-4985-aaaa-907387b7ad55","year":2020},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.276188Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:67c1d8f4fd43368fde30425d5dd19ab41fb4571d13c981e5fb4774d4c8ac0f42","observation_id":"9e8a0d37-c3d0-45ec-a70f-7333868b19dc","resolution":{"observed_at":"2026-08-10T20:15:58.156389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.133117Z","title":"Cornia, M","venue":null,"work_id":"6a021c76-e62c-4a55-823f-c58697fd9638","year":2020},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.281106Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:c7888031df9928af68e20e475aab0f39116d7e8da16486d5b2da967a0706402b","observation_id":"cc9a1d59-7d73-4d88-b85f-2ae53b22e3d1","resolution":{"observed_at":"2026-08-10T20:15:58.138784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.108900Z","title":null,"venue":null,"work_id":"fccd54f1-c622-4fdf-ab40-0bf6734eee30","year":2018},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.286019Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:a92a6168cefa1df99c0e012954033947cadb033e4c7f408193a519aaca28c823","observation_id":"2117796b-1b92-4efe-912f-c23573234fe0","resolution":{"observed_at":"2026-08-10T20:15:58.114738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.090544Z","title":"Devlin, M","venue":null,"work_id":"d34a749a-8c4c-4cea-810a-73c9236fe19a","year":2019},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.290272Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:7112dcc4dcee6f1191b6d58ae14e12b4a8962ac53d25ba9aa1da6ff60829adc2","observation_id":"4381c911-4e5c-4b39-9cb3-66db67b41973","resolution":{"observed_at":"2026-08-10T20:15:58.096576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.073791Z","title":null,"venue":null,"work_id":"57e716e3-7288-4157-ad7e-7d311aedcfb9","year":2004},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.294793Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:6bf2950b605d5440ff36b4e322295c815dae203f128802b1a3bd27e05bea6cc7","observation_id":"5af8ffbc-1dd6-4f45-91a5-52879b9b5a47","resolution":{"observed_at":"2026-08-10T20:15:58.079781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.059384Z","title":null,"venue":null,"work_id":"297fa56c-e775-460b-8e1a-d357d3539969","year":2001},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.299636Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:cfa2586fce60d538489210782dac7d5208c176269794a8cca91c411deb994490","observation_id":"a09aec31-3044-44f8-9856-7a63ad2b0507","resolution":{"observed_at":"2026-08-10T20:15:58.064380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.037347Z","title":"Gonz´ alez-Ch´ avez, G","venue":null,"work_id":"5dc59225-85d0-4767-89be-6ba47f76479b","year":2024},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.304071Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:f6941862d604d22cbeaa0610a961921612f0ac1d34e83b48184bb87261e1605c","observation_id":"47d7930b-3290-4e14-b065-b89416f9759b","resolution":{"observed_at":"2026-08-10T20:15:58.043912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.019573Z","title":null,"venue":null,"work_id":"d0e91286-9581-46f2-bfe8-5f7c5817e454","year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.309515Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:873e9152c7f1b8ad68daa7448f35fbc271a592befd188ee23557d6803ed62c30","observation_id":"dee7aec3-8330-41f7-bd85-cc5b9bde2d5f","resolution":{"observed_at":"2026-08-10T20:15:58.026461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.998569Z","title":"Hodosh, P","venue":null,"work_id":"c1bf36f1-312f-4bec-b0d8-163125cc8364","year":2013},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.317543Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:11d0e990669a00bb590799ac668f564c02640ede75b3a17351d6fd8e19d0c235","observation_id":"3c9d3916-7670-4853-8863-b649ab24e444","resolution":{"observed_at":"2026-08-10T20:15:58.005410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.978847Z","title":"Kasai, K","venue":null,"work_id":"e77635df-5fde-4b62-903a-be694df13f0e","year":2022},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.321804Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:7595e0674d6e6d60d14ede6c3c874991a31cc5a2c3dcb70128a42bae198c27db","observation_id":"9e50a53c-1121-4a36-a052-a3bbe84f2b33","resolution":{"observed_at":"2026-08-10T20:15:57.986157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.958172Z","title":null,"venue":null,"work_id":"c13cddc1-05a0-460f-ac7f-a09361b8e868","year":1948},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.326591Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:5419e05252712d89aceddaa9ca4e95377c4274cd48299c31418a81fef7e19b55","observation_id":"4d6ba391-c6c6-42d3-8cf6-9f49928df913","resolution":{"observed_at":"2026-08-10T20:15:57.963864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.937980Z","title":null,"venue":null,"work_id":"be20cf06-aa6e-48cf-8062-c1b263556492","year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.331813Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:0835a8fd03d396a070ea57e1292d557573b6b2c37c4553651c8255c563461f45","observation_id":"02f0908e-911d-4a3a-b821-dce02eb069c5","resolution":{"observed_at":"2026-08-10T20:15:57.945190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.919735Z","title":"Krippendorff","venue":null,"work_id":"ce6ea15c-cc4a-4e53-bca2-d80b9334dfa8","year":2009},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.336628Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:2cc8ffd314c25cdd045c35c513e1cfd81ac24385ef9074f6310579a24acb8608","observation_id":"b454c05e-481c-436c-bfe6-4df6c811887c","resolution":{"observed_at":"2026-08-10T20:15:57.925982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.901266Z","title":"Krippendorff","venue":null,"work_id":"a43578e7-db5c-45ed-b042-2a2a7cd2636e","year":2011},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.341156Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:cd4894c9456a3dece86e3eb32f10f5654a0c3ed0d6f4f9d7fd6be7d277218ded","observation_id":"1649a973-3f22-4334-bb7d-a0ce0c26ca16","resolution":{"observed_at":"2026-08-10T20:15:57.907003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.880571Z","title":"Lavie and A","venue":null,"work_id":"dd73a01c-a46a-4bed-8f6c-35c514317542","year":2007},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.345662Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:cd82514834feb755ddfcec758ba3a61cf5c0809d0447c557cdd43849b069fd17","observation_id":"9088461f-61ed-44d1-aeca-929d35000d3c","resolution":{"observed_at":"2026-08-10T20:15:57.888941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.861165Z","title":"Levinboim, A","venue":null,"work_id":"cfd5e24d-e46f-43a3-9170-0c43873554be","year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.350160Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:47d9dcd6e5e06ae3a86079d15ecb1572df941a70dfa8b1390ee1cef5541c551a","observation_id":"fb159076-4cea-4149-a0ba-e4b28b5ee87f","resolution":{"observed_at":"2026-08-10T20:15:57.867204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.355863Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.355863Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:421cde8df41307c873b927f827e39d14cb332bedb5815251534cdedb0be9050c","observation_id":"d1c3cae0-2169-4ec2-b920-b7a98d027277","resolution":{"observed_at":"2026-08-10T20:15:57.355863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.834028Z","title":null,"venue":null,"work_id":"568c904b-e782-46db-a52f-8fca43cd2761","year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.360682Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:045f5fb94a2c913f951a0b515687a0a6ff7e8aede57c1c85f32c1f0307c4170f","observation_id":"e9f5bffc-e62a-4565-9af0-516dd8fc398e","resolution":{"observed_at":"2026-08-10T20:15:57.838405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.366327Z","title":null,"venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.366327Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:8c71edb5c0dff1ec6b2174d39361acc920def4a1680f4d12b5ec369bbfaea079","observation_id":"772b51ef-5b30-4dba-b984-64907d6908b0","resolution":{"observed_at":"2026-08-10T20:15:57.366327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.801896Z","title":"Lin and F","venue":null,"work_id":"1d3c4c17-ee45-4267-993d-55c2e6fa90be","year":2004},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.370175Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:415882ea2515a87b485dce2f07ae93de585cb447adde1696f9ce925414082d4e","observation_id":"6d3915eb-1b89-48bc-831a-440902a8c71f","resolution":{"observed_at":"2026-08-10T20:15:57.807380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.784823Z","title":null,"venue":null,"work_id":"b1395e1b-cd9c-4d0b-9e6b-4a9b41c7f177","year":2014},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.374598Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:b45a951c9e0e8df23c680a8a3cfc30559e19c313a5ce2538757e25fdb97d904a","observation_id":"1ba33e88-375d-47a0-99aa-fef0a018492f","resolution":{"observed_at":"2026-08-10T20:15:57.790960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.762324Z","title":null,"venue":null,"work_id":"55269605-e3dc-4e61-a763-e640dffe27ae","year":2017},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.378590Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:eafa0c69de96426d073de7584c7a14279c579330c3ca22755b8b7f3f07b928d1","observation_id":"4cde52b5-4ce0-4038-8096-d4bc2ac5d7eb","resolution":{"observed_at":"2026-08-10T20:15:57.767531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.743912Z","title":"Moctezuma, T","venue":null,"work_id":"cf156940-4325-40b5-acfe-edc174aafc7e","year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.383350Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:4beaf1bcf0729d9a640f2a74d588495f7dacce69f3bdab06cf41efbedee2137a","observation_id":"9ddb9518-4557-4bc6-be62-adc6643d47c0","resolution":{"observed_at":"2026-08-10T20:15:57.749495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.726504Z","title":null,"venue":null,"work_id":"fd643a98-17f4-4163-ba4e-31e08bf9066f","year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.387863Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:b4d1f7da32a1a81d0d581fd0671862b213949676a144b28337d39fa7d749c5c0","observation_id":"0d93616d-5668-47ef-b8fc-9cc047206a94","resolution":{"observed_at":"2026-08-10T20:15:57.733545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.707140Z","title":null,"venue":null,"work_id":"807177b1-51f6-40d4-b574-88e304af4df4","year":1995},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.391993Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:562d3959c388b4e02309a7c7a7913ebdde38feef72fa9f38435e05a0f5e1cfc1","observation_id":"d7c165a0-03a1-4fe5-8b98-329c53af196c","resolution":{"observed_at":"2026-08-10T20:15:57.712620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.691045Z","title":"Papineni, S","venue":null,"work_id":"39717039-42fe-4c5d-b424-99f551fdcd61","year":2002},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.396570Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:ddbf028b75efbbbf8de8929b367a62e9d64d539cca24f3ad2b04df1a1a316419","observation_id":"3289be5b-6e5b-4b2d-b8db-e1d0a10bbb35","resolution":{"observed_at":"2026-08-10T20:15:57.696719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.677191Z","title":null,"venue":null,"work_id":"ee97ffc9-0c32-483d-b7eb-695620f71c13","year":2011},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.402073Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:b101074276b895dad804fc20d956b81faa6edc871f7e56b0bb5eb2e7d5916b24","observation_id":"0ed91ce9-5d1b-4e2c-89a0-6be33c8a410b","resolution":{"observed_at":"2026-08-10T20:15:57.681779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.406166Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.406166Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:e0545bb38f7dcb37f474344d2ccdbabac21370e01c7826091f33218b15bbf66f","observation_id":"21ff81ff-e9e1-4fa6-808a-edf03c311a97","resolution":{"observed_at":"2026-08-10T20:15:57.406166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-10T20:15:57.410119Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.410119Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:3ed45a314c0c3451b9d9f1d580abcd3d5e20d23ec8aa146188d9d96d8f51668b","observation_id":"9b705bf6-9c45-45ed-984d-87d7a3e151fb","resolution":{"observed_at":"2026-08-10T20:15:57.410119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.651606Z","title":"Rahman, N","venue":null,"work_id":"6ee8d845-8ce1-4779-a876-9d2c72bf6a9c","year":2019},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.414356Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:d1e813e8ea9f2fc5e0fd8678ed01ab8fbb95303c0647d31f92347ab20f3cf432","observation_id":"d65728e6-742e-4dcb-a59e-1ccab7b95f2a","resolution":{"observed_at":"2026-08-10T20:15:57.656746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.635501Z","title":"Schall, K","venue":null,"work_id":"aef7502a-8896-4402-9f0b-6dc2c01cf410","year":2024},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.419586Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:d76b176f2a8d56fe88eff0a779d1dccd61502c23adf3c5ad80054ec04b9a4c88","observation_id":"36ccfc71-6eb9-4787-b84c-524f62ca6e89","resolution":{"observed_at":"2026-08-10T20:15:57.640510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.620277Z","title":"Schuster, R","venue":null,"work_id":"c386901d-e70a-4a27-81d8-e179b05f5273","year":2015},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.423542Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:5bb57bfc8ad0218b131667d9441f28f6c44774c9085b0cadc60b7b16e2d112f3","observation_id":"fb540e5a-364b-48e9-bc70-483b70f8c72c","resolution":{"observed_at":"2026-08-10T20:15:57.625359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.605575Z","title":"Stanojevi´ c and K","venue":null,"work_id":"11584111-b20c-408e-851a-de4072475156","year":2014},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.427689Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:df2f8615e4aa8a1304366e8f41d7ec38d67dcd1b34a35c59d51ad5501649652a","observation_id":"781df4f6-5772-4246-a79f-bb353f05f86a","resolution":{"observed_at":"2026-08-10T20:15:57.610281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.588777Z","title":"Vedantam, C","venue":null,"work_id":"830310c5-7d5b-446f-b1a6-855f67f429a0","year":2015},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.431952Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:3204a6e55240be1294590644228e78d0295ce6aef4a5bf6400a2f49110482b19","observation_id":"7bb619fd-3ae7-4b92-be39-030ef025cdd1","resolution":{"observed_at":"2026-08-10T20:15:57.594375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03052","last_updated":"2022-06-01T09:24:35Z","snapshot_observed_at":"2026-08-20T14:59:05.580493Z","submitted_at":"2022-02-07T10:38:21Z","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03052","snapshot_observed_at":"2026-08-10T20:15:57.436866Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.436866Z"},"links":{"cited_paper":"/paper/2202.03052","citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:0c79b76af391f2857451349af097ae805e315a31511d7f6e33404444eb42fd61","observation_id":"cfd59bb3-1d50-4eda-b3ef-a63716c5f551","resolution":{"observed_at":"2026-08-10T20:15:57.436866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.574411Z","title":null,"venue":null,"work_id":"af4da0f0-717e-46d4-9165-abdd865f72c9","year":2019},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.442081Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:89a4efc7409351b0bfd562c2656c4497ee28082224690f70dde652acd58e84ba","observation_id":"6f297336-97ea-49cb-ad28-15f75c0a3faa","resolution":{"observed_at":"2026-08-10T20:15:57.579246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.559475Z","title":"Wiebe, R","venue":null,"work_id":"78889e9f-974a-465f-af40-78c65a624e4f","year":1999},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.447767Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:ede7bba9f45bf16fba325ce79929f5e70e9b1a2b015a37b795665c30833589d0","observation_id":"3b56e3a8-1d5b-43c9-b3c7-34f17722c229","resolution":{"observed_at":"2026-08-10T20:15:57.564531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.545963Z","title":null,"venue":null,"work_id":"f9c8886c-07dc-40a8-a357-7d3cad0ef126","year":2015},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.453140Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:f03d41785666e05d5ea26e43142850ffbf56ab908946518da1999e54eba87bee","observation_id":"c52b34b8-83bb-4507-9afc-5489490037ff","resolution":{"observed_at":"2026-08-10T20:15:57.550294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.528922Z","title":"Zhang*, V","venue":null,"work_id":"6b61dad1-c690-4ade-887f-e30032780e0d","year":null},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.460723Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:d9afdb62391161141f432ecb542f0f0e945740cea5dbf077d56b0efacd6e9b09","observation_id":"13dc7e3b-ed98-4c18-81b6-f4a132436a48","resolution":{"observed_at":"2026-08-10T20:15:57.535594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2501.09155."}