{"as_of":"2026-08-10T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccab35b09f1afc886afb1c35d8000edbb951111e0879ec18e08c5a9def3d7ab5","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:58:48.251828Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06600/citation-record","integrity":"/paper/2502.06600/integrity","json":"/paper/2502.06600/citation-record.json","paper":"/paper/2502.06600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1511.03292","last_updated":"2015-11-10T21:14:51Z","snapshot_observed_at":"2026-08-08T15:03:08.486608Z","submitted_at":"2015-11-10T21:14:51Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03292","snapshot_observed_at":"2026-08-08T14:58:48.107848Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.107848Z"},"links":{"cited_paper":"/paper/1511.03292","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:63bb34a964d197e77003bcf9a8c837fc1122818a0cea5e367abf0581319acb63","observation_id":"83f9ae22-6664-4e3e-9ae7-facd58bf7ce4","resolution":{"observed_at":"2026-08-08T14:58:48.107848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.700384Z","title":null,"venue":null,"work_id":"aea4776c-437e-4813-8ed9-193a3381835f","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.112701Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:40ace4f5989e243ee758b1855ffe331055ceb8892bf6d3113466f378097d59f1","observation_id":"8d4fc923-288d-469e-8913-2e82bf926c33","resolution":{"observed_at":"2026-08-08T14:58:48.703743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17733","last_updated":"2024-02-27T18:09:36Z","snapshot_observed_at":"2026-07-06T17:36:23.851926Z","submitted_at":"2024-02-27T18:09:36Z","title":"Tower: An Open Multilingual Large Language Model for Translation-Related Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17733","snapshot_observed_at":"2026-08-08T14:58:48.116638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.116638Z"},"links":{"cited_paper":"/paper/2402.17733","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:c34befb787c7670eb319e9d32d5fcadb7ccf5a6cb433155753a2d0c57b55ae0f","observation_id":"6b138ef1-d3f6-4927-8fbb-ec2a0c8e06e4","resolution":{"observed_at":"2026-08-08T14:58:48.116638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.690063Z","title":null,"venue":null,"work_id":"a4524c3c-9e62-44af-b691-ae53adf9bc80","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.120954Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:3247f0fed8440dbad73d640812f5c24c975efaa5fb2ea891d1eb05d501e5ebc6","observation_id":"4e69acfb-352d-46d3-80bc-8845f2411477","resolution":{"observed_at":"2026-08-08T14:58:48.693345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.680442Z","title":null,"venue":null,"work_id":"9920f67a-6d2c-4626-8092-fc14d94eb3ed","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.124736Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:bcf3366e0ea610720b762ce4bb4f9f2bacd68a65e9044ac441af39290ed53942","observation_id":"ab46c83d-b001-4dd1-8c64-eeadb081bf10","resolution":{"observed_at":"2026-08-08T14:58:48.683627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03567","last_updated":"2025-01-08T11:20:00Z","snapshot_observed_at":"2026-08-03T18:39:18.742312Z","submitted_at":"2025-01-07T06:35:34Z","title":"Evaluating Image Caption via Cycle-consistent Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2501.03567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.03567","snapshot_observed_at":"2026-08-08T14:58:48.348233Z","title":"Evaluating Image Caption via Cycle-consistent Text-to-Image Generation","venue":"cs.CV","work_id":"c2c0f4b1-28b5-4c6c-ad8e-e6c2a1ea19cb","year":2025},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.128379Z"},"links":{"cited_paper":"/paper/2501.03567","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:8dad6f0197263015d539a294e1f263f990baf306bb7e18a0dfe8dd529a5405e0","observation_id":"58f9782a-809f-4fa1-933c-d12dff79cff4","resolution":{"observed_at":"2026-08-08T14:58:48.351746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.670750Z","title":null,"venue":null,"work_id":"cfd88667-1cb4-40b2-8855-84471180224d","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.132436Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:1d98edbd49f5c4799c19d32c95c4e316f3e7f80610fd321dde837fe73641000e","observation_id":"1c9b6edf-f166-431e-9e0e-68708a488229","resolution":{"observed_at":"2026-08-08T14:58:48.673976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06930","last_updated":"2024-06-20T06:48:17Z","snapshot_observed_at":"2026-08-01T21:48:29.941951Z","submitted_at":"2023-07-13T17:51:58Z","title":"mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06930","snapshot_observed_at":"2026-08-08T14:58:48.135855Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.135855Z"},"links":{"cited_paper":"/paper/2307.06930","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:3b058b97b3fc9521d269aaa2f02c209e3bb10fab900063f48d5a01dedc4f4cf8","observation_id":"7d6d3166-20b1-43c9-ad06-3b9f14f4478f","resolution":{"observed_at":"2026-08-08T14:58:48.135855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.660572Z","title":null,"venue":null,"work_id":"c3fa3efe-4f7f-4624-9207-d408209913c6","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.139766Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:b4b0f1708e6e4dd43983f0efe34832e10b569e14ebaa3efa8744a5a97c3b4239","observation_id":"054bdc68-448b-4a6b-900d-c853408c8bd1","resolution":{"observed_at":"2026-08-08T14:58:48.664055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.650529Z","title":null,"venue":null,"work_id":"3eb24349-2c05-49f9-820c-47edfd68c4d7","year":2013},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.143162Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:bce056741253966d65eb3df6eb1e6cbee2edf557acd8deaffd85158a6a4dc7cb","observation_id":"dcd3ac4a-2f04-42d5-86ba-ed55c2335154","resolution":{"observed_at":"2026-08-08T14:58:48.653900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.639523Z","title":null,"venue":null,"work_id":"a8167ffd-6ed3-4654-a45f-6e6a6d33ee29","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.146463Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:4f42cf4d8ffb655d938206c5f10fc8867aef66413054a7141973e668d795a533","observation_id":"e8b7e6cb-d43e-4f60-bd21-d1e3534c6313","resolution":{"observed_at":"2026-08-08T14:58:48.643350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.628845Z","title":null,"venue":null,"work_id":"b678af8d-5e22-414d-9369-be93238b7538","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.149925Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:1ac6d4134f51839fa9e4d8f70c8ef2bb8bc464fe6676ce2eccf0a7ea83e859ff","observation_id":"f4cd076b-50e7-4c45-88e4-127b8d59cb26","resolution":{"observed_at":"2026-08-08T14:58:48.632497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.618641Z","title":null,"venue":null,"work_id":"67482fc8-ccd4-4d4d-b6ff-3d3f650dba70","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.152564Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:9171f71d5cc4b959a38d05f49545e4b7f4c09077aac9bbe4a6de2eb4654c27df","observation_id":"f86b738c-e88b-462f-84b7-616c8fbf42da","resolution":{"observed_at":"2026-08-08T14:58:48.622305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.607870Z","title":null,"venue":null,"work_id":"8caf5d9d-696f-4e5c-a1ef-5fe4b1e2aeec","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.155242Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:5ac0a31358637f20f4ad300da2f9728a67fbeb5208608832fc16ea923f3bcddb","observation_id":"0509c59d-0ce0-4f90-b056-583aad488a4d","resolution":{"observed_at":"2026-08-08T14:58:48.611322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06004","last_updated":"2024-06-10T03:57:39Z","snapshot_observed_at":"2026-08-04T20:09:33.779406Z","submitted_at":"2024-06-10T03:57:39Z","title":"FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06004","snapshot_observed_at":"2026-08-08T14:58:48.157795Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.157795Z"},"links":{"cited_paper":"/paper/2406.06004","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:2fa0ead8d901c6db00b3e346cfa49551bd08f6a536b9e7c5629d2c7d5a1af9b4","observation_id":"262e7b40-e123-4ea2-a546-18028f092554","resolution":{"observed_at":"2026-08-08T14:58:48.157795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.596898Z","title":null,"venue":null,"work_id":"b7bbd0cb-3462-495e-affa-7eb830ca2c93","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.160659Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:16670f4adc80b6fefd8c9052a4492884455ea82ac294d970c8fcc8ad915bd88c","observation_id":"e94ee4ea-f377-4b0f-8732-a7ba9c3bb5ab","resolution":{"observed_at":"2026-08-08T14:58:48.600724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.585911Z","title":null,"venue":null,"work_id":"c8214032-1bae-4e7b-b4b9-4cef7b002396","year":2020},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.163384Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:6857ae98a9076014fbff449d30aaf2f846eb1aee98e81b4674b12b466a2b775c","observation_id":"5dd98dfd-ec45-4b48-b16e-190a8b5ee264","resolution":{"observed_at":"2026-08-08T14:58:48.589632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.574834Z","title":null,"venue":null,"work_id":"923882a6-a609-47db-bda9-0fe6ae63a815","year":2020},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.166210Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:fe2bf6c6e5c96b054b9f90b486b257cd17986879e42808e923ce5d949e44fbbe","observation_id":"2a499ef0-c798-4326-958d-05772ebe347c","resolution":{"observed_at":"2026-08-08T14:58:48.578526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.563743Z","title":null,"venue":null,"work_id":"e14cec7a-78d2-4fb1-ad68-3639ce3fa642","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.168871Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:3ff6c0fd3ffda80e1a397cd35f4f8e6f661fe5a2f192634a381ddea21d462966","observation_id":"dcabe155-8dab-4e76-91c0-868983d29dd0","resolution":{"observed_at":"2026-08-08T14:58:48.567322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.552958Z","title":null,"venue":null,"work_id":"2aca137d-817a-4b08-97fc-36e89877f40b","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.171937Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:253a3988c5c0cf03e725c066336acf91d5bcf95c6d579ccbd61733fd1a0ef405","observation_id":"52e30fe1-49a0-4c7a-a590-48eef4db58df","resolution":{"observed_at":"2026-08-08T14:58:48.556817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.542855Z","title":null,"venue":null,"work_id":"aaf30c1c-afb9-4516-b3da-c5f23a501edc","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.175223Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:921b92a679d656eae1ee51c0cf79d36b674864ce25ed7418054a77d95544af74","observation_id":"e827993b-975c-49bd-b84a-0efffdec7d0e","resolution":{"observed_at":"2026-08-08T14:58:48.545931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.178520Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.178520Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:57c83755e6b0ff313ff312fbcbcf2fc6aa7c835b273cb0617bb94de203b8e96e","observation_id":"cd7d2f62-94a8-4d85-a4a6-1f32bfd8f481","resolution":{"observed_at":"2026-08-08T14:58:48.178520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.526230Z","title":null,"venue":null,"work_id":"8ecc94b4-ab4a-417a-a134-457dab7c36f2","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.181934Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:73b3caa415b75b57be6195dfa4e3547239d20bbd415890f39681165aa3c0ba39","observation_id":"720e87c9-ba5b-4ca1-9252-aee9ddfa6290","resolution":{"observed_at":"2026-08-08T14:58:48.529185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.517356Z","title":null,"venue":null,"work_id":"7c07db66-161a-45e2-a8c0-84fe15ca73f7","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.185359Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:30e7248f10d97fd1b4318e002fb91ab5ffb030868b53fd229530b9b552fc0248","observation_id":"2c560504-c6a2-4af7-a220-b923ba8bf3ad","resolution":{"observed_at":"2026-08-08T14:58:48.520419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.508576Z","title":null,"venue":null,"work_id":"9b51c95e-545c-473f-9fdb-56a01112585d","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.188730Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:2bb3715db845644330f05f2936463eac0ef1054e284c03c18bee44a861851320","observation_id":"91ae5dad-3086-4095-902b-c279a8d85fa4","resolution":{"observed_at":"2026-08-08T14:58:48.511567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.498695Z","title":null,"venue":null,"work_id":"b1552586-27e8-42ba-abc4-e409adeabd5a","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.192388Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:e1eff25072b3f8abdc8bb53de94e6417771b5546d7216df2c9c9d4b390de09e9","observation_id":"93864a7b-81d6-4f6b-9c5d-fe781abf2d33","resolution":{"observed_at":"2026-08-08T14:58:48.502102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.488987Z","title":null,"venue":null,"work_id":"bf4a00a1-c4a4-4ec4-a7a0-9ae82404cc7a","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.195667Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:c21f077d15794df20bc9c26dfe8f7e61edd54dabbfb1e58a48013badca40d190","observation_id":"3ff3180b-db37-4e66-a805-e6ba78042af0","resolution":{"observed_at":"2026-08-08T14:58:48.492448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.478819Z","title":null,"venue":null,"work_id":"6e87430a-c890-4227-bdf0-895f628c32fd","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.199242Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:c504f0ec68b01b86ea5a82983784745862561a0fc11e317d25eb5d6419d7aba7","observation_id":"0128b44b-877f-49ea-b537-4d2c28710619","resolution":{"observed_at":"2026-08-08T14:58:48.482354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.468922Z","title":null,"venue":null,"work_id":"6fb91b82-9ca2-40d1-b37b-0817f26022d3","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.202653Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:020b42fa2b9a7c801e28019612586304b5c444f175d85c0195c4322c01a509b4","observation_id":"f4db2265-c362-4c07-bb56-8c486bd1e2b1","resolution":{"observed_at":"2026-08-08T14:58:48.472530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.459044Z","title":null,"venue":null,"work_id":"d8b07b66-e0e8-460b-a2a7-283a79607422","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.206031Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:7d7e88cdf4d43d72105997a004d35e0a61812859fe728cdf15035eeb15214e77","observation_id":"88661f33-1a84-4df6-8210-b8a6f49236f4","resolution":{"observed_at":"2026-08-08T14:58:48.462397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07336","last_updated":"2025-07-29T19:14:56Z","snapshot_observed_at":"2026-08-06T00:59:46.952830Z","submitted_at":"2024-10-09T18:00:09Z","title":"Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07336","snapshot_observed_at":"2026-08-08T14:58:48.209337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.209337Z"},"links":{"cited_paper":"/paper/2410.07336","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:e1769733f73ecb20297272260cae5ba9e02c72fd58d0ea3865b8f83693b2273d","observation_id":"70bab504-fbe1-4dcd-94b0-de0d35278fbd","resolution":{"observed_at":"2026-08-08T14:58:48.209337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.448928Z","title":null,"venue":null,"work_id":"69f63f40-740b-47cb-b4d3-0b50bb6e1185","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.213093Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:9c0e298b5051f650a4c17d7415ea38ed6ff639f588ceb08408f088d97713be86","observation_id":"30ead303-1f8d-4752-8115-bc8cd0becdc4","resolution":{"observed_at":"2026-08-08T14:58:48.452291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.438798Z","title":null,"venue":null,"work_id":"ced7163d-d522-4412-b772-36ffb3846f90","year":2019},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.216626Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:1b8b1fe0d9fccd2e8c5dcaf17e83cf408dee2042a569446203656df2ebca5701","observation_id":"a4d74aca-a523-4c46-b549-d18939fdc182","resolution":{"observed_at":"2026-08-08T14:58:48.442298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.428657Z","title":null,"venue":null,"work_id":"dc852ba3-d831-4971-a4dc-93f65fc3572b","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.219896Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:dad318cd40876dedbc3c416371ecd38704be581fa9ad8c61350ca4bff39299ed","observation_id":"91a1aeb2-7791-4bb0-806e-49a13e7c416f","resolution":{"observed_at":"2026-08-08T14:58:48.431991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13647","last_updated":"2024-12-19T15:37:55Z","snapshot_observed_at":"2026-08-05T12:04:38.510941Z","submitted_at":"2024-12-18T09:23:12Z","title":"G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o","version":2},"cited_work":{"arxiv_id":"2412.13647","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13647","snapshot_observed_at":"2026-08-08T14:58:48.302502Z","title":"G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o","venue":"cs.CV","work_id":"47a7ba01-e19e-454d-bdc0-e5eb87190ba2","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.223313Z"},"links":{"cited_paper":"/paper/2412.13647","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:0db6eefa6cc5f25b528f33dd746bf4d3c170f51c7d22a7f31fff3dfb7eb06adb","observation_id":"5444d6e4-1a51-4718-8f98-e699647f718d","resolution":{"observed_at":"2026-08-08T14:58:48.309144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.418157Z","title":null,"venue":null,"work_id":"8a0cc460-b83f-4012-815d-6dfdfb506dc2","year":2015},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.227281Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:a06ac02891a2673544979978d91b2313a87c3376aeb7f869df1de947b94fa784","observation_id":"80b7e105-15a2-437c-83b2-7746e24bfdb2","resolution":{"observed_at":"2026-08-08T14:58:48.421535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.407892Z","title":null,"venue":null,"work_id":"663d5b84-55c2-4307-994b-9e9923afdc4f","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.230725Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:53e7ca1c18a14d70b07f42d72cc0232954a13b00c08e26c164d96db21cddeb38","observation_id":"8e4b798c-3d69-4815-acbf-c5c5db183cf4","resolution":{"observed_at":"2026-08-08T14:58:48.411384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.398510Z","title":null,"venue":null,"work_id":"b2922c59-b6f7-498a-b078-a981d2534989","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.234045Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:cd04ebdaf5ed7169dbee4ecb5572e395e2b594f30e3a6811df3faaf81cc5bf18","observation_id":"9fede902-8fa7-4281-a23a-e75100d5d95e","resolution":{"observed_at":"2026-08-08T14:58:48.401688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-08T23:17:13.003005Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-08T14:58:48.237478Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.237478Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:c1262f2e10ec36724e3e0fe8517e6f53b82ba761dcfa2802e4f9ebdf201ac245","observation_id":"e0a843d9-4994-4c1b-8a96-0b8dd8c8be83","resolution":{"observed_at":"2026-08-08T14:58:48.237478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12043","last_updated":"2024-04-13T17:02:25Z","snapshot_observed_at":"2026-08-06T09:54:52.355397Z","submitted_at":"2022-12-22T21:27:12Z","title":"When are Lemons Purple? The Concept Association Bias of Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.12043","snapshot_observed_at":"2026-08-08T14:58:48.240959Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.240959Z"},"links":{"cited_paper":"/paper/2212.12043","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:9e32a536f257d6a8df3d8029f768413d3ca5e6fc2808498797929c3c0358abff","observation_id":"3e996417-493e-4955-a628-82ecb0dba27f","resolution":{"observed_at":"2026-08-08T14:58:48.240959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.389382Z","title":null,"venue":null,"work_id":"a04947b9-5d44-4ced-a930-309fdf9f088c","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.244606Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:558945c84bcb2e98aa6b03b05de53c5b3a36fcbb7d15cb60283a541ab9b140ab","observation_id":"55d6fdf1-22a0-49e7-b462-f7684214929e","resolution":{"observed_at":"2026-08-08T14:58:48.392417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.248032Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.248032Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:3988a623a90d2b89d0397acdb1d8be4178e3d8eaeccde1c209d1680022912a3c","observation_id":"d455749d-bc74-4cf7-b9b3-4288580f2fab","resolution":{"observed_at":"2026-08-08T14:58:48.248032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.251828Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.251828Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:945e16e56a57b9dd74eebf185592af9d92e965c505309ae5465b26a4ff4d1342","observation_id":"ecbced9a-afae-4de3-ac64-1f0c38fbdb2e","resolution":{"observed_at":"2026-08-08T14:58:48.251828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T08:16:45.290904Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2502.06600."}