{"as_of":"2026-08-10T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ea355922592c8fab3bc5cb265cfc04f522627e47782a1c5b9be0b1403f4b623","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:55:45.393061Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09014/citation-record","integrity":"/paper/2509.09014/integrity","json":"/paper/2509.09014/citation-record.json","paper":"/paper/2509.09014"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.189833Z","title":"Generative image captioning in urdu using deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.189833Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:66e3877353b5871ab17891b7a1337029a1f799cdfa390371f274944b116a0133","observation_id":"cf238843-15a3-4932-bf0c-07d976e37d14","resolution":{"observed_at":"2026-08-04T19:55:44.189833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.208048Z","title":"A transformer-based urdu image caption generator.Journal of Computational Linguistics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.208048Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:cf881e805b40790cda0322a411c02ca39fa75381c65184bed72837c0a0885c6b","observation_id":"b0799bed-7272-4992-a4b0-fea0b94bf682","resolution":{"observed_at":"2026-08-04T19:55:44.208048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.250926Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.250926Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:847644b6a605ca4bbbccb0ad82681f0dc0f0a7b76cfee81ca9838d9846faae94","observation_id":"69b9f292-de18-4277-9490-cd73cedb2001","resolution":{"observed_at":"2026-08-04T19:55:44.250926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.284388Z","title":"Massively multilingual sentence embeddings for zero-shot cross-lingual transfer and beyond.Transactions of the association for computational linguistics, 7:597–610, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.284388Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:2c35191b9f710d63375cd58d5b4c5b3ec9e5791648d5ccdad773d68b35deb028","observation_id":"f95e35aa-83cc-44bf-ae9b-bb7fc0eaba99","resolution":{"observed_at":"2026-08-04T19:55:44.284388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T19:55:44.314288Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.314288Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:89ff8d39799d45f85a039255a5370588bdfbf23a07dab2b151816925798a0279","observation_id":"412fac42-dd76-47e0-8e04-7c8367c1118f","resolution":{"observed_at":"2026-08-04T19:55:44.314288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.355029Z","title":"Multilingual vision-and-language representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.355029Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:5bf479bb6699f7c74eb241fd44ddde87caaf3facc6d113a490cba16e9d9741d6","observation_id":"f012383d-d653-4afe-8cb4-46cd079c9e79","resolution":{"observed_at":"2026-08-04T19:55:44.355029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-04T19:55:44.391146Z","title":"Palm: Scaling language modeling with pathways.arXiv preprint arXiv:2204.02311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.391146Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:76e522b3bc523be22de12b8824c82a9b43fbe1ece943311fb8ad711313c02b3a","observation_id":"9e1ee3ac-b78b-48ae-a9fe-50ace34cb8ed","resolution":{"observed_at":"2026-08-04T19:55:44.391146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-04T19:55:44.451788Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.451788Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:0dc5a52b4cfd4bee7b0ed2eea8c2f9cda41d6b97b6d71d3242d4f38916937492","observation_id":"4f49463e-9c2f-497d-bcfe-dc27fbb6d5db","resolution":{"observed_at":"2026-08-04T19:55:44.451788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-04T19:55:44.486223Z","title":"No language left behind: Scaling human-centered machine translation.arXiv preprint arXiv:2207.04672, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.486223Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:25b72bec0ca7c9a5f71e021db426a8dfcc1b6fe156243411e41566db042a8c3c","observation_id":"e17d1073-0eac-4c12-9bef-65206112c9b5","resolution":{"observed_at":"2026-08-04T19:55:44.486223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.528542Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.528542Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:3e6f189e47a48ecbe15bbcb607c6924d4d9490f41b7d6f35aef83144fce3dc0e","observation_id":"761ae009-fb96-41e4-b91b-72861c82274f","resolution":{"observed_at":"2026-08-04T19:55:44.528542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01663","last_updated":"2021-06-19T15:31:55Z","snapshot_observed_at":"2026-08-08T11:50:13.122665Z","submitted_at":"2020-08-02T17:22:33Z","title":"Efficient Urdu Caption Generation using Attention based LSTM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01663","snapshot_observed_at":"2026-08-04T19:55:44.553540Z","title":"Efficient urdu caption generation using attention based lstm","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.553540Z"},"links":{"cited_paper":"/paper/2008.01663","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:a7a622487635dada5447c35c81e03943e6035e050d9acc2e347e37e30c342f81","observation_id":"a3190854-0045-44e9-9e56-2607d8f1126c","resolution":{"observed_at":"2026-08-04T19:55:44.553540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.613957Z","title":"Openclip: An open-source reimplementation of clip.https://github.com/mlfoundations/open_clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.613957Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:861c5c099cbe4807c1c2fa353bdf7d6808d4b8fec34dfdcf0665fea9dce8aeea","observation_id":"38220436-2ae6-4dff-b2a2-38e5ed328956","resolution":{"observed_at":"2026-08-04T19:55:44.613957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.630163Z","title":"Johnson and Taghi M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.630163Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:0be71da6a9a307f8ac9bb538f0bf8265bd119e9657c5abcec985815509873a22","observation_id":"b1bdf49f-fab3-4b9b-9649-618640825473","resolution":{"observed_at":"2026-08-04T19:55:44.630163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.671413Z","title":"The state and fate of linguistic diversity and inclusion in the nlp world","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.671413Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:bbb908055e728033f9768e332b39995a5014a24c6f888faadfcd45534b7f18be","observation_id":"40a9a5a2-5d33-468e-abc5-2e420c058ec5","resolution":{"observed_at":"2026-08-04T19:55:44.671413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01234","last_updated":"2023-12-27T17:54:38Z","snapshot_observed_at":"2026-08-09T03:37:10.147461Z","submitted_at":"2023-03-01T06:04:25Z","title":"Frauds Bargain Attack: Generating Adversarial Text Samples via Word Manipulation Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01234","snapshot_observed_at":"2026-08-04T19:55:44.707367Z","title":"Scaling laws do not scale for low-resource languages.arXiv preprint arXiv:2303.01234, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.707367Z"},"links":{"cited_paper":"/paper/2303.01234","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:558161989b9fb4731ba4982c3c56d71cbb624caa967e1d63194ce302179b2952","observation_id":"19866d74-863f-433c-89fa-acc9a7e10ee3","resolution":{"observed_at":"2026-08-04T19:55:44.707367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.739787Z","title":"Bilingual–visual consistency for multimodal neural machine translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.739787Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:48494e51fd2fbf7a53b14c5ccb7377082e687802bfbe99d8022176ea5ce07967","observation_id":"e822431a-e00b-4762-99b7-35c1651b7244","resolution":{"observed_at":"2026-08-04T19:55:44.739787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.779330Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.779330Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:3292dd0da5e7cfdeab4e374e99dec130ea97f97181ae7bf9c8879152cb407307","observation_id":"c215330a-41ba-4162-8b3f-fbaade13bba9","resolution":{"observed_at":"2026-08-04T19:55:44.779330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.789861Z","title":"Aligning visual and textual concepts for multimodal learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.789861Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:6aaeae7438424946f0f0194ec421d17f1d15b44786051f0785afee38aab8ee96","observation_id":"613faa33-9b50-45f2-9aa2-f476fca1d54c","resolution":{"observed_at":"2026-08-04T19:55:44.789861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0320701","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uicd: A new dataset and approach for urdu image captioning","venue":"PLoS ONE","work_id":"3733a55d-6bae-441c-89fb-c6eaeef23653","year":2025},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.830277Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:ea5a248d4acd769d57101bc1bfb2557ec7283e083a00413470a7226e07deeb41","observation_id":"3cf872c2-d760-4738-884e-0da5a743eaec","resolution":{"observed_at":"2026-08-04T19:58:32.135778Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.867358Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.867358Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:d422542906389d2b2d32236fbba3a16f84ae4641249dad4e0bf36feaa22ca041","observation_id":"dced8525-f0bd-4560-9348-c8a975fe5d9d","resolution":{"observed_at":"2026-08-04T19:55:44.867358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.902452Z","title":"chrf: character n-gram f-score for automatic mt evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.902452Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:413b47f9f442dab7e739b6e13b8f7ef1cb56b6cb54917a89b59f91f9a4bfe9dd","observation_id":"8f20581f-17a4-4361-be60-1f11f8525f05","resolution":{"observed_at":"2026-08-04T19:55:44.902452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.964637Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.964637Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:0e142ca0d87b0da0d3ea8dd2f1b93339089b43e4f7f3c2df82364e571fe0fdaf","observation_id":"5156d792-d626-4b96-b803-f9549b618f5c","resolution":{"observed_at":"2026-08-04T19:55:44.964637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T19:55:44.981165Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.981165Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:d20d34ff482d08866601fad4057bb4335fc78c79b223c54be18f9487c3971abb","observation_id":"23176506-0055-4a25-8339-8f3febc714d7","resolution":{"observed_at":"2026-08-04T19:55:44.981165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.022661Z","title":"The impact of translating resource-rich datasets to low-resource languages.ACL Findings, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.022661Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:bc82f4ab195b1257e254b77d2ed1f0fef1fb03c9996d5f4120ba495746a084ef","observation_id":"e5887033-193b-43fc-b227-28d6d633d488","resolution":{"observed_at":"2026-08-04T19:55:45.022661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.067556Z","title":"Comet: A neural framework for mt evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.067556Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:3a2a653dc60f37b3c5ed8d38bb11ef7ffa75accadddb19c7f6f7408a8a2be877","observation_id":"86ec481c-a153-4526-84f7-9a7e136153c7","resolution":{"observed_at":"2026-08-04T19:55:45.067556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.091717Z","title":"A dataset for movie description","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.091717Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:301dcb9ebec24d51457ba56428ed0a8d05a9c4d7f945ceeaf9c184396b7fa620","observation_id":"e2f6ff27-f8ae-45b3-8317-ce790bf9106e","resolution":{"observed_at":"2026-08-04T19:55:45.091717Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13958","last_updated":"2020-04-29T05:01:32Z","snapshot_observed_at":"2026-08-05T02:26:08.731160Z","submitted_at":"2020-04-29T05:01:32Z","title":"Optical parametric oscillation in silicon carbide nanophotonics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13958","snapshot_observed_at":"2026-08-04T19:55:45.117651Z","title":"Beyond english-centric multilingual nlp.arXiv preprint arXiv:2004.13958, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.117651Z"},"links":{"cited_paper":"/paper/2004.13958","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:4f214179464b035aaeccd576e0c19500dd47b338b2400f35d2bd119b73dff497","observation_id":"65938e06-3da3-4d8a-a3ab-524c75e10b03","resolution":{"observed_at":"2026-08-04T19:55:45.117651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.158899Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.158899Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:22c229e5ef9c2c9a9799fa2fac30548e70c6ba32946626957bb8bf8314651df3","observation_id":"33b03155-51a5-4b2b-af5a-d565f47668c1","resolution":{"observed_at":"2026-08-04T19:55:45.158899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.176389Z","title":"On the stratification of multi-label data","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.176389Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:c62160b5ad11cc10ac55fa3c491049d22e24ac863810f00d79027e7fd7c359f2","observation_id":"bed9bb90-4d1d-409d-b561-7c95c7ffb191","resolution":{"observed_at":"2026-08-04T19:55:45.176389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.210380Z","title":"Multimodal quality estimation for machine translation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.210380Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:e536d12b604b95ac1db85525fda999bd8ff4fb86bcffb55e4e39eb049c4e9197","observation_id":"8cdebaad-445c-4929-8658-ec63b1abe38b","resolution":{"observed_at":"2026-08-04T19:55:45.210380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T19:55:45.246349Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.246349Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:faeee8664d2595b835261e4517f542f21cc713935f21e2511845273948a1801e","observation_id":"257041e6-933e-4584-8d12-df305798b660","resolution":{"observed_at":"2026-08-04T19:55:45.246349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.277507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.277507Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:5fc80f500b7a11ef0f5cc99683a53e484c40a7e4be538202252e855697aa666c","observation_id":"e54a9fe0-19ed-4763-893e-f041f72cd8cb","resolution":{"observed_at":"2026-08-04T19:55:45.277507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.287808Z","title":"Cliptrans: Transferring visual knowledge with pre-trained models for multimodal machine translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.287808Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:68a862093d952cc5c2012c34dd86c4faa8b30d6ece94008e98e39555a11b5e0e","observation_id":"e7bec6f6-5fc6-4679-8cd6-f86de57138a7","resolution":{"observed_at":"2026-08-04T19:55:45.287808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15237","last_updated":"2022-05-30T16:52:30Z","snapshot_observed_at":"2026-07-06T13:15:32.315247Z","submitted_at":"2022-05-30T16:52:30Z","title":"VLUE: A Multi-Task Benchmark for Evaluating Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15237","snapshot_observed_at":"2026-08-04T19:55:45.328993Z","title":"When does clip generalize better than unimodal models?arXiv preprint arXiv:2205.15237, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.328993Z"},"links":{"cited_paper":"/paper/2205.15237","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:c616025faafaa9b05bf1b0d37d061d0764b951c0e9303e2924f9c6637d0b867c","observation_id":"15c4100e-016c-4368-80db-689ce493fb20","resolution":{"observed_at":"2026-08-04T19:55:45.328993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.361226Z","title":"Mobileclip: Fast image-text models for on-device multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.361226Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:9d6e576788f07f78a8f3ee7e640d5d45b49db16caaa604f1b3b2b3bee6e37703","observation_id":"53b7023a-8f04-42c7-a98f-af9f2d3d779f","resolution":{"observed_at":"2026-08-04T19:55:45.361226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-04T19:55:45.393061Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.393061Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:05ad6e2e6e02c1a60990b449d1f51b0d5ef4b6bcfddf51e1f680efe3454ad134","observation_id":"1c327785-7b05-44cd-8c5d-359a9fba4ad5","resolution":{"observed_at":"2026-08-04T19:55:45.393061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:37:27.473406Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2509.09014."}