{"as_of":"2026-08-15T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d328a41649e17b16acf3a0d5ef630413092dab1ba5e9605fd71c2b766c07d372","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:59:01.698073Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:42:28.802465Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:27:09.235019Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"cited_work":{"arxiv_id":"2412.01814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01814","snapshot_observed_at":"2026-07-02T16:27:09.235019Z","title":null,"venue":null,"work_id":"adc85a9d-e026-44fd-b16f-3790d165762e","year":2024},"citing_paper":{"arxiv_id":"2606.06867","last_updated":"2026-06-05T03:33:43Z","snapshot_observed_at":"2026-08-06T09:09:28.037280Z","submitted_at":"2026-06-05T03:33:43Z","title":"Multi-FRuGaL: Multimodal Flexible Redundancy-aware Decomposed Gated Learning for Cancer Diagnosis and Prognosis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T22:42:28.802465Z"},"links":{"cited_paper":"/paper/2412.01814","citing_paper":"/paper/2606.06867"},"observation_digest":"sha256:c5b28e01743ab727299d112733fc6066679e15c5dcbad382da339f0cfa9869ca","observation_id":"9b4cfeb0-ea76-4d11-a3a5-b6f6099bc7ba","resolution":{"observed_at":"2026-07-02T16:27:09.236693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01814/citation-record","integrity":"/paper/2412.01814/integrity","json":"/paper/2412.01814/citation-record.json","paper":"/paper/2412.01814"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.432127Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.432127Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:79fb92dbd19a113c0762984e2ef211cd777bed36f3dca87228330958d15b0544","observation_id":"2acbd428-3830-45fe-93d7-7c9c84b351b5","resolution":{"observed_at":"2026-08-12T00:59:01.432127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.435687Z","title":"Single-stage semantic segmentation from image labels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.435687Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:54d5efd1ad0bfa1c9a8faf544eb9f81046fdc63c49cdc3c1a825c6e081007ad0","observation_id":"f1c5260d-c378-44c8-8aab-632a635aa5f4","resolution":{"observed_at":"2026-08-12T00:59:01.435687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.438584Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.438584Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:3a69b1c3f051e5b1d7595a8bad9ae700f5097c42c27c67bbcf39c84522dbca2e","observation_id":"7af55be0-2496-45be-b0f5-91b5cfa3523f","resolution":{"observed_at":"2026-08-12T00:59:01.438584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.441778Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.441778Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:fb66702995d650ec2d1b0d76a4cb201361fb152541424856911cb17dedb99f5c","observation_id":"cb619a82-6ccc-4ec8-b9fb-ae8d943b713f","resolution":{"observed_at":"2026-08-12T00:59:01.441778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.444870Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.444870Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:108f099330f0296828d58fd412633ff4814fd32d807246dfe2138399ae016f4f","observation_id":"5f0282ec-5e69-4cd3-bb3d-83ea39aee8fd","resolution":{"observed_at":"2026-08-12T00:59:01.444870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.448023Z","title":"Unsupervised learn- ing of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.448023Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:01decd918498dedf9aec174b5a36a17af5e9fd2dbcc37d074c09432254a7e4d3","observation_id":"fb87e830-9a4b-41c8-9b49-5b76c83f38cc","resolution":{"observed_at":"2026-08-12T00:59:01.448023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.451411Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.451411Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:411a826c156c68ae35cae9c51ee99021c757313dd625a6dc9039d3f5ca3eac37","observation_id":"1691d2f1-92b1-4bee-86bb-b7168eef9727","resolution":{"observed_at":"2026-08-12T00:59:01.451411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.454495Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.454495Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:e31d558d18ae4e616c9212e49531a17ee368ea1a1db6257e520aba50609d3253","observation_id":"d626e36a-75bb-4367-adba-49148d239221","resolution":{"observed_at":"2026-08-12T00:59:01.454495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.457364Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.457364Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:f06867c708fea89a62921b24f705a8820d811bf3fefe7e32bb929a61608985d7","observation_id":"146a3257-d629-41cb-946e-a8dab6caad62","resolution":{"observed_at":"2026-08-12T00:59:01.457364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.460432Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.460432Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:694435933c24a677379931f4af5b3ebf8dc0a8af8d02ad8ca15f61a6387cb1e0","observation_id":"af539555-6e7f-4cf7-81ce-21dd28a48688","resolution":{"observed_at":"2026-08-12T00:59:01.460432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.463365Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.463365Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:549679b6177f694125fdb2cb2ba73e1dd4e23abf70e31db82bcaa290f43dea7d","observation_id":"05374346-b9bb-4f52-9ec7-07d24727a305","resolution":{"observed_at":"2026-08-12T00:59:01.463365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.466833Z","title":"Intriguing properties of contrastive losses","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.466833Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:a06c7454f10dd5c7fa1914b12fa5c85707efef7bb3f857594970e34c2d4858ed","observation_id":"51cd77d6-93a2-448a-8d1d-57492678cfa7","resolution":{"observed_at":"2026-08-12T00:59:01.466833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.469700Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.469700Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:70471ae49af6509dad1ee721a3d6dc23eb0c858ce6b8be5c50c5f26b6d921006","observation_id":"c66352b4-f5a5-494d-af9c-d757c89906f0","resolution":{"observed_at":"2026-08-12T00:59:01.469700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.472620Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.472620Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:ad967c253979631df9b1719ed70c5772cf16c277dfdf0bdf1f1a1a123a790c76","observation_id":"ac515e9e-1cc8-417a-a635-90ae73bfe593","resolution":{"observed_at":"2026-08-12T00:59:01.472620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.475572Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.475572Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:fd7d034dc4a473fef04338cfe8fc2d94b7e23e050b5b4c65fa2f984b5681f132","observation_id":"5f047899-dd01-40f4-bd39-2fe402c8ff26","resolution":{"observed_at":"2026-08-12T00:59:01.475572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.350816Z","title":"Democratizing contrastive language-image pre- training: A clip benchmark of data, model, and supervision","venue":null,"work_id":"f6c00c29-c057-4651-b746-79d61e0999d1","year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.478518Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:4fb1785b692eb7c0368ef5dbaf15fb8df551478c8bea71bbf1cecc6918f3adbd","observation_id":"1d4c787a-b8b4-44b8-98af-ca5352b00144","resolution":{"observed_at":"2026-08-12T00:59:02.353984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.342889Z","title":"InstructBLIP: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"2a7a2749-296e-4608-9716-80acc5b162a7","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.481577Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:cffe1ae6e67b2a5054e27581c6fb17c4909181fb6e079f3028f61b11e2dd1810","observation_id":"d92ab704-8f91-40fc-b28e-11168bc64594","resolution":{"observed_at":"2026-08-12T00:59:02.346004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.334808Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"09e8bc42-06d2-4afa-a92e-624ccdf5ed82","year":2009},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.484471Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:79515e05a444dbc9806170005195d8fad9d4418e0a545905133d8558b9e1d841","observation_id":"65aa734b-2a1e-4806-87c8-a67628a91d5a","resolution":{"observed_at":"2026-08-12T00:59:02.337905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.326522Z","title":"Redcaps: Web-curated image-text data created by the people, for the people","venue":null,"work_id":"f13dc5dd-e4dd-4dc5-90fc-dde323548951","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.487324Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:50bb34608ad3ac3b10bd0dd8eac8445807ee3d84be9bb0a77172f3abc35f04d1","observation_id":"9755562e-6caf-4b31-9f68-4c6310447869","resolution":{"observed_at":"2026-08-12T00:59:02.329703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.318242Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"25db2144-d764-4aa9-99eb-a9d618584d48","year":2018},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.490080Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:2dfba0befe8b190a3aa96559b790ab61a5f07d716ba1ef816d781b827a127401","observation_id":"9fdc2215-99ad-47db-b60b-e55efbff62bb","resolution":{"observed_at":"2026-08-12T00:59:02.321406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.310343Z","title":"Maskclip: Masked self- distillation advances contrastive language-image pretraining","venue":null,"work_id":"af5feb05-5f77-4709-aa3a-fd043e954b33","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.492548Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d07c403fdcab765480dfff05775b4c778b6b110ff9f9b28a3e1c0441e56409c1","observation_id":"54b74ef3-05b9-41ce-9a5f-16e5f7372504","resolution":{"observed_at":"2026-08-12T00:59:02.313247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.302038Z","title":"The pascal visual object classes challenge: A retrospective","venue":null,"work_id":"1e9e2a86-6f1c-4be7-a751-3926820cf70c","year":2015},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.495242Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:447fabbd9af8c97396340eaebc10e1c80f338860ec6ba8fee3a91a823590ae4e","observation_id":"1790a824-4b22-4503-b7a3-b9e8bdc441a1","resolution":{"observed_at":"2026-08-12T00:59:02.305043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.293938Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"b7951c83-dba5-40da-9b09-8e07a50a700f","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.497970Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:7eac13bbe12ed37e94d8f35c933845736d09f9b62d3c05bc6ae3d95d92d2f8a9","observation_id":"8b5a8220-4685-42bb-8275-7fb415448414","resolution":{"observed_at":"2026-08-12T00:59:02.296907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.284751Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"6e04fbec-f539-4bdb-8413-97409c022850","year":2004},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.500653Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:1e072cf528434faa02e4c87ef26aeb77d7afe58a1537ec4775c21d5468e644c2","observation_id":"e5c1d5e0-84cc-4f6e-b252-745503d192ec","resolution":{"observed_at":"2026-08-12T00:59:02.288559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.276074Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"6ad4872f-6b37-4bf9-a00f-531061f5989a","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.503384Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:9a2b6e6a8695900954f811ec89c28d4d3c77666530371094eeba7d82cd140aa6","observation_id":"b77ac433-95a3-4132-8d29-870e71ba727c","resolution":{"observed_at":"2026-08-12T00:59:02.279224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.267090Z","title":"Pyramidclip: Hierarchi- cal feature alignment for vision-language model pretraining","venue":null,"work_id":"28e045cc-4d90-46d2-ac04-6372c29ff6ba","year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.506039Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:2bab424a88c454bbc75586bdf554a7375b921898ffb82978a75ce43018b769df","observation_id":"d4242c3e-b862-44ba-a27d-147635fc8e42","resolution":{"observed_at":"2026-08-12T00:59:02.270340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.258771Z","title":"Softclip: Softer cross-modal alignment makes clip stronger","venue":null,"work_id":"4abf9cbb-0153-4997-b7f9-3931ebec6fd5","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.508676Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:e0816ab79c7528763e61ecfa2dff24d0bc79a0e58b67bf25b86a0933319a3303","observation_id":"47fc3fd9-cb86-4b10-ac76-f65eef6c157a","resolution":{"observed_at":"2026-08-12T00:59:02.261682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.250409Z","title":"HiCLIP: Contrastive language-image pre- training with hierarchy-aware attention","venue":null,"work_id":"b2854ea0-a127-4157-b6ff-f0932ae068f0","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.511435Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:1b6277566bc241c5f7e5c6e235c37b174e1b4ce8a270e537f50949ecc01ceeba","observation_id":"b3efd4d9-4696-45e9-b65c-f24e80455272","resolution":{"observed_at":"2026-08-12T00:59:02.253398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.242246Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"7fb06aa3-c90b-4d54-9834-4ee275d3a25d","year":2020},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.514078Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:a727c0e0c3efb1c4d89d247c89340860f5b17367b435a6c7e3d460416eb7b64c","observation_id":"6d451149-5157-482a-ace4-e7c9c3d023d9","resolution":{"observed_at":"2026-08-12T00:59:02.245173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.233718Z","title":"A survey on self-supervised learning: Algorithms, applications, and future trends","venue":null,"work_id":"d5ab9baa-160f-4d7e-a890-dcda8366df69","year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.516730Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:1f1791f8fe7ab3deb9fd1cb2358c46c232b872f7c10e644784a9bd3b8fd708e4","observation_id":"0d814104-8839-4172-9320-a1fed898f0ba","resolution":{"observed_at":"2026-08-12T00:59:02.236823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.519556Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.519556Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:0d6e71a6bcaae002d73da06e96d72902946af6026c53dd65a4c4e4807b021299","observation_id":"b0170a05-e30f-49b9-b94e-122ecd1a81d9","resolution":{"observed_at":"2026-08-12T00:59:01.519556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.219722Z","title":"Probing image- language transformers for verb understanding","venue":null,"work_id":"779c22fb-eda2-48dc-9fb2-0ae110ec4235","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.522570Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d3ca0e789b415894ab5de78c9c4c8625bc362e76500df20c2dd27350e03c4367","observation_id":"2335dbc5-f7fe-40a0-a4dd-cca0ff73c0aa","resolution":{"observed_at":"2026-08-12T00:59:02.223327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.210679Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"82fc2db9-c8c7-49f9-b1b0-1fc696982ed8","year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.525264Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:fac0715f15adbdf3934c15c41e9f25752a119f2118f689c314a70a5896427a39","observation_id":"5d231367-4c5b-417e-8351-394b21ff393b","resolution":{"observed_at":"2026-08-12T00:59:02.213999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.202106Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"1cf79a55-23d5-489d-89bb-dc43e568abd0","year":2019},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.528211Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:42409b46305a4df1459e107171ffebb5e60f12a7130040a700865bf638ba45a3","observation_id":"ca07a299-f29a-421c-9e43-0a0971ec2ec0","resolution":{"observed_at":"2026-08-12T00:59:02.205124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.193376Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"8ac0edbf-f58c-40b3-9bd4-e811005135db","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.530839Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d6ccb538b3dc9bbb005db244f96b2d86c8df4ed1e31d6ed1401e027bb1a37536","observation_id":"fffa3571-1830-41bf-aa93-51728aa71ca9","resolution":{"observed_at":"2026-08-12T00:59:02.196645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.185147Z","title":"JUWELS Cluster and Booster: Exascale Pathfinder with Modular Supercomputing Architecture at Juelich Supercomputing Centre","venue":null,"work_id":"1c2ef538-7a09-42b4-8292-07c4826639a6","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.533475Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:79e3c9fbbf682d463b2b46c70281d7927522f4d98bf26d621116dc4917739cfd","observation_id":"1aca144b-b25e-4dee-9f8a-40c48c91ee2b","resolution":{"observed_at":"2026-08-12T00:59:02.188170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.176803Z","title":"Expediting contrastive language-image pretraining via self-distilled encoders","venue":null,"work_id":"c3ef4bf9-299e-458f-b7ce-bd4011c76359","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.536104Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d2305fe8d73ec83eaef13b17169a3c37384a8a22c03a69745dc08037f5076b72","observation_id":"28205008-6967-4e81-aef1-7cb092c5ae7b","resolution":{"observed_at":"2026-08-12T00:59:02.179877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.538549Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.538549Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:c7418d836f8f321519601e10179b5a1452951f6b133730cec287a75c62630b65","observation_id":"40f8976a-0b8f-46b7-9d89-b3f3bced11f2","resolution":{"observed_at":"2026-08-12T00:59:01.538549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.541200Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.541200Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:57909771ff054fc2ae37d4adeff44c5ad046218f6ddecb2e324797d1ebdb31d6","observation_id":"7b4732ce-b8e6-4329-becc-b55ac72e6be0","resolution":{"observed_at":"2026-08-12T00:59:01.541200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.158937Z","title":"Veclip: Improving clip training via visual-enriched captions","venue":null,"work_id":"909e044c-0f9e-4d81-a58a-a60c32f4dedb","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.543893Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:150c6f09888763cd6ba72b5c226a3ae4693d2bb3abf9420d35870d265b30ddc6","observation_id":"b85dcf65-9397-4d82-9549-8f34ebb734f1","resolution":{"observed_at":"2026-08-12T00:59:02.162101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.150230Z","title":"Modeling caption diversity in contrastive vision- language pretraining","venue":null,"work_id":"091410c2-0f58-4ee9-81eb-fe229bd2853f","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.546561Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:7c966a06979aa54f2bfd93fb2e6431a528bf1e99174feb97b3d65f13f5df2d54","observation_id":"7e59a81b-f756-43c3-8aec-400d0b2d4ea2","resolution":{"observed_at":"2026-08-12T00:59:02.153526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.549111Z","title":"Uni- clip: Unified framework for contrastive language-image pre- training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.549111Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:62288af105aa6f6209329a53277e6c29064c2cb4febf2570789296b46d444a54","observation_id":"7fd87592-cd6e-4d5e-9886-16ee48c13452","resolution":{"observed_at":"2026-08-12T00:59:01.549111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.551755Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.551755Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:9cfd0dc11aaeeb87b637f7f1ce5fa82fa3c6a5a487a0525bacce722215066bac","observation_id":"6db64e3b-95be-4353-9b3d-d4b5e785db79","resolution":{"observed_at":"2026-08-12T00:59:01.551755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.131367Z","title":"Addressing feature suppression in unsupervised visual representations","venue":null,"work_id":"b367b09a-cefa-477d-8338-574abbc39f99","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.554813Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:ee343dbe9503e1fda57480355c18c20fb5464a925131cbf977a85d2b7d4146fd","observation_id":"43df981f-28fb-4fa4-8172-f298f464b8fa","resolution":{"observed_at":"2026-08-12T00:59:02.134536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.122916Z","title":"Su- pervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":"fdf669be-8777-4748-b64d-2bb4c6698343","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.557540Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d4aa25dddc195d922ff8b847fa4e11b459f59674f2e466e301dd135908a1384c","observation_id":"cf4fba8c-a748-4ffe-9b38-93ed858ea971","resolution":{"observed_at":"2026-08-12T00:59:02.126074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.114025Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"4ef446b5-96ee-441b-81a8-c9803bbdf85a","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.560282Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:3b46bc656f9fd85ec5edd43e0b0c14d2e4e541aa27b25618adaa98385b00c917","observation_id":"ee8fa206-f536-4ad2-aaa9-7756346109bf","resolution":{"observed_at":"2026-08-12T00:59:02.117155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.563041Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.563041Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:886a95a76c0d8db0d12d915169324d74b2241e2466145cb56d2cf4099e9f145b","observation_id":"e977972d-a9a7-491c-aa37-5f47d14a930e","resolution":{"observed_at":"2026-08-12T00:59:01.563041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.100790Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"76fd1ef3-3f00-4798-b66d-908429c4cb1f","year":2014},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.565660Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:fa3b9d9dc5c250817022b617b64f7befd5f82a17501d71c931509ef351e036bc","observation_id":"270ad24b-2677-43c9-ab8d-e79c5d77fab9","resolution":{"observed_at":"2026-08-12T00:59:02.104111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.568397Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.568397Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:1eb8f1b69ea9cdad1acf7ccb6821550874a856f63c9919a2f5438b2a177c9771","observation_id":"914a2adc-52a7-4af9-9e17-3b34d0f2a532","resolution":{"observed_at":"2026-08-12T00:59:01.568397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.086693Z","title":"Visual instruction tuning","venue":null,"work_id":"b0c2f776-dbc1-4555-8a0e-2b90834b4b93","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.570985Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:90bd7848cc16032f66eec5bc3788cd5486e3a8160173d7dd3c5f46858113f3cf","observation_id":"a7ae13cc-3bc3-4405-9b80-5b2596a65bac","resolution":{"observed_at":"2026-08-12T00:59:02.090060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18765","last_updated":"2024-03-13T08:47:32Z","snapshot_observed_at":"2026-08-14T08:40:16.249566Z","submitted_at":"2023-11-30T18:05:52Z","title":"MLLMs-Augmented Visual-Language Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18765","snapshot_observed_at":"2026-08-12T00:59:01.573702Z","title":"Mllms- augmented visual-language representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.573702Z"},"links":{"cited_paper":"/paper/2311.18765","citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:95e4ca79a871b3a8f11125ca116be1f25c5e4661634e59059095fdd912d832bd","observation_id":"9b2c064d-bf1e-444d-9ba4-aa33aaf72ab8","resolution":{"observed_at":"2026-08-12T00:59:01.573702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T00:59:01.576976Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.576976Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:6fe03eabdf2ba5caf8675d04dc5fd7d24e3e9410de5d9cae862bf9d6b3b95da3","observation_id":"d5896950-44b3-45f2-afbe-4760779e1c28","resolution":{"observed_at":"2026-08-12T00:59:01.576976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.580026Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.580026Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:7ede6c60e6857a3f0cf2280ed973f1996aba679b438d5764057c35816ee47259","observation_id":"0ef9242d-acb6-4c19-bba0-a6fea2e89433","resolution":{"observed_at":"2026-08-12T00:59:01.580026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-12T00:59:01.582789Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.582789Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d536c6869ea29c82c7853171cd28a1358f367f0e413d16b675f3253a6daf8cb5","observation_id":"373a3b4f-5f65-4bc8-adfc-055248b60599","resolution":{"observed_at":"2026-08-12T00:59:01.582789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.072574Z","title":"The role of context for object detection and se- mantic segmentation in the wild","venue":null,"work_id":"ddd6ff6d-3215-4593-9226-2bcc68031c42","year":2014},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.585944Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:11940ff08088aa685a0d4b0bf1ee3c2c21dcd84807f00438500a246941e7f7c8","observation_id":"c3a5c50e-a21e-4dae-a5f6-609b1c42243a","resolution":{"observed_at":"2026-08-12T00:59:02.075691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.062838Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"1c2590ea-dbc4-4075-89f2-64792db70c24","year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.588548Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:bfebe115f5283d08bc9598e74691862a75b5bc1de7daced5931507ef4c4eaeb9","observation_id":"0f800bc9-b72f-427b-a897-2cc42c6e7b24","resolution":{"observed_at":"2026-08-12T00:59:02.066074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.052832Z","title":"Silc: Improving vision language pretraining with self-distillation","venue":null,"work_id":"146a41ff-034a-4eb2-9c33-a80fb2a34dc3","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.591328Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:87e25225c313224fefe0ff75e6f63a29fb2711369eb4f573ee894a08b9afedd6","observation_id":"2a966b05-2b8d-4cad-9d34-84187d5fb175","resolution":{"observed_at":"2026-08-12T00:59:02.056308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.044127Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"68342e46-b9b3-4dc8-b8ea-f14e921f92cb","year":2008},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.593960Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:da8747b5ffdedfef93dece02a733b05b8318fd8de8eaab4a59971a70b44fc047","observation_id":"6d879a00-adcf-4924-86b2-9d24fce288ba","resolution":{"observed_at":"2026-08-12T00:59:02.047364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.035017Z","title":"Docci: De- scriptions of connected and contrasting images","venue":null,"work_id":"08677eb7-5522-4c3e-9d7d-012178f9b250","year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.596705Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:b4eb945d6246d4e7392b220ca8de51cadf532658d080622259a54e24a413726a","observation_id":"0d779462-8cdc-4406-b167-3846f737a30e","resolution":{"observed_at":"2026-08-12T00:59:02.038430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T00:59:01.599753Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.599753Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:2be3750b23a33651279979f6bf4ffecea77b2fd18a134dcb172be3a82f6b9150","observation_id":"6fed06a7-ab62-4720-9f9a-80f41a01e56b","resolution":{"observed_at":"2026-08-12T00:59:01.599753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.025786Z","title":"Cats and dogs","venue":null,"work_id":"4c6bc738-3b54-4a08-921e-1cfaafd44714","year":2012},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.602628Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:ac25db4210796d7314daa0f0b2f40390af3eda573b53d21b1f360971b8218856","observation_id":"dc963c2f-7d71-4e18-b421-44f0cac54772","resolution":{"observed_at":"2026-08-12T00:59:02.029089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.605473Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.605473Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:9cddc775fdeb86849d325c6fe263befe524d3ab708aea1471d4207f2b81a87b1","observation_id":"56516dae-85b5-4fc2-96f8-d28eebef2ac6","resolution":{"observed_at":"2026-08-12T00:59:01.605473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.010094Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"cdd18186-a10e-4985-a6b8-0d737db27285","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.608384Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:38b254bd360a83e87b9328767b85e07ca21ed58db568d70d5c6e0b1c28fdb265","observation_id":"4f7c7423-52ef-4fd7-b347-5671b729535b","resolution":{"observed_at":"2026-08-12T00:59:02.014123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:02.000160Z","title":"Can contrastive learning avoid shortcut solutions? NeurIPS, 2021","venue":null,"work_id":"bb53daf2-b06b-4606-862f-5fbcfe6711be","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.611260Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d6fcd29c85901ffec5b37b6b8f3dae588bbe0ee794fdf154878884ec22408354","observation_id":"3e41a84c-d228-4333-9866-2c8738021ce2","resolution":{"observed_at":"2026-08-12T00:59:02.003410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.990443Z","title":"Building vision-language models on solid foundations with masked distillation","venue":null,"work_id":"310d1cc0-bc13-41a5-9407-3fbce9e34fd2","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.613979Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:400f2feb07a811c04edbaee1e826e00814ed6b699fbb69fb543ed55407855c8d","observation_id":"23470b4c-4ffa-4658-a4ac-1c38628389b6","resolution":{"observed_at":"2026-08-12T00:59:01.994418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-12T00:59:01.616766Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.616766Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:ce4d83b605d1baec1f06b1800cd064c26e9d9b3af2ce8cbff7567a4f06ada7b0","observation_id":"5150e07e-858b-4834-82d4-a874478e2811","resolution":{"observed_at":"2026-08-12T00:59:01.616766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.619938Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.619938Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:3a239410b73a4dfa701e52a1e3f252b8bf78f748e58aa18ef0db2c8817b14791","observation_id":"9cb4a333-6b53-431b-9cea-627257c7ccfd","resolution":{"observed_at":"2026-08-12T00:59:01.619938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.622729Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.622729Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:7e47fb5102d9d3d2e6f60f9af275103d5ce9d91fa34389dd677f2e28e86d541b","observation_id":"0d10c965-c3a8-47ef-8fb9-e9bad0d5d146","resolution":{"observed_at":"2026-08-12T00:59:01.622729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.625540Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.625540Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:fb526616dff00809849e812fbf6ee5b16ece0313c284fa6c0644896a1fa9f989","observation_id":"fe9386d0-38c8-4069-96b9-d70be07cb39c","resolution":{"observed_at":"2026-08-12T00:59:01.625540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-08-14T13:42:52.882986Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-12T00:59:01.629788Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.629788Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:a2395fcc99788f5b6f19bd767830f64ac2b52145dcafb22363a1c011e9cde30f","observation_id":"c88223e4-099f-478e-afbf-79b9f07c9bf9","resolution":{"observed_at":"2026-08-12T00:59:01.629788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.966867Z","title":"Feature dropout: Revisiting the role of augmentations in contrastive learning","venue":null,"work_id":"5cd94593-fc86-4de2-bb19-69aeb4c2ca0c","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.632981Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:51d4ff37317fc70806ff2d27beb4af3f961723e6554a1aa597605a130f01acd7","observation_id":"a2089c6b-2dbf-432e-b1e6-afb7b05f77a8","resolution":{"observed_at":"2026-08-12T00:59:01.969736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.958794Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"5d64646a-cc1b-444a-b3b1-9a1e0d224594","year":2016},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.635784Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:ff82a8ad49300aeb14a92921b65c52dbc9da5e8d49e4ced23c7c3aeef04ca429","observation_id":"c7b6a6dc-e200-46fd-a1ff-931d19e6bebc","resolution":{"observed_at":"2026-08-12T00:59:01.961726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.950312Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"71343911-c4a8-480c-864b-b82c233fff1a","year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.638585Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:95cf98a0ecd7b7b993be414a3e6aef4234accccd15fbab5d60781b94d27787ed","observation_id":"4880a0f0-34e0-4f3d-85d4-a49d81b36f41","resolution":{"observed_at":"2026-08-12T00:59:01.953374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.942040Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"4a0f1a78-1b50-47d5-9081-40aec7c4461f","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.641225Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:3d69238aae4bfe7e5a9e7f8dd1c3c9e98657fd850dcd7f7b700743d871548e90","observation_id":"3259ba9a-d2b6-4802-b975-1155a34081fd","resolution":{"observed_at":"2026-08-12T00:59:01.945166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.933125Z","title":"A picture is worth more than 77 text tokens: Evaluating clip- style models on dense captions","venue":null,"work_id":"0fe27331-8f90-49c0-89a4-dd98c2787efc","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.644041Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:b554aa82454995045d04a3e3411cdef5c355e151d6a20cf51bc1a6c9f0e36448","observation_id":"0036db66-678d-4c50-9f3e-36526ca122af","resolution":{"observed_at":"2026-08-12T00:59:01.936681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.924001Z","title":"Mobile- clip: Fast image-text models through multi-modal reinforced training","venue":null,"work_id":"364479d5-86ac-4bcf-8f90-d0147089aa70","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.647216Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:4e59f81642caedbf18265b7d8c6e2af25952f534dba5e08dffc9e4234a664476","observation_id":"2900c910-458d-49d5-b188-0413a190181e","resolution":{"observed_at":"2026-08-12T00:59:01.927259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.915166Z","title":"Sclip: Rethinking self-attention for dense vision-language inference","venue":null,"work_id":"6860c285-7222-4ab6-b21d-f8bdec057180","year":null},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.650242Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:21621233cf735b6edde6d8c7b44ad67e3ae36ebbd0abfd58defcce3511c02f4c","observation_id":"6849a673-9f1b-4338-b2d0-f7d815f05342","resolution":{"observed_at":"2026-08-12T00:59:01.918378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.905877Z","title":"Lotlip: Improving language-image pre- training for long text understanding","venue":null,"work_id":"376b6724-1f41-4e86-a06e-c3d56abddcb3","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.653129Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:867ccb79ea324e5e5f18400b26bd5e3a1297e535fb7359a28a0fa53168458813","observation_id":"a1d627ca-69a2-4ce2-a4f2-b832652a5576","resolution":{"observed_at":"2026-08-12T00:59:01.909611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.896798Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"594b2694-69d1-4a87-a1b2-970dc2a283f5","year":2010},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.656036Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:dc9dd3752f2b507263e4652d8f6ad9905fbf746e8347af282ca7c7f89905966d","observation_id":"ef549f9d-6e36-4b5f-848d-041213f458dd","resolution":{"observed_at":"2026-08-12T00:59:01.900051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.888477Z","title":"Demystifying clip data","venue":null,"work_id":"a88f8231-0cde-432f-b46f-a5f193a7ec00","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.658633Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:d0580ad0a2260b8a32a02a685832a816bb761bf5d7d398cdd6026132b3f44d1d","observation_id":"720276a8-722b-40da-b1ec-19d16d439e14","resolution":{"observed_at":"2026-08-12T00:59:01.891558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.878385Z","title":"Which features are learnt by con- trastive learning? on the role of simplicity bias in class col- lapse and feature suppression","venue":null,"work_id":"48f305e9-5173-456f-b940-982daf5e7d69","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.662014Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:15bdeab72c6d7dbaba4ae262eb6dbaaf28326ca2763bdf6b72eb9c6b93edb3b0","observation_id":"84b90c2c-6d4c-426c-bd13-23a655ec38fa","resolution":{"observed_at":"2026-08-12T00:59:01.882225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.664819Z","title":"Alip: Adaptive language-image pre-training with synthetic cap- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.664819Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:ad644ffd70a914c67b0cb3e1b048669376d626f88344df03b1e4d388b6f2dd4b","observation_id":"3757f023-7e51-4f95-9c2e-f3aaf559ceff","resolution":{"observed_at":"2026-08-12T00:59:01.664819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.865249Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":"d41029e7-64f9-4c3b-9027-0dc7af9027be","year":2021},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.667403Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:4f71c242bcc9805e33e65caecad64264b36383772316b0c0c565cbe70b98db5d","observation_id":"2730cf4a-de97-418a-ab08-573ba4d2a5d3","resolution":{"observed_at":"2026-08-12T00:59:01.868632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.857162Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"38cf7284-73af-4b0b-8e65-cb0d42cbe7e1","year":2014},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.670158Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:061104dcc79cf4cc87b235abdc6015c8614a7af4c29fe27ab2e281786fed1fc0","observation_id":"01343171-1b51-4250-be3f-a5fbf6dddce0","resolution":{"observed_at":"2026-08-12T00:59:01.860321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.848694Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"ede86ebb-7353-4da3-9819-8821e60c3205","year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.672871Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:f400bef3a88f3be617c59df5ce68b54d3ab9f0813a12e53b972c8b18a161e0f8","observation_id":"5beb5583-4a5c-4ff2-beb3-70e86ae85bde","resolution":{"observed_at":"2026-08-12T00:59:01.851879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.839757Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"e190b70b-bb4c-4ce9-a4fd-13335064cd52","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.675547Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:767c4fb581f6fbe1e6536f5f16f583114969162f4eac033eea08a5fddb59b4a0","observation_id":"97cffcac-a975-49b9-9869-0fb1cd7e82b1","resolution":{"observed_at":"2026-08-12T00:59:01.842833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.830294Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? ICLR, 2023","venue":null,"work_id":"6346b7eb-76c3-4aa2-baf1-78197c88ba97","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.678286Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:73c751f6e6a894aea9ac6820fc7888a3efcbed685c4a42555a22f85ceb7322ef","observation_id":"6f3fa02b-44ab-492e-a293-65fd3b14c078","resolution":{"observed_at":"2026-08-12T00:59:01.833392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.821996Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"b444aaa3-7982-4213-aaed-88060bc2d212","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.680908Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:bdea0436e3363dd84067e325018621419355350858fc9ab627e5ef00bdc99572","observation_id":"c23bf18c-567b-448c-a311-acb698f5eac9","resolution":{"observed_at":"2026-08-12T00:59:01.824877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.812661Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2f1f1efc-bdb6-4f5a-b4b3-57f1061f5a65","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.683643Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:78fb0de6145abc9defd6a4cc73e84bd47bbca577ee74b261ee0e23e3c5ee6446","observation_id":"2c698dfb-1afa-46f2-88ff-d0bfde6255f5","resolution":{"observed_at":"2026-08-12T00:59:01.815993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.803483Z","title":"Learning the unlearned: Mitigating feature suppression in contrastive learning","venue":null,"work_id":"ed111895-f13f-4f4e-b625-e0e1b4de4366","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.686390Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:552ba23b55399e3f29f5fbefd9e8eb8e6a0f8f192fb10748e880549cbc8f951d","observation_id":"ec95625c-92c6-4024-9419-61aac0f964d3","resolution":{"observed_at":"2026-08-12T00:59:01.806542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.794557Z","title":"Dreamlip: Language- image pre-training with long captions","venue":null,"work_id":"3de48345-a9f0-4f12-b6b8-7e4fa392908f","year":2024},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.689027Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:e1d5095ea52796ec281f89319588c14561245c2e6d59127220e40284b16093e2","observation_id":"1ffc3780-82ce-402e-84b0-b1c8857f3bc4","resolution":{"observed_at":"2026-08-12T00:59:01.797925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.785500Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"2f5fcf4c-16fb-4990-b434-29777a6ee4e9","year":2019},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.692388Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:8bb1f78a5ff41286a3bad449cd4ba8045a6b96bbc4657ee59a71cfcf3c0434b5","observation_id":"f2f462a3-d922-4a66-bd84-0fea60865499","resolution":{"observed_at":"2026-08-12T00:59:01.789021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.776113Z","title":"Extract free dense labels from clip","venue":null,"work_id":"42ea9e90-816e-4b38-963a-72400780c51b","year":2022},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.695349Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:5073d96c987c953d09516ce36d15bf93821d39eaf1dd6b0a2be0804f372b359d","observation_id":"0bf5983b-acfa-47f0-a1fe-d5ee5c46ed42","resolution":{"observed_at":"2026-08-12T00:59:01.779397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:59:01.765184Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"7943f372-b1af-4ae5-93ef-a86da4109981","year":2023},"citing_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:01.698073Z"},"links":{"citing_paper":"/paper/2412.01814"},"observation_digest":"sha256:1e820d3fdc94524f27a945fde274e3514b700dc29db9083c348863f132a66433","observation_id":"a3912940-b9a1-4d7d-88a2-3b51915297de","resolution":{"observed_at":"2026-08-12T00:59:01.770126Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":59},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 1 inbound Pith citation observation for arXiv:2412.01814."}