{"as_of":"2026-08-09T05:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffeccbc5c264fb6fc41e0c009f89d8093ec5cae458f979d26a494e49b9f64b7c","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T09:55:43.412471Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10698/citation-record","integrity":"/paper/2607.10698/integrity","json":"/paper/2607.10698/citation-record.json","paper":"/paper/2607.10698"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:211bd3db607a9ba4877a9b9908031eddad2fc79498e22a1bd04d2d590b723a0e","observation_id":"41f32ed8-c815-499c-ae3f-455d7144bad6","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:53bf0d311fbab5bd6353e571a74ab7d727a73262c94bc5718321a935764f24c2","observation_id":"5ec96b19-09be-461c-a827-81bf234957f5","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Welle and M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:337286602e184146b81d95299888142076ceaefd7a8400ee8cc77b41a0351731","observation_id":"7d2dd094-c7e7-4bd3-b877-d184fb62bccc","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Learning Transferable Visual Models From Natural Language Supervision , issn =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:6d1d00644ca379897e5c3b243aebc2b152575205608e584171721b13b2f233e9","observation_id":"41717dd9-21de-4123-91e6-c58ec63bbf7a","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Mind the Gap: Preserving and Compensating for the Modality Gap in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:5828271a58fa8f8e98684e12d523222fa9ac1a12d0458d94fba4c4fba99f8c44","observation_id":"dd5339ae-ce24-4d18-ab0c-59ccd891267b","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03703","last_updated":"2025-05-06T17:24:41Z","snapshot_observed_at":"2026-08-09T05:06:25.999685Z","submitted_at":"2025-05-06T17:24:41Z","title":"Fill the Gap: Quantifying and Reducing the Modality Gap in Image-Text Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03703","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Fill the Gap: Quantifying and Reducing the Modality Gap in Image-Text Representation Learning , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2505.03703","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:5ff42f83a76fd5d43cc6887da0e7336890f31be12dd661a16db2d398b5d7dcab","observation_id":"aaa20988-4bfe-48ae-b506-7093ef8b35f1","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:ad49755d13ec2c9642608572f66808266ba82f65bd766cd0c62f807f311abaac","observation_id":"facefa64-37b2-4c5e-b531-fab1f1d52c42","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17639","last_updated":"2024-09-16T15:32:11Z","snapshot_observed_at":"2026-07-06T18:36:47.155837Z","submitted_at":"2024-06-25T15:24:02Z","title":"Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17639","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"arXiv preprint arXiv:2406.17639 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2406.17639","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:8631a63504a703b14b3c82090d2301a1f0f03744c4aab5a6d347805a536feadd","observation_id":"c343c166-52ce-4d12-824e-6580531435fc","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"The Double-Ellipsoid Geometry of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:7a21b945dc0de847bc5fb299e538d5f575a6526976b1a256320b390b4d649b2c","observation_id":"fd5d053f-626a-41a5-b30a-92475cfc6c00","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Understanding the Behaviour of Contrastive Loss , rights =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:4e1164d6ffcc881f9f744455f46bc3a9a3ce76d1bbc5d0c7408d1690badd51c4","observation_id":"32070759-6146-4700-9b57-ee68525bc559","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"IEEE Transactions on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:8a971400f2e182181b2904c94677559a5d96a2be09984bf5a59d1a1c4e605651","observation_id":"b5b3f29d-ccda-4800-8891-a3422935d2cb","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"and Lin, Dahua , urldate =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:6eea7a9c697b71c4bd6b474d44ee21fcb5a1546619ba8814c67a483af2327a95","observation_id":"0a073013-80ad-4dbe-a74e-0569ad1fee6a","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Representation Learning with Contrastive Predictive Coding , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:333402408e759a8bb946ef904d8e0bd513a4fc01272f504f525fd071ac80aa77","observation_id":"3d0ca495-471e-412b-bf37-e81bfdf42e76","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Learning Representations by Maximizing Mutual Information Across Views , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:27aac5004522ff01a709af8a61b9b731c7568c9bfde5022b6c54fcb92fbbe22a","observation_id":"57a1ac9d-0dde-4e01-a5eb-d15445037a9b","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"A Simple Framework for Contrastive Learning of Visual Representations , url =","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:f6c86829dfedb2a2f0d625ac380346d2c684de94e8efa8f065160c353647d31f","observation_id":"cc14a885-5c21-4bab-9fcc-322636230be4","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Momentum","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:73257421b12dbb62a59f74295998ff64628c432027a9b66e125b5fbfa88dbde7","observation_id":"8cb7ef59-3df2-4720-b2df-fd5704b6422f","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.05373","last_updated":"2017-03-01T08:55:36Z","snapshot_observed_at":"2026-07-06T05:30:25.930441Z","submitted_at":"2017-02-17T15:06:14Z","title":"EMNIST: an extension of MNIST to handwritten letters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.05373","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"doi:10.48550/arXiv.1702.05373 , shorttitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/1702.05373","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:79a7134ece93c13dbcf2f02e5e2de1a198b3023cf818dece116881ebd455f97b","observation_id":"61cc073c-496b-4d1f-bffa-538097f8b93e","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Lawrence and Dollár, Piotr , urldate =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:e145a1bfba5ca12e1eacf80ad74242dcc1b4bae7b144fd3e056b684d904a1cb0","observation_id":"cc6b0391-478a-43a1-a2c4-47521cd9fbde","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03897","last_updated":"2023-11-07T00:34:37Z","snapshot_observed_at":"2026-08-06T19:10:15.512409Z","submitted_at":"2022-03-08T07:34:52Z","title":"Geodesic Multi-Modal Mixup for Robust Fine-Tuning","version":4},"cited_work":{"arxiv_id":"2203.03897","doi":"10.48550/arxiv.2203.03897","metadata_source":"pith","pith_arxiv_id":"2203.03897","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Geodesic Multi-Modal Mixup for Robust Fine-Tuning","venue":"cs.CV","work_id":"83e9d542-5736-4b5e-9c5b-ecd6c063d3b1","year":2022},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2203.03897","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:d1edecb977988f551ad66505420993fac552c10839a313f77ebcfe5d0065b9c8","observation_id":"0a23ab62-74f2-42b3-bd77-b0fe143c1fde","resolution":{"observed_at":"2026-07-14T10:00:26.872272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:20:04.035615+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:20:04.035615+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"Second Workshop on Representational Alignment at ICLR 2025 , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:009be6efc427137bb084cb54d995c1e42bb4982b2621377c5f89418f7977b139","observation_id":"e3e0d41b-9e54-402b-aaf2-72ea9c0969e1","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:6f35359f7e5d465f4b93c31da5e45d8c56808f4b1a6c9dc41649fd003746e19b","observation_id":"75905059-fca1-40a6-a4c7-1e0a1d2063a8","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"2018 , eprint=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:e2bd36cd8c089b0a9f8b80909892aa37eb0c1b0e8e171b10c84496f7a225a652","observation_id":"dc5f12f3-0fbd-496d-99db-9cf40ee2ef0c","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"2015 , eprint=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:c4444f11c0f7bdd513140146bfcccd045b202c5dc6b14b239a5249039016c4e8","observation_id":"b8f3fd5a-b823-4315-883d-aa585eb3ac91","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:554327c14e3a5d370863432c3ba65c6e5cbf6c31a3d3c7996274342a27ce1e37","observation_id":"1ea4d842-e4db-40b6-ae32-38ac2ea48ac6","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:2a31b2b106f6f01091f8c9916c8b1fec9d89f14cca69d3db5fa09c46754cc80e","observation_id":"64f25ac6-0a42-447e-9530-f48a44ff3d4c","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:47:56.625661Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.10698."}