{"as_of":"2026-08-14T21:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea1b2e7bed7abb2ee59ec80ced335aa18487280383769c6435803d6a201792d8","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:27:08.913531Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:11:51.045027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-06T20:11:51.045027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-14T09:42:45.374800Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.045027Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0aad4cfe282fa5c5e67626f59572ea46efa45ef98d000dcf4528a9dc0e4ff8ce","observation_id":"9e393176-8412-4a5a-816e-ea283721eaac","resolution":{"observed_at":"2026-08-06T20:11:51.045027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":"2411.14517","doi":"10.48550/arxiv.2411.14517","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The double-ellipsoid geometry of clip.arXiv preprint arXiv:2411.14517","venue":"arXiv (Cornell University)","work_id":"ccb7cd66-a39c-4b2c-95e1-31fc2c849a45","year":2023},"citing_paper":{"arxiv_id":"2605.07907","last_updated":"2026-05-08T15:45:34Z","snapshot_observed_at":"2026-08-13T15:41:06.798887Z","submitted_at":"2026-05-08T15:45:34Z","title":"Consistency Regularised Gradient Flows for Inverse Problems","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-11T03:21:35.082352Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2605.07907"},"observation_digest":"sha256:cb5e45bb14cfe594f26deda228f871b5aeaf1fa9db953c2a6834423e0620deb6","observation_id":"249358b8-1e94-48ba-b496-86084158aa02","resolution":{"observed_at":"2026-05-11T03:25:54.899664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":"2411.14517","doi":"10.48550/arxiv.2411.14517","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The double-ellipsoid geometry of clip.arXiv preprint arXiv:2411.14517","venue":"arXiv (Cornell University)","work_id":"ccb7cd66-a39c-4b2c-95e1-31fc2c849a45","year":2023},"citing_paper":{"arxiv_id":"2605.07973","last_updated":"2026-05-08T16:32:44Z","snapshot_observed_at":"2026-08-12T11:11:48.950322Z","submitted_at":"2026-05-08T16:32:44Z","title":"HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T03:12:10.701349Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2605.07973"},"observation_digest":"sha256:0d6056a21b70329cca96c35f7ce0d558aab6db0eb425e7e5a4817c5f60065136","observation_id":"e08923c8-03ac-4056-b529-ae2e7e7fbe62","resolution":{"observed_at":"2026-05-11T03:15:54.923804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":"2411.14517","doi":"10.48550/arxiv.2411.14517","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The double-ellipsoid geometry of clip.arXiv preprint arXiv:2411.14517","venue":"arXiv (Cornell University)","work_id":"ccb7cd66-a39c-4b2c-95e1-31fc2c849a45","year":2023},"citing_paper":{"arxiv_id":"2606.11190","last_updated":"2026-06-10T19:46:16Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:59:58Z","title":"When to Align, When to Predict: A Phase Diagram for Multimodal Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T14:08:33.542700Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2606.11190"},"observation_digest":"sha256:b877b47fa9558a9aa858397c910e5d3770d3ff1f98fcf8bcdc1fd2fa1a72c2f4","observation_id":"a51214b1-5ced-44eb-8ff2-f786b450dc8d","resolution":{"observed_at":"2026-06-27T14:10:57.780723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":"2411.14517","doi":"10.48550/arxiv.2411.14517","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The double-ellipsoid geometry of clip.arXiv preprint arXiv:2411.14517","venue":"arXiv (Cornell University)","work_id":"ccb7cd66-a39c-4b2c-95e1-31fc2c849a45","year":2023},"citing_paper":{"arxiv_id":"2606.30625","last_updated":"2026-06-29T17:55:40Z","snapshot_observed_at":"2026-08-11T12:08:39.966475Z","submitted_at":"2026-06-29T17:55:40Z","title":"Optimization Dynamics Imprint Semantic Specificity in Contrastive Embedding Norms","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T03:27:31.177489Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2606.30625"},"observation_digest":"sha256:0d6608e78e9d414cbf6add73857042a1f0bd1cf84344331c048bce0cf74e3d2c","observation_id":"be83d961-77ab-4be8-8e6e-5b083317ec00","resolution":{"observed_at":"2026-06-30T03:34:13.360064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:20:02.780597+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-07-14T09:55:43.412471Z","title":"The Double-Ellipsoid Geometry of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10698","last_updated":"2026-07-12T10:41:52Z","snapshot_observed_at":"2026-08-14T09:02:42.693882Z","submitted_at":"2026-07-12T10:41:52Z","title":"On the modality gap and the contrastive loss in multi-modal representation learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T09:55:43.412471Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2607.10698"},"observation_digest":"sha256:53e6196fa6f7112470fd4852105e75098a4aa2d95c8872eca1557f9351c6dacf","observation_id":"fd5d053f-626a-41a5-b30a-92475cfc6c00","resolution":{"observed_at":"2026-07-14T09:55:43.412471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-02T04:33:53.106844Z","title":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13660","last_updated":"2026-07-15T10:05:53Z","snapshot_observed_at":"2026-08-14T10:12:56.734187Z","submitted_at":"2026-07-15T10:05:53Z","title":"The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T04:33:53.106844Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2607.13660"},"observation_digest":"sha256:8bf92defc68bab40f3778e75f06e5e02e3a0c61d3e8d798aa93a3c08b588850b","observation_id":"742c16b9-db8c-4f45-9197-72f6a802c9c9","resolution":{"observed_at":"2026-08-02T04:33:53.106844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14517/citation-record","integrity":"/paper/2411.14517/integrity","json":"/paper/2411.14517/citation-record.json","paper":"/paper/2411.14517"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.692056Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.692056Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:fdcd889ff1937072a8e0cea65e479fc77ffb48a0b472a6acff8b40b5d85383e1","observation_id":"2e69f3b2-d031-4ee4-bdb6-532e7acfb594","resolution":{"observed_at":"2026-08-12T15:27:08.692056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.548972Z","title":"Crosspoint: Self-supervised cross-modal contrastive learning for 3d point cloud understanding","venue":null,"work_id":"c9d23c0b-a80d-4208-8bfb-0d2c838e2eca","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.696999Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:d6a2c8105249b07c191a2517f18700fcf09dc2facf7d4acee7a212f0e9e334bb","observation_id":"3a3ce743-e330-4b24-9ea3-a0c5475141b9","resolution":{"observed_at":"2026-08-12T15:27:09.552537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09229","last_updated":"2019-02-25T12:32:15Z","snapshot_observed_at":"2026-08-14T17:11:48.050757Z","submitted_at":"2019-02-25T12:32:15Z","title":"A Theoretical Analysis of Contrastive Unsupervised Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09229","snapshot_observed_at":"2026-08-12T15:27:08.700684Z","title":"A theoretical analysis of contrastive unsupervised representation learning","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.700684Z"},"links":{"cited_paper":"/paper/1902.09229","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:44d415240e3b6f6b92ede4350d7d6fe5d7407a8521dfd03264d841ca32e8c756","observation_id":"8450b623-64af-41eb-9e49-c0db6daa6e6e","resolution":{"observed_at":"2026-08-12T15:27:08.700684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.538739Z","title":"Grit-vlp: Grouped mini-batch sampling for efficient vision and language pre-training","venue":null,"work_id":"6be5915f-15b0-4867-a17b-a5bb6c02d95e","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.705196Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:22122e0eb6feefba22d17dd67bfd5aae13de8dc048dcbd063f8b5c4bb37c1ea1","observation_id":"441a6acf-f127-45c5-b805-63727d1bcbcf","resolution":{"observed_at":"2026-08-12T15:27:09.542365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.527554Z","title":"Mafa: Managing false negatives for vision-language pre-training","venue":null,"work_id":"a0be1899-1c77-436a-b7dd-3e66a0e4b3b9","year":2024},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.708525Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:f6acbd43ff2910fd6261f614d07c1419053c4eba617bdcf0b335248e76a455d8","observation_id":"8da093b7-fcd1-4f8a-94b7-4d34386714f9","resolution":{"observed_at":"2026-08-12T15:27:09.531238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.516759Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":"7796a068-b433-4ef4-9add-cda0af137e46","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.712059Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:e8ee0a884635c430db22fa1157193c2144ff495b3b31b44d8773f6f63408b665","observation_id":"f194b376-7684-4c4f-b993-172018eca4e5","resolution":{"observed_at":"2026-08-12T15:27:09.520727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.715475Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.715475Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:54e082688a9ba5336eeb6695784ad87f84fda94a24f4c5cb52af84f94ab419b8","observation_id":"15d7b1fa-e38b-479e-9d0b-7bdcc41fde77","resolution":{"observed_at":"2026-08-12T15:27:08.715475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13115","last_updated":"2023-03-29T18:26:34Z","snapshot_observed_at":"2026-08-14T07:10:26.392864Z","submitted_at":"2022-05-26T02:46:09Z","title":"Fine-grained Image Captioning with CLIP Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13115","snapshot_observed_at":"2026-08-12T15:27:08.719025Z","title":"Fine-grained image captioning with clip reward","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.719025Z"},"links":{"cited_paper":"/paper/2205.13115","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:3516a48990e1624f772d5c1af5ec022d0c041740db983360a4bb1805519220f0","observation_id":"82ae280a-d73c-41e1-9c54-c9f95123f773","resolution":{"observed_at":"2026-08-12T15:27:08.719025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.498225Z","title":"Debiased contrastive learning","venue":null,"work_id":"5b0e6cd6-bd2e-4b08-969a-d83936d15919","year":2020},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.722558Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:bee1531b5358ee0620dfa5a9250e6c2b745dbddffc3a916ae14f5e5e093f42e3","observation_id":"d2415993-83b1-4ded-8681-44e71a5fd964","resolution":{"observed_at":"2026-08-12T15:27:09.502088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.486968Z","title":"Eccv caption: Correcting false negatives by collecting machine-and-human-verified image-caption associations for ms-coco","venue":null,"work_id":"bbd4878a-8c19-432c-a7b2-fce1b4b9d32b","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.726139Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:a795d4d7ff646b404d7d3a87bf85fc55d9b7d50e271562f264fc1470f41d981a","observation_id":"15a06a48-4505-42e8-960e-787fc7ac50b1","resolution":{"observed_at":"2026-08-12T15:27:09.490912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.476317Z","title":"Eldar and Alan V","venue":null,"work_id":"1ed2e57f-372f-4a69-8676-23be0b51549b","year":2003},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.729900Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:5e63663ca1e05d7672f7ca266400014d9a7e9308e2f8f409bef5c52b41e50d83","observation_id":"fa8d2de3-14c7-4db0-b694-8a37b0cbce0f","resolution":{"observed_at":"2026-08-12T15:27:09.480059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-08-12T23:55:45.098329Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-12T15:27:08.733351Z","title":"Its not a modality gap: Characterizing and addressing the contrastive gap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.733351Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:dc1ce470176de61687575265870762a81f475f09713c883656d1de495a893194","observation_id":"985352e5-5476-4be7-8f86-7144a0f14e28","resolution":{"observed_at":"2026-08-12T15:27:08.733351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.465692Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"96db05d7-5059-40ad-a8a1-01a9ba617066","year":2024},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.737235Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:6f22ffb77e55d7f701f1af362ddc144bfbf9547ae14a8510f25a937f4d62281f","observation_id":"a3affa10-9b1b-4eab-bb4c-8a37f79ab46c","resolution":{"observed_at":"2026-08-12T15:27:09.469451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-12T15:27:08.740577Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.740577Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:b98d7d1a500034cea1870861f6fb2d61409981d1ed89ad18f8000cf3369df33e","observation_id":"d7c749ab-375c-48b7-a5dd-8ae3ee7bbb22","resolution":{"observed_at":"2026-08-12T15:27:08.740577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-12T15:27:08.744074Z","title":"Simcse: Simple contrastive learning of sentence embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.744074Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:fd1cde60d587215495aaef19e773705d702a533e0f8fa7f726107e04177d5f4d","observation_id":"1f1010a0-12ba-4911-8912-0e17bfa4c948","resolution":{"observed_at":"2026-08-12T15:27:08.744074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.454943Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"4a7b6527-7c41-466e-aadf-5b42784e23a5","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.747702Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:3279ee383e662d9d814d2f72498537fe07cdc8d2cda0ac9402d658834106c435","observation_id":"c9cae812-ed5c-449a-a7c1-ef754b47dea6","resolution":{"observed_at":"2026-08-12T15:27:09.458805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.443552Z","title":"Proxedit: Improving tuning-free real image editing with proximal guidance","venue":null,"work_id":"bdf0263d-6388-4429-a542-bbf3c3bf275a","year":2024},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.751124Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:953065ade716a137c11db73f434d6a74b7a94b6e721801ff8d43a88dee8635eb","observation_id":"026a5c38-ac85-4969-811f-20f7a01314f7","resolution":{"observed_at":"2026-08-12T15:27:09.447304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.754774Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.754774Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:fc177f8c8ba88637548d4f708b4cf505d82cb53a6c19e1404668ed60fa1669d0","observation_id":"359a2066-106d-4655-9038-55ac7475dc5e","resolution":{"observed_at":"2026-08-12T15:27:08.754774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.425290Z","title":"Open-vocabulary multi-label classification via multi-modal knowledge transfer","venue":null,"work_id":"f7b61644-4dcd-44a9-a4bf-d217baed18ee","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.758531Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:83b6fe565c000a4471973816ba5c6f6d5117533fad16a92f77726a41eb2eb785","observation_id":"9bb68dc2-63d7-4ba5-9134-f0f50addab42","resolution":{"observed_at":"2026-08-12T15:27:09.429653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.414687Z","title":"Clip goes 3d: Leveraging prompt tuning for language grounded 3d recognition","venue":null,"work_id":"74204e59-db6a-4fdc-9052-625fbcd48575","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.762049Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:60d6652d45cf95f33f97c4d033b82c517fb259b153c326d4d12d01858983f73e","observation_id":"9185dd05-1fcd-4b25-bac3-669db242fd80","resolution":{"observed_at":"2026-08-12T15:27:09.418553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.765412Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.765412Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:c2a8886d1bf0e210662cf1d27769013e797fa68ee73eb582a14bf6edf1a6d113","observation_id":"0bd0dae5-f0c7-4029-9d7a-a6384d233b9b","resolution":{"observed_at":"2026-08-12T15:27:08.765412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.768831Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.768831Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:85723ad02fab3c15e2aacfd2caeeb603582b95463611174820551df7d2f1e3ad","observation_id":"df71112c-7046-449c-bda2-81eeab463582","resolution":{"observed_at":"2026-08-12T15:27:08.768831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.390735Z","title":"Boosting contrastive self-supervised learning with false negative cancellation","venue":null,"work_id":"132ed360-6d12-4c95-bcc1-7e77fe89eb5b","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.772696Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:aeb85aa00a549f2a6b5c1bd0d4c9078669cf9ce542bd219535062c28ed1ea305","observation_id":"b2ea9f17-f111-4014-8ca2-9b5e0529f250","resolution":{"observed_at":"2026-08-12T15:27:09.394316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11644","last_updated":"2022-10-06T18:09:37Z","snapshot_observed_at":"2026-08-13T14:39:33.258591Z","submitted_at":"2022-08-24T16:34:30Z","title":"A Slightly Improved Bound for the KLS Constant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11644","snapshot_observed_at":"2026-08-12T15:27:08.776197Z","title":"A slightly improved bound for the kls constant","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.776197Z"},"links":{"cited_paper":"/paper/2208.11644","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:87d1d902b0c3c3ecc0e2b842e5fd9cbf29efef80d343f2941510a40b4e6299f9","observation_id":"59434c5c-02c4-4a45-842d-a43261a26660","resolution":{"observed_at":"2026-08-12T15:27:08.776197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.379942Z","title":"The power of contrast for feature learning: A theoretical analysis","venue":null,"work_id":"12062c47-d16e-4f5a-9596-9fbb104bd4bc","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.780045Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:84c27a1b757a3f5999ee1126f803d5c4aa80e6013b00115ac61ea6c9458ec321","observation_id":"9f37cd12-7d20-441f-b51c-7bfb46e4f61c","resolution":{"observed_at":"2026-08-12T15:27:09.383804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.368811Z","title":"Hard negative mixing for contrastive learning","venue":null,"work_id":"155b269a-a592-4087-a903-cffbf2ec1816","year":2020},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.783478Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:21c9b015623db36c4c97b718233fa347fc40ce085259fb70fec56527f4b14144","observation_id":"a10cefdd-fdc2-4ded-8f89-b9778d31862d","resolution":{"observed_at":"2026-08-12T15:27:09.372683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.788113Z","title":"Isoperimetric problems for convex bodies and a localization lemma","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.788113Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:35a18e08ff41a49153836b28f191ef8160ec216d2f32904686d358953d931661","observation_id":"f4cfce5a-a4b6-4409-b94e-618a8f75b103","resolution":{"observed_at":"2026-08-12T15:27:08.788113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.351272Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"511b58ab-121c-46a9-91a0-b73d289249ba","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.791658Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:ac11c9d2befc3669d95ae37eb5326bc7aa0b0453c30a572ab1166dc0f0af409d","observation_id":"85ee44e1-97c5-4fd2-8325-423f2e540f2c","resolution":{"observed_at":"2026-08-12T15:27:09.355146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.795199Z","title":"Optimal whitening and decorrelation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.795199Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:69b005439726899a4292099809cbc4436dab6467a837c88992bf37a92a36525a","observation_id":"ac23b385-0acd-4187-84d8-29824a7c9145","resolution":{"observed_at":"2026-08-12T15:27:08.795199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.333377Z","title":"Diffusionclip: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":"3bbf2088-7041-4bc3-b949-a8bb8a8b17c9","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.798626Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:845bdd21c52d65aae250ccb5626b86fba7bb16d2aaaeece82b83dc76fb64176d","observation_id":"914c90c9-b426-4262-bbc9-7497d2043241","resolution":{"observed_at":"2026-08-12T15:27:09.337163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07345","last_updated":"2021-06-03T05:52:43Z","snapshot_observed_at":"2026-08-13T19:10:47.776435Z","submitted_at":"2021-06-03T05:52:43Z","title":"Self-Guided Contrastive Learning for BERT Sentence Representations","version":1},"cited_work":{"arxiv_id":"2106.07345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07345","snapshot_observed_at":"2026-08-12T15:27:09.038324Z","title":"Self-Guided Contrastive Learning for BERT Sentence Representations","venue":"cs.CL","work_id":"d982b74d-7249-4e8f-8224-594f48b282c3","year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.803202Z"},"links":{"cited_paper":"/paper/2106.07345","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:0fa4e484397bcc1d09df0d80d0bea3a98b1cbdabff28ec0e12c2479aec4bcf45","observation_id":"9bf2ca50-2804-42a3-942d-39c2e064c152","resolution":{"observed_at":"2026-08-12T15:27:09.045781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.322211Z","title":"Logarithmic bounds for isoperimetry and slices of convex sets","venue":null,"work_id":"e55c25b9-1738-48a1-afa2-24e1517095a8","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.807373Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:b5946187ee28c46209a03cd4337dc58007afab7a213ddc89f41a6aa23ff51ceb","observation_id":"ac978ad9-78b0-45f4-ba51-d7387df81320","resolution":{"observed_at":"2026-08-12T15:27:09.326378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.311603Z","title":"Bourgain’s slicing problem and kls isoperimetry up to polylog","venue":null,"work_id":"4dad3d34-9b76-4da6-8cbe-3cc46e4885dc","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.811016Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:208fbdeaa4f16a57a8857fa669752cf17c04dca00aedb65c57a80732fc32ac01","observation_id":"5675096a-f93d-473a-b7c8-846bbbcf5260","resolution":{"observed_at":"2026-08-12T15:27:09.315268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.814599Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.814599Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:d96aa00cffdff5f048349b280c7f04e348d42cdde6aec579c52e05a30c54cca2","observation_id":"0810a8d6-d28d-40f1-b972-355fd1516f9b","resolution":{"observed_at":"2026-08-12T15:27:08.814599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.293233Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"e5b7eafd-791e-4ade-8ba1-98d9afe2e9df","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.818367Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:16d3b673e18d1a5da25289d89200fee92e50c791a13115f580abd161150dc459","observation_id":"082272bb-9e5b-4e0d-bd12-0a44b48d582b","resolution":{"observed_at":"2026-08-12T15:27:09.296988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.281448Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"d2b448c5-1c95-4ad4-9b5b-8784548197f5","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.821762Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:191e819ab500a02c5a1c1027d10c0909dec6ff64f0d1a728ea39b109a470c5fb","observation_id":"b9e9b5b3-673a-4d8e-97ce-fe9a3c4defeb","resolution":{"observed_at":"2026-08-12T15:27:09.285480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.825500Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.825500Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:c2ad5f127024b4d619f1265511af07f1cd4044e270af865c102ab72f89f7713b","observation_id":"1573240e-e676-4e06-9164-c71bfc98bb2b","resolution":{"observed_at":"2026-08-12T15:27:08.825500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.829241Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.829241Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:46a8103e7322d8ba81ed9dfdabb19acf1062df9b6aea3275887995306b01c050","observation_id":"7eaba0d9-0525-47ad-829d-b1456cb58ee5","resolution":{"observed_at":"2026-08-12T15:27:08.829241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-13T11:00:46.685761Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-08-12T15:27:08.832852Z","title":"T-mars: Improving visual representations by circumventing text feature learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.832852Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:bfeae3ebb66e28375034a2819f5eea0de8b48a9931a58b69bfeea70ab891eda5","observation_id":"23bc8428-552b-496b-adcd-0b06efbf0260","resolution":{"observed_at":"2026-08-12T15:27:08.832852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.257140Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"699d03f2-1fb7-4e5b-bd06-e6129b5b35d9","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.837390Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:82360ebf92f425267e3f29d3b2873911b6c1548f1a755678c3413a0b934f630c","observation_id":"1173e5b2-1281-4833-b1b2-fd21cff77965","resolution":{"observed_at":"2026-08-12T15:27:09.261120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-13T13:33:48.501765Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-12T15:27:08.841244Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.841244Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:7a7b9a99dc7c5afac56daeadf78edc8309dd80a17a2221bd9cd64dcc546f3c39","observation_id":"8b205510-a7a7-4003-926f-b1e29ce5f987","resolution":{"observed_at":"2026-08-12T15:27:08.841244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-12T15:27:08.845177Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.845177Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:f2d1d8fe4f7c4a28835f9c70acf0db68633d8ab1e9c4a897219acaadf0bb2f58","observation_id":"87a77cfb-2324-4d8b-aa5b-2b4d489a5b3f","resolution":{"observed_at":"2026-08-12T15:27:08.845177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T15:27:08.849329Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.849329Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:5412bd347eeca8dbbd388d43e8ed8dfb427d1d012116600fe5146e3836be76ae","observation_id":"f5b25e2e-85d3-42b3-82b1-4f4a6176caac","resolution":{"observed_at":"2026-08-12T15:27:08.849329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.245526Z","title":"Concentration of mass on convex bodies","venue":null,"work_id":"2db2ba88-75c9-45b5-b866-bbcf8b00c6d5","year":2006},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.853808Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:1bef3c6e2621fe29c0da4bf83e584b812f79ccf092fe0c3c149b05f564a8fdf9","observation_id":"46acc012-612c-4832-bf2b-f5765c1ca293","resolution":{"observed_at":"2026-08-12T15:27:09.249574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:08.857514Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.857514Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:3b0dad7882feaff357204feeed19b062179878e84d5cdbe2442327bfaf4be205","observation_id":"f7cf45cd-38b8-4a73-b3f0-4f0f19a1a8d6","resolution":{"observed_at":"2026-08-12T15:27:08.857514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T15:27:08.861394Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.861394Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:91f15d019943a71180f6c257aaab881080e0c678dbb68f0f098cad559be04ea1","observation_id":"7bbcc534-37a2-488c-a04d-0cebc1ed2d0e","resolution":{"observed_at":"2026-08-12T15:27:08.861394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-07T09:28:19.837584Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-12T15:27:08.865285Z","title":"Contrastive learning with hard negative samples","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.865285Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:cd68730772b9d6718d92fcbc2dda48e6e343ce915df5e85cc3fc3d6d2f915afe","observation_id":"be457e78-b581-46f3-a84a-0688e61ce576","resolution":{"observed_at":"2026-08-12T15:27:08.865285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-08-13T00:32:26.842527Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-08-12T15:27:08.869500Z","title":"Two effects, one trigger: On the modality gap, object bias, and information imbalance in contrastive vision-language representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.869500Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:19de47683a87d7a42e08fc806daa17fd6587e098ff6f0855b7bf54d2c48a1db1","observation_id":"ecae586e-f37f-46c1-93b3-84815eab7a7a","resolution":{"observed_at":"2026-08-12T15:27:08.869500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.226750Z","title":"Towards understanding the modality gap in clip","venue":null,"work_id":"d2ef2db6-1594-4fea-8f45-1d1cded19084","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.873464Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:7035d6423fb9ea8a893063f3c0cb9d2f82c9ae7a20a4ff419058c5c08efb0758","observation_id":"756ae1ac-b357-4503-b1a8-e97284e17410","resolution":{"observed_at":"2026-08-12T15:27:09.230577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.215403Z","title":"Clip4caption: Clip for video caption","venue":null,"work_id":"86322da1-82d5-4c53-ae99-574fd6390cb7","year":2021},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.878435Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:edc933843713a6d94d368ea16a029afdf01bfea2ad86737541076fa8d1ee8376","observation_id":"25320019-feb7-4ccd-9f99-02c2f237008f","resolution":{"observed_at":"2026-08-12T15:27:09.218980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.204747Z","title":"Too large; data reduction for vision-language pre-training","venue":null,"work_id":"9055367b-dec6-447a-ab20-b7dbe3da63a9","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.883741Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:64d0b999226e1a9147d16ded4c9a351ec41537fe1a490ba0d348122d3981c135","observation_id":"baba9d6b-8b96-4fc6-9a68-04b543150ee4","resolution":{"observed_at":"2026-08-12T15:27:09.208723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.193637Z","title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere","venue":null,"work_id":"53258f82-9cde-4cd0-a38b-5ea444c8daa3","year":2020},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.887310Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:ddb0c117624dc14c8049dc349f6ef20aeb03e3685e0f94ef77e2dd1f274b9300","observation_id":"3e3708c2-1e12-4209-855d-170ae8df0a23","resolution":{"observed_at":"2026-08-12T15:27:09.197495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13457","last_updated":"2022-05-27T09:29:45Z","snapshot_observed_at":"2026-08-13T16:18:29.007692Z","submitted_at":"2022-03-25T05:36:26Z","title":"Chaos is a Ladder: A New Theoretical Understanding of Contrastive Learning via Augmentation Overlap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13457","snapshot_observed_at":"2026-08-12T15:27:08.890954Z","title":"Chaos is a ladder: A new theoretical understanding of contrastive learning via augmentation overlap","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.890954Z"},"links":{"cited_paper":"/paper/2203.13457","citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:c6a3fe58e855b6861ccdc1358eea9e3e612cf1ca215cc0a3aeaffc99ea49510a","observation_id":"8c992d2e-eab8-47dd-9c91-8350b99fd5dd","resolution":{"observed_at":"2026-08-12T15:27:08.890954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.182262Z","title":"Wav2clip: Learning robust audio representations from clip","venue":null,"work_id":"c96f999f-3969-4ee4-9421-107169b7947c","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.894992Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:e9b17451d5e5368e9248c16fee7026b7fefbef371b9ef43d68865618f19add3c","observation_id":"87f4022b-f9f6-4cee-8f98-949bc6b43588","resolution":{"observed_at":"2026-08-12T15:27:09.186237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.171015Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"2c12798c-ab2a-4276-acfa-bcb5df03e0f5","year":2023},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.898772Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:df5b43e5e4549ad6ce01c48625499dc91bd2c36dafebbdbd4ad999927cae96ab","observation_id":"d34d1666-21b4-4268-ab99-45d680099ddd","resolution":{"observed_at":"2026-08-12T15:27:09.174912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.159084Z","title":"Pointcontrast: Unsupervised pre-training for 3d point cloud understanding","venue":null,"work_id":"7bd3916e-ff0f-4b2a-ace9-b85dd41b7ce2","year":2020},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.902233Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:5492300352d827e7bd5709ac0656bbb658fddf485d052f0c0919abbc39569977","observation_id":"740e3585-3cf8-451c-867e-7b9219c6ddeb","resolution":{"observed_at":"2026-08-12T15:27:09.163432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.147533Z","title":"Vision-language pre-training with triple contrastive learning","venue":null,"work_id":"645e7548-54a9-4181-9963-75123f9dbcda","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.905851Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:7bea4bff70781d35ef73ce724e301db3e6b98c89ae07cd271e968bb44b267e27","observation_id":"ee0d79db-2944-4174-9518-2ad3fd31c606","resolution":{"observed_at":"2026-08-12T15:27:09.151554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.132481Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip","venue":null,"work_id":"acbc247d-6e57-4efe-8d43-c0d83cbfe427","year":2024},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.909555Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:7fde8de5a7fa0c742ccfc4d2ac8d7c664b30877b8db915dd9f545e75c3118e7d","observation_id":"fdeb8284-5b63-4f74-bf67-40715d3e6dd1","resolution":{"observed_at":"2026-08-12T15:27:09.136920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:27:09.117427Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":"05a7eee0-325b-4262-9a3e-60a7eaf737b0","year":2022},"citing_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T15:27:08.913531Z"},"links":{"citing_paper":"/paper/2411.14517"},"observation_digest":"sha256:5ccb6417f235e5ab72d5278c6d1c0d620cc25cddb02913a2e1c3de850a244ab2","observation_id":"d4736b66-74a3-4761-b6da-12d79b23e592","resolution":{"observed_at":"2026-08-12T15:27:09.122362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:19:02.769113Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 7 inbound Pith citation observations for arXiv:2411.14517."}