{"as_of":"2026-08-09T19:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2f13a54c7a5e0389956d78faac5ade0a7f57845428b0e3750d703fa0560193e","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:05:28.366500Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:24.087885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T14:13:29.951494Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-08-07T14:01:24.087885Z","title":"Bagdanov","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.087885Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:1ee46520a91abbb0970b8978d4aefdc082378eaf8ab2dbefc31b6127a43f92bd","observation_id":"421bfe05-7e31-41b5-ad92-4b487724c3f8","resolution":{"observed_at":"2026-08-07T14:01:24.087885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-08-06T22:33:33.700571Z","title":"Cross the gap: Exposing the intra-modal misalignment in clip via modality inversion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21476","last_updated":"2025-06-26T17:05:06Z","snapshot_observed_at":"2026-08-06T22:22:07.574344Z","submitted_at":"2025-06-26T17:05:06Z","title":"Global and Local Entailment Learning for Natural World Imagery","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:33:33.700571Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2506.21476"},"observation_digest":"sha256:51e0999666387dc555d1a3b54a893561827d4886b70f659ff5f0715740b90662","observation_id":"a3bd064c-3c80-479b-a405-5813f35c1596","resolution":{"observed_at":"2026-08-06T22:33:33.700571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-08-06T18:09:17.391053Z","title":"Cross the gap: Exposing the intra-modal misalignment in clip via modality inversion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09118","last_updated":"2025-07-12T02:28:42Z","snapshot_observed_at":"2026-08-09T09:30:54.839933Z","submitted_at":"2025-07-12T02:28:42Z","title":"Mind the Gap: Preserving and Compensating for the Modality Gap in CLIP-Based Continual Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:17.391053Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2507.09118"},"observation_digest":"sha256:c2767dc341058e63188731cc741e7775ca3e8d427f1742d9432ce9a65ace92d0","observation_id":"f64889f6-b20e-45ba-98ec-b6bcaf0766dd","resolution":{"observed_at":"2026-08-06T18:09:17.391053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":"2502.04263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-06-29T14:13:29.951494Z","title":"Bagdanov","venue":null,"work_id":"328cc654-01a4-4416-af70-3d2c59c4f4f9","year":2025},"citing_paper":{"arxiv_id":"2605.18193","last_updated":"2026-05-18T10:32:48Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:32:48Z","title":"Best Segmentation Buddies for Image-Shape Correspondence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T11:10:29.360224Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2605.18193"},"observation_digest":"sha256:6c0484f930a4362283344d0583c9535d93a6d3f638300b11424d12ea6e905c98","observation_id":"9528a14c-23ee-49b2-b3de-e52fd5152860","resolution":{"observed_at":"2026-05-20T11:13:13.515460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":"2502.04263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-06-29T14:13:29.951494Z","title":"Bagdanov","venue":null,"work_id":"328cc654-01a4-4416-af70-3d2c59c4f4f9","year":2025},"citing_paper":{"arxiv_id":"2606.11221","last_updated":"2026-05-27T03:48:10Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-05-27T03:48:10Z","title":"LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T14:12:23.837961Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2606.11221"},"observation_digest":"sha256:6db9a90b7879deb670d26761a23df8f1f064ede90347e1afec7fe5ec8bcc2459","observation_id":"963adb28-36cf-4c0d-894e-b1dc113a3e37","resolution":{"observed_at":"2026-06-29T14:13:29.953305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04263/citation-record","integrity":"/paper/2502.04263/integrity","json":"/paper/2502.04263/citation-record.json","paper":"/paper/2502.04263"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.158867Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.158867Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:5746d78dabe246d8a69670a9bd5998f1e5155863390b35271e1ecd8a926ef7da","observation_id":"8e67da87-1f65-4a36-9c84-2ed7d83ab3bc","resolution":{"observed_at":"2026-08-08T23:05:28.158867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02951","last_updated":"2025-07-26T10:50:24Z","snapshot_observed_at":"2026-07-06T18:09:59.472962Z","submitted_at":"2024-05-05T14:39:06Z","title":"iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02951","snapshot_observed_at":"2026-08-08T23:05:28.164106Z","title":"iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.164106Z"},"links":{"cited_paper":"/paper/2405.02951","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:97dbceb0c0d6c7b01975796967801842d51112cccc87c29c2e6c8ea49f4e33ab","observation_id":"df186c1b-5f45-42da-ae80-8a73e10a113e","resolution":{"observed_at":"2026-08-08T23:05:28.164106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.799208Z","title":"nocaps: novel object captioning at scale","venue":null,"work_id":"d3ed0f3c-3892-4536-854e-c21b22897897","year":2019},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.168444Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:0d420736d00339aca49e416abbf478a1fb8ed1f38a0dbbb4f18b817956f85bfe","observation_id":"6a124118-1d9a-4700-8267-fe7b4076ded6","resolution":{"observed_at":"2026-08-08T23:05:31.802665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.789137Z","title":"Zero-Shot Composed Image Retrieval with Textual Inversion","venue":null,"work_id":"79e32c27-1c67-43aa-a105-76789707a0f3","year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.172838Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:e19c2993b61070211662d3563dad2f84e0c8b01f3a1fd5d12feb2583c67c4446","observation_id":"2b8ea1ac-88fe-458b-a1f0-5357f4f48c1e","resolution":{"observed_at":"2026-08-08T23:05:31.792661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.778856Z","title":"Food-101--mining discriminative components with random forests","venue":null,"work_id":"a2df82e0-ccf5-4411-b27d-8ec62c21e611","year":2014},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.176227Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:7d4934d9322a4ed6f7b1a64bc04f70d49eed3a845d4635ed7cdd6fd0b549900a","observation_id":"e24f9d0c-9719-4aea-bc9e-27794b8a251a","resolution":{"observed_at":"2026-08-08T23:05:31.782507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.179775Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.179775Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:46c62a2f8cfaa32458e82df728529f0b73b5beb066d7fdc6e7302d7ba376f458","observation_id":"ff880db6-7a66-46f4-bf95-40dda6bfbad5","resolution":{"observed_at":"2026-08-08T23:05:28.179775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.183453Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.183453Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:7d5c9446d0e71ebe297bb459dbe8f4d35450bb2b4b0fb96d6c8a76e6e2f1e2ed","observation_id":"320cc0d9-1416-4192-bc80-9746e1222e7d","resolution":{"observed_at":"2026-08-08T23:05:28.183453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.187018Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.187018Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:e51a6c68f0bdd0a2a8fa847dbe30673065c7ff4c5e2f607c73728b9c834c1df3","observation_id":"b34db35c-6e3d-4e2c-887f-31bb92027d55","resolution":{"observed_at":"2026-08-08T23:05:28.187018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.190767Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.190767Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:9bf783a9d66e02e2fb91547b7cba70ef1e9e441684b87f39644c029c7d211b17","observation_id":"f4ebc51a-6dc0-4995-9654-972d35bd0975","resolution":{"observed_at":"2026-08-08T23:05:28.190767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T23:05:28.194653Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.194653Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:b75718435766de56d78f5f7b2ac1a0a8d5e384c780d0d64e78dd9a0aa775371a","observation_id":"4d93ccfe-64ce-41ec-ab1a-36897b528558","resolution":{"observed_at":"2026-08-08T23:05:28.194653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.745246Z","title":"Asirra: a captcha that exploits interest-aligned manual image categorization","venue":null,"work_id":"e18f7de0-2d58-41d5-b4d3-2d0506586065","year":2007},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.198269Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:1c069290d426524d35b759b098d8c6e22b101f285e9451272b3d9b3801184076","observation_id":"b092ac40-efb0-402d-93e4-5b1ee8646544","resolution":{"observed_at":"2026-08-08T23:05:31.748820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.201903Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.201903Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:8f894009bf6b8a2e8309dd77820690d1433d24082046ece0cf52e30c8630aa5c","observation_id":"f16a91e5-fbf0-4781-a47f-eeae517f014e","resolution":{"observed_at":"2026-08-08T23:05:28.201903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.205084Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.205084Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:e2329ff5f02eac6831d95f697b8d525d294f6cb40cedc44a18672a4a39f6dfde","observation_id":"d639af3c-d7a2-4186-a0a7-ab65a62c1bf1","resolution":{"observed_at":"2026-08-08T23:05:28.205084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.208342Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.208342Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:775bce478b8ac3b24aa0cf15044c749464e74cc89b67ce642f3bad66964ec447","observation_id":"8fe38a14-23d5-424a-ba2d-e2223f2e2a5d","resolution":{"observed_at":"2026-08-08T23:05:28.208342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-08T23:05:28.211690Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.211690Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:f987d996d3e65d362dbcd395e39b57359080238d25517598927850e9737523cf","observation_id":"ad8985fd-34e1-4311-8b00-0f681239b6b8","resolution":{"observed_at":"2026-08-08T23:05:28.211690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08172","last_updated":"2025-08-13T13:35:19Z","snapshot_observed_at":"2026-07-06T19:01:06.124684Z","submitted_at":"2024-08-15T14:19:13Z","title":"Towards flexible perception with visual memory","version":3},"cited_work":{"arxiv_id":"2408.08172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08172","snapshot_observed_at":"2026-08-08T23:05:31.388381Z","title":"Towards flexible perception with visual memory","venue":"cs.CV","work_id":"fe016a90-019a-417e-b5d9-3ccdb220758b","year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.215151Z"},"links":{"cited_paper":"/paper/2408.08172","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:f64744ed93c3b0e025d29cbe6f46874a3d9dce793e61352bb396a6159026b175","observation_id":"63a55951-2600-47fd-b55b-351820567691","resolution":{"observed_at":"2026-08-08T23:05:31.393813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.218897Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.218897Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:8f22b53788b4f07169f8c740b48d588b89e75a5b90de6755433dbd453496fb4d","observation_id":"38e593f4-eeec-400b-a8f8-6acc321ef0dc","resolution":{"observed_at":"2026-08-08T23:05:28.218897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.222020Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.222020Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:b55de9e58678a52b7d78f4135b3cdea9df1cd91c2dfa508b6ebcccec1fceef83","observation_id":"cedcd4ea-f5da-4c1e-86ab-a417dec8c4b9","resolution":{"observed_at":"2026-08-08T23:05:28.222020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.225249Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.225249Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:77615aa77e93f64952883ff0dacf548ccf2bd492fcccc3109e3fcded340cb905","observation_id":"6e08ae28-74fa-4ae2-ad32-1a8c14e0cbd5","resolution":{"observed_at":"2026-08-08T23:05:28.225249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.228575Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.228575Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:d279fdba4a419a9ad2eadb760311119d001b6d4a4e38932f03d4d6256fa24995","observation_id":"d2b1de36-b920-436e-b296-197dd7e96096","resolution":{"observed_at":"2026-08-08T23:05:28.228575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.231717Z","title":"Newsweeder: Learning to filter netnews","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.231717Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:11584e86c634b7ea7982e3e1ed420d5a9f8230ecb1d5718b08688beb2a86ed6c","observation_id":"25920617-61a7-448d-bf15-b68c9858cfac","resolution":{"observed_at":"2026-08-08T23:05:28.231717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03032","last_updated":"2023-03-06T11:02:47Z","snapshot_observed_at":"2026-08-05T10:22:16.844750Z","submitted_at":"2023-03-06T11:02:47Z","title":"DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03032","snapshot_observed_at":"2026-08-08T23:05:28.234921Z","title":"Decap: Decoding CLIP latents for zero-shot captioning via text-only training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.234921Z"},"links":{"cited_paper":"/paper/2303.03032","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:edaa5a92e5532675bd6bc17c0102adcbd0cf9f7e923ce0bfa30a0c4a0f10c329","observation_id":"6a1cca45-c804-4898-b714-2d95db06f8fb","resolution":{"observed_at":"2026-08-08T23:05:28.234921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-07T07:07:45.501871Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-08T23:05:28.238464Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.238464Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:d1de3e942034873af43b6e7d9c9316a44ccb74bf94c32543f7ca4226610ab846","observation_id":"7eaf461c-ec4e-4ac5-bf04-695ec715f0a5","resolution":{"observed_at":"2026-08-08T23:05:28.238464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.686717Z","title":"Mind the Gap: Understanding the Modality Gap in Multi-Modal Contrastive Representation Learning","venue":null,"work_id":"90fe3acd-e507-4b05-a1e6-362e4baa25cf","year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.242157Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:cd8daa5db8620498d2b130ffb0c05704e400e4d3730cbfa04b19065f3d3ac7c6","observation_id":"dcffd5eb-efe3-4146-b392-479e4d08bcbe","resolution":{"observed_at":"2026-08-08T23:05:31.690268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.245374Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.245374Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:c02d960fed15472d1e91bcf466630b4b41a882a6cf80f4f145b0ad087fb80207","observation_id":"666c1b54-5e94-4533-8dc4-f61fa7837b40","resolution":{"observed_at":"2026-08-08T23:05:28.245374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.248562Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.248562Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:1cd1a677494fee3d7ef1525c8d5fda509b330c1755af618f4d8f890af1d8adbb","observation_id":"6f157b15-ef77-420f-8058-d6bb58d629d3","resolution":{"observed_at":"2026-08-08T23:05:28.248562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.251727Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.251727Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:b122ab3665eae82f3422c4b9a9298abbf8b5338e842d612e5aa8cefd75f62f69","observation_id":"c4a5a5ad-23f6-4684-9168-b3a6e7bac4a8","resolution":{"observed_at":"2026-08-08T23:05:28.251727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.658604Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"b77ddcd7-35e3-4642-a967-30d8c04a7247","year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.255108Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:12bf7f2c4a89d3b325f872d3c1f7b932b482449bac7a76405625263d1769ef64","observation_id":"93e0a649-9035-4687-808c-41c3eed86e4d","resolution":{"observed_at":"2026-08-08T23:05:31.662166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.258345Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.258345Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:90577f4c8f6fb6ff4ebee201a8eefa6b6cab6d541414d19f7002b12fe9bfddc2","observation_id":"5d68d289-afc7-4060-af7d-2faaa7000cb5","resolution":{"observed_at":"2026-08-08T23:05:28.258345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-08T23:05:28.261742Z","title":"Fine-grained visual classification of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.261742Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:8d0e3b8f2a466b8617ea8135be565511e65cb77084cff6c411399c401343526b","observation_id":"52dd46dc-1bfa-4692-aa54-33ba31143ca7","resolution":{"observed_at":"2026-08-08T23:05:28.261742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.642139Z","title":"Slip: Self-supervision meets language-image pre-training","venue":null,"work_id":"b76a0a7f-0dc9-4868-bb76-3d87aaa66558","year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.265463Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:8681430211b792b3ac25680fba64df3f3e61811d3dbc050928f9fdcdec8c7560","observation_id":"ad756d82-f0fa-4950-8361-5aa369639e19","resolution":{"observed_at":"2026-08-08T23:05:31.645695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.268889Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.268889Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:07ede950361a51707e3298278b2357a1342acd1c04f4e44aee6b1b9a1d80456a","observation_id":"30629513-27b0-4a96-a759-3b43540c0eb0","resolution":{"observed_at":"2026-08-08T23:05:28.268889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.625061Z","title":"Deep metric learning via lifted structured feature embedding","venue":null,"work_id":"700c4b91-2f72-476a-a771-a19b46fed5cf","year":2016},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.272247Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:cea9ab443a7d05985ea2e6353d3a373fb5b8b75f187ab4ebfeb65db66a02b447","observation_id":"b433afe8-3ce4-4f3a-a751-116285151618","resolution":{"observed_at":"2026-08-08T23:05:31.628790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.614579Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"96a18c66-ec45-43b4-85b0-2b89a5912dc7","year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.275652Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:952a7ff4c01d5260f09fe7721e8ece5d0d37fb77596ab8a49688eef066a8a15a","observation_id":"9cd5f98e-8640-4594-a7a9-b3b55ac0fb10","resolution":{"observed_at":"2026-08-08T23:05:31.618213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.278965Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.278965Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:82edf274ee261760de74fdc58b9aebb5b5f56d582b5760c5929290a0295e5c94","observation_id":"43f0499c-47ad-4c36-973b-d9908769a5c9","resolution":{"observed_at":"2026-08-08T23:05:28.278965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.598305Z","title":"Eclipse: A resource-efficient text-to-image prior for image generations","venue":null,"work_id":"d45e8bf9-a35d-4914-8015-6244beb1d4d5","year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.282437Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:e6e62864cb905781ffdeb45d79e73f076dba195b4708b520fa67ea64c8cb1eaa","observation_id":"b8336ba0-9c42-49cc-92d2-75f4c91b39d7","resolution":{"observed_at":"2026-08-08T23:05:31.601859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.285695Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.285695Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:7ab2dc26155269d130704d14b4530247b9767ac0bc9cc38319e50b1335179af5","observation_id":"1d5606bf-8a1d-4a78-8014-a40faae32aa0","resolution":{"observed_at":"2026-08-08T23:05:28.285695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.581492Z","title":"Revisiting oxford and paris: Large-scale image retrieval benchmarking","venue":null,"work_id":"48cba0ba-e969-4cdc-8f9d-4b8462817d81","year":2018},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.288917Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:eb70cab593c841d66ac24102a2bfee00616493b7b9a1e4b4c10685a2a5bc366b","observation_id":"e71decce-b0da-4846-bd81-5920527175a3","resolution":{"observed_at":"2026-08-08T23:05:31.585707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.570934Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"77c82e17-6310-4eb1-83a4-93105f11558b","year":2021},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.292099Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:45168f8f618c551f3ce422a1dd8193b790052566a9c2cf8d3731cd907240e08d","observation_id":"2d8504b3-ee9d-4792-8b83-9c299a793a3f","resolution":{"observed_at":"2026-08-08T23:05:31.574565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-08T23:05:28.295365Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.295365Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:601c2ac500aeec0bf3a5ffe094675dc9e3c8da02cae043b38c9695043de2ac83","observation_id":"aea494b7-c64a-473e-a9f6-36c9950c2d25","resolution":{"observed_at":"2026-08-08T23:05:28.295365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.298693Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.298693Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:70052037adabc2bd232218186e447dc17271d50b7c9d4a771774de8380c7ca96","observation_id":"a2a37b1b-bd28-48f8-b7ac-0a1f0cd53173","resolution":{"observed_at":"2026-08-08T23:05:28.298693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-07-06T17:59:00.124173Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-08-08T23:05:28.302016Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Representation Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.302016Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:ed0d323969f56d798cb0756eb00fc1116fdb81c8bfd0ff0bf57d5eaf5cd7123a","observation_id":"1ef2bc42-8645-4506-9f70-e9690e01dfe7","resolution":{"observed_at":"2026-08-08T23:05:28.302016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.305486Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.305486Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:a299aac34c951ea42db9f16153ea25edc69eb0a39d4883b0519d879c39aed663","observation_id":"12435e46-267e-49ac-9880-830c2f685cb7","resolution":{"observed_at":"2026-08-08T23:05:28.305486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.309008Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.309008Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:786b7b6554fe5f01806ce5153a63233241eade9e132d17b15894f253cb16194e","observation_id":"14bfbac4-28ab-479e-bb57-685723b527d1","resolution":{"observed_at":"2026-08-08T23:05:28.309008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.541770Z","title":"Towards Understanding the Modality Gap in CLIP","venue":null,"work_id":"0b3926e8-868a-40f6-abde-e41a61989247","year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.312316Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:a5b2c95fb08f0b8acde16f011f9ff9683bbec3fc9113398e2e56dfa55cdacbc5","observation_id":"b6c45df0-393b-405a-8615-fafd2d6bacd6","resolution":{"observed_at":"2026-08-08T23:05:31.545840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.530647Z","title":"Improved deep metric learning with multi-class n-pair loss objective","venue":null,"work_id":"c24bb2d1-0338-4848-8640-717d95bad0c2","year":2016},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.315355Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:c468d2f11c700751f9352c17142c5eb51a27de6d9773dd81d4e5508d7973d625","observation_id":"07ff24e2-ce6f-499d-ba4c-4df030201343","resolution":{"observed_at":"2026-08-08T23:05:31.534046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07190","last_updated":"2022-03-14T15:29:27Z","snapshot_observed_at":"2026-08-07T08:00:26.953532Z","submitted_at":"2022-03-14T15:29:27Z","title":"CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07190","snapshot_observed_at":"2026-08-08T23:05:28.318675Z","title":"Clip models are few-shot learners: Empirical studies on vqa and visual entailment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.318675Z"},"links":{"cited_paper":"/paper/2203.07190","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:32abee9f6e33951279b571e84062635e8b8ff5129a28f690d1542f2d8e6dfb8f","observation_id":"adad59bb-9f9f-406c-9c95-8386147827c9","resolution":{"observed_at":"2026-08-08T23:05:28.318675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-08T23:05:28.322291Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.322291Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:4533675ed2c6926647dbd7f3498f3347fa4758745a4a0ccaa07acf106718a851","observation_id":"edbcfd55-15c3-4edb-b6ed-461eb7da6929","resolution":{"observed_at":"2026-08-08T23:05:28.322291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.520800Z","title":"SuS-X: Training-Free Name-Only Transfer of Vision-Language Models","venue":null,"work_id":"e2d32a8d-b597-4f22-a64e-36dae7e33457","year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.325835Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:754aed79fc2cd1222aa8ddf9706b1d0ab988739c07b099268f8102cc06408f82","observation_id":"fac08640-37ec-48d0-b3ff-5667bca5d0d8","resolution":{"observed_at":"2026-08-08T23:05:31.524274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.329093Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.329093Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:7c63e0a9023b971355fc2e9aaa476954b168dac16e7883d553ff8facd760e04d","observation_id":"5efc861e-25af-419d-b972-9ab6a20fc525","resolution":{"observed_at":"2026-08-08T23:05:28.329093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.504489Z","title":"Leveraging Cross-Modal Neighbor Representation for Improved CLIP Classification","venue":null,"work_id":"c74dd0f5-12fa-44e7-b3a8-bce37d4d4cc3","year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.332228Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:5193b61b00b252e72e935417c3323ac54357e744eb630c1fa0bb226bb6587c97","observation_id":"53627af5-6126-4204-a195-5dbaf1e5e96b","resolution":{"observed_at":"2026-08-08T23:05:31.508001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.494515Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"7cf31750-042d-4994-a8b1-31a92d784cd2","year":null},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.335778Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:992264dda27b955b97e8107cdca7f7b887f16c7c533aac70effcb02ee1841e36","observation_id":"11fbbb18-74b0-4e16-a09f-43f52b2f9afd","resolution":{"observed_at":"2026-08-08T23:05:31.497851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.484394Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"d730ffa3-09fb-4f9a-bb77-c219c08b08f4","year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.339318Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:35c27fa5e3c6f44fb185ebcfb549d94e39188cfbb8b55e92bd58ed060a80cb9b","observation_id":"692e86c5-9045-40d1-9ca3-544cc62727a8","resolution":{"observed_at":"2026-08-08T23:05:31.487903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.342500Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.342500Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:d058a22baef5045ca4567445c17f374e341183136d8dd9d6f7de5068a0cab16a","observation_id":"dc84c6d1-b7e2-415e-8467-e0ebbee1d78a","resolution":{"observed_at":"2026-08-08T23:05:28.342500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.468199Z","title":"Diagnosing and Rectifying Vision Models using Language","venue":null,"work_id":"f33908d3-2baa-4736-a2f0-54ff387049c0","year":2023},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.345739Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:344be9f16bbd5322f915100d09a4bc3d9cb8f0708aacceede16cf86f38c7a151","observation_id":"64c93fef-c480-4d13-886b-c78aefefe651","resolution":{"observed_at":"2026-08-08T23:05:31.471591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.457594Z","title":"Avid: Any-length video inpainting with diffusion model","venue":null,"work_id":"ba102381-1912-4aca-8c87-b91a8d2997fa","year":2024},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.348990Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:d487c93fba586d19a313a1961928164a8ad552023aae0b16f41988d0467312d5","observation_id":"18179f04-a4c0-4af9-925e-1a51f971e059","resolution":{"observed_at":"2026-08-08T23:05:31.461236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:31.447352Z","title":"Extract free dense labels from clip","venue":null,"work_id":"63c2ead8-f69c-49e3-b91b-19ba7cd9b3e5","year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.352254Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:2ce48682cb51d683229a2edc0dc8b8c2018584cd3606dc38f72e02cc66ca5103","observation_id":"5538da71-045c-4d56-bdb5-3b5ca66cb48f","resolution":{"observed_at":"2026-08-08T23:05:31.451094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.355537Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.355537Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:8613ec7dabffa847a1f5ff8dc0e9e46f04040fb9c84306d9d6dffd568247b3b3","observation_id":"7847be78-e3e5-45a1-b39d-08130c794dbb","resolution":{"observed_at":"2026-08-08T23:05:28.355537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.358826Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.358826Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:01643e44cf21230e0cc82c689b02067d29207c4c6bfaba3f8d29b80b9cc46957","observation_id":"cbbb8424-0553-484c-b80a-48770af66919","resolution":{"observed_at":"2026-08-08T23:05:28.358826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.362890Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.362890Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:802e88720e138aedcd1c584739eca0a9280f10a17305210051ff25480b40ef1b","observation_id":"2965186f-a05c-4125-a819-6c8c989c558c","resolution":{"observed_at":"2026-08-08T23:05:28.362890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:05:28.366500Z","title":"a photo of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T23:05:28.366500Z"},"links":{"citing_paper":"/paper/2502.04263"},"observation_digest":"sha256:e8eddaed6c10071735691b6fa9e51f8bd1e72aca836b978c3e06a725da59b325","observation_id":"647fabc1-5e1a-4907-aeef-00cde2700bf4","resolution":{"observed_at":"2026-08-08T23:05:28.366500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 5 inbound Pith citation observations for arXiv:2502.04263."}