{"as_of":"2026-08-20T02:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92d11d2ed5cfe8ce92b04bcdd996d673c8bcb20addffc70c247222801b7412a8","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:34:17.989815Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:33:52.023170Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06934","snapshot_observed_at":"2026-08-02T04:33:52.023170Z","title":"Usha Bhalla, Alex Oesterling, Suraj Srinivas, Flavio P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13660","last_updated":"2026-07-15T10:05:53Z","snapshot_observed_at":"2026-08-16T05:33:21.550232Z","submitted_at":"2026-07-15T10:05:53Z","title":"The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T04:33:52.023170Z"},"links":{"cited_paper":"/paper/2505.06934","citing_paper":"/paper/2607.13660"},"observation_digest":"sha256:0343b9344b752a01e1a5035a566b770a16b9189dc7dc84d67f872d3a15ffedca","observation_id":"226be0c5-61ab-4daa-b173-81220b474c88","resolution":{"observed_at":"2026-08-02T04:33:52.023170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.06934/citation-record","integrity":"/paper/2505.06934/integrity","json":"/paper/2505.06934/citation-record.json","paper":"/paper/2505.06934"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.760069Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.760069Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:e0c07620213f3c6c8b2b35f1cdaa30bbf113081057464f1e44abfb522b4ef4c6","observation_id":"2c0a9458-6fd5-4bac-abc7-d1a9a2599875","resolution":{"observed_at":"2026-08-15T22:34:17.760069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.664316Z","title":null,"venue":null,"work_id":"378c9846-8c68-4737-827e-dfb3b818d79e","year":1954},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.766090Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:60e4e6d39451b36bda810cb19694bac066a7d5e153c16fb9df5547dd5d421fdc","observation_id":"a4b813f8-5e53-43c0-ac1e-05a49490177e","resolution":{"observed_at":"2026-08-15T22:34:18.668868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.770494Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.770494Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:7c26c1fa805063a756c4b157450d171d5975672d2a2b60d271fa3f8438f871da","observation_id":"54b2d11d-d947-478e-8412-9d9b12a5b47b","resolution":{"observed_at":"2026-08-15T22:34:17.770494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.642056Z","title":"Gpt-neo: Large scale autoregressive language modeling with mesh-tensorflow","venue":null,"work_id":"422817b5-bfb0-4414-b6ea-015dd80f4b07","year":2021},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.775094Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:3d1aabdbc09b6c196c8c854422417de95383367226e340f66155766428581539","observation_id":"ea6f08c5-ee87-47f3-97ce-e7112aadee00","resolution":{"observed_at":"2026-08-15T22:34:18.646646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.779567Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.779567Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:939e034a5c568b831eee39f2142dffa006bd5e152eb8da18981a4a24ac443d88","observation_id":"680aab0f-6343-419b-930b-d02e51facaf5","resolution":{"observed_at":"2026-08-15T22:34:17.779567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18068","last_updated":"2024-11-18T15:43:58Z","snapshot_observed_at":"2026-08-16T14:14:40.092348Z","submitted_at":"2024-02-28T05:54:02Z","title":"SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18068","snapshot_observed_at":"2026-08-15T22:34:17.784054Z","title":"Synartifact: Classifying and alleviating artifacts in synthetic images via vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.784054Z"},"links":{"cited_paper":"/paper/2402.18068","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:695c13d51687413715937fb18e9e5660a4e608c649d8319dab0a7f5b54d025df","observation_id":"f67cf553-fe3d-4544-89bf-bf87548cc2fd","resolution":{"observed_at":"2026-08-15T22:34:17.784054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13079","last_updated":"2024-09-19T20:34:22Z","snapshot_observed_at":"2026-08-18T22:13:48.239787Z","submitted_at":"2024-09-19T20:34:22Z","title":"Embedding Geometries of Contrastive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13079","snapshot_observed_at":"2026-08-15T22:34:17.788814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.788814Z"},"links":{"cited_paper":"/paper/2409.13079","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:b13a67648b54736d12a812dd43ce109a65cd3728c9459f6e1e970845f803b1e4","observation_id":"ce7e5ed2-8b7d-4423-b7b6-c0682a596237","resolution":{"observed_at":"2026-08-15T22:34:17.788814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.618611Z","title":"and Pearson, E","venue":null,"work_id":"f73c33bb-b713-43a8-a893-74a41cefdb1f","year":1973},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.793707Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:76e3046c4412e24f839f4cbee104634b5782db630853c26007958c04b3402336","observation_id":"7755000a-6667-432e-b6b8-2aacbda7dd50","resolution":{"observed_at":"2026-08-15T22:34:18.623525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.797797Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.797797Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:328416bccf19794bfc7adf384e75e72ca927c8265f861b012df4a4bbd706155a","observation_id":"18353692-d61f-428e-a370-f2ca0ab3b496","resolution":{"observed_at":"2026-08-15T22:34:17.797797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.801835Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.801835Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:b648cba9cd3e74b50e654d94ce853e3caeaf38561e7f9ce7fca695f914f9a85a","observation_id":"f192eb3c-8ce5-4f25-85d0-7a23547ef6cd","resolution":{"observed_at":"2026-08-15T22:34:17.801835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T22:34:17.806775Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.806775Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:f12b5d0726866888635dc6bee124615a4354d0193661849a782f8f105eae1086","observation_id":"6afccaf3-c37e-46e7-9f43-77024692cc09","resolution":{"observed_at":"2026-08-15T22:34:17.806775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.811461Z","title":"and Mordatch, I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.811461Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:90805f8e806a965e8aeea65788e16975cddaee9b6adbc85be60827f8b052b7bc","observation_id":"f96faba4-68a2-47c8-bb43-5ead3ba30dd6","resolution":{"observed_at":"2026-08-15T22:34:17.811461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.578670Z","title":"Image inpainting: A review","venue":null,"work_id":"1f2e64d3-b02b-4312-8e7d-fb7f5c60ea8f","year":2007},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.815634Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:44461b3a1e0b7b4f5cbe49ddf04406b0e12e6c3e68cca23f1df5384dfbdc05e3","observation_id":"cd193a06-7451-413c-b6a3-d1eaff471d0a","resolution":{"observed_at":"2026-08-15T22:34:18.583123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.565484Z","title":"Implicit diffusion models for continuous super-resolution","venue":null,"work_id":"a7dde262-04da-4ffd-9189-083540a35c2d","year":2023},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.819831Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:6335bd942703990ec7247305940c6749d135ce4b8b1b71d632bc6afaf968696f","observation_id":"6e5ff08b-9b4e-4815-8536-767a0daf467c","resolution":{"observed_at":"2026-08-15T22:34:18.569723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.552277Z","title":"and Geman, D","venue":null,"work_id":"211d699c-9821-4675-a3ca-083a1264adcf","year":1984},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.823834Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:ff366847890d3743753c6467e41f8917923a7cfa1a34afe4066d1dbb1a3777ef","observation_id":"aca585c2-f6fb-400e-a4c7-4ae1e4c64082","resolution":{"observed_at":"2026-08-15T22:34:18.556530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.828111Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.828111Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:d596538f217f90c3814a5328a2f6ce4097e6042534abd98a0517a11899239496","observation_id":"fc693052-84d2-405c-af02-a5ff64858394","resolution":{"observed_at":"2026-08-15T22:34:17.828111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.832224Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.832224Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:9cb854c8f39b4394706592a713383177e2a0d3543977828ac77103b88ccd2b0a","observation_id":"560ac1a3-63bf-471e-81f1-9e4f2f05efd1","resolution":{"observed_at":"2026-08-15T22:34:17.832224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.520864Z","title":"S., and Sharma, A","venue":null,"work_id":"69b2ce08-c9c3-4d43-9593-efdf0c7895f4","year":2020},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.836344Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:907dc4e76de0a6fb1158fc1f1274b08d392d7238584173b3adbc6b34a9df674a","observation_id":"7d5b9084-9af7-4d5f-a427-81c1d8eb6c12","resolution":{"observed_at":"2026-08-15T22:34:18.525395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.506715Z","title":null,"venue":null,"work_id":"38ba1889-519f-4fb4-84fb-4cdbefe349e3","year":1984},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.840509Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:7e36d7192eb63125349cfbaf85ecdfea09393bc8dc2bacf3b131dd87e2adbdf0","observation_id":"1a9db6ca-e910-4b26-81dd-c0c091fb8eb4","resolution":{"observed_at":"2026-08-15T22:34:18.511523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-15T22:34:17.844828Z","title":"and Dietterich, T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.844828Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:fba5e206ffa5fd3b4c120b8bd69194b5f01d610a3060afc25375d3095579e8d3","observation_id":"6b18316f-cdd3-4557-8c44-977467a32a21","resolution":{"observed_at":"2026-08-15T22:34:17.844828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.849275Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.849275Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:8cfff3d6f18186a844dad15ca3dcb2272c569021b9b80d80b855c0c494be1deb","observation_id":"d8704306-bec2-43b4-ba68-2596e4cacd74","resolution":{"observed_at":"2026-08-15T22:34:17.849275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.853608Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.853608Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:8b42ea903a14aed6ddd1cc7fb917d9197da38d3e722a3dec652d67ec00f57587","observation_id":"3d9ec8c7-66dc-40ed-8688-f95b0db6fc0b","resolution":{"observed_at":"2026-08-15T22:34:17.853608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.857878Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.857878Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:c23d849782b171085886b5df6127e7024c0543c9e5be31d1ae72953f2b9b147c","observation_id":"07b6ed78-91c8-4eed-b42f-20fa1c610971","resolution":{"observed_at":"2026-08-15T22:34:17.857878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.862349Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.862349Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:f3c39de3e9eb78d3fc6751d30297bc3bae2088f6a18e0549f184b2567c84ab7e","observation_id":"e3e06eca-aeef-4a38-a0a3-ee0493c39ffb","resolution":{"observed_at":"2026-08-15T22:34:17.862349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.456300Z","title":"Framing image description as a ranking task: Data, models and evaluation metrics","venue":null,"work_id":"0a5bd510-966c-4e3f-a839-23294bd6a9cf","year":2013},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.866458Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:a24e65003ebf2f0bd8d3add09130ffc046e0641012d334f84c5c7bda1bfd22e2","observation_id":"e7dd160f-057c-464b-b136-c5e137cee452","resolution":{"observed_at":"2026-08-15T22:34:18.461604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.441800Z","title":"Imagenet object localization challenge","venue":null,"work_id":"a6978b44-e4f1-41fb-95a4-5488cf93171f","year":2018},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.870482Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:8aba434df69594de86f8e6a9273ff70f7c1e65db84d7b296d6e770c461bc24e3","observation_id":"9c13272a-8818-4efd-8b4f-ff1f4b2ec19a","resolution":{"observed_at":"2026-08-15T22:34:18.446213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.426883Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"f93338a6-4047-4cb6-bea3-a4510d897639","year":2023},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.874620Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:7cb7f04f5a39b6620e9cbb8e7c5c9df0e1570d66e42c889ea30f717196b7a612","observation_id":"8d0b33fd-4213-4223-a520-c67886b5b9dc","resolution":{"observed_at":"2026-08-15T22:34:18.432254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-15T22:34:17.879077Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.879077Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:677818ddd4d1e67161f537c04f059abb6d854ddab49cf7b87b50dd452b91f8a5","observation_id":"5688792c-a31b-4288-bdf5-ed46dd52ed86","resolution":{"observed_at":"2026-08-15T22:34:17.879077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.412758Z","title":null,"venue":null,"work_id":"492f20fd-4933-46b7-92b4-dbcd992343ef","year":2025},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.883536Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:5ad2b4c224a91507e7740695a97fdbb652836c07b30f420211a7def81372e18b","observation_id":"fb59f236-63b2-4003-9f68-5cb584be46ea","resolution":{"observed_at":"2026-08-15T22:34:18.416764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14848","last_updated":"2024-07-10T17:01:37Z","snapshot_observed_at":"2026-08-19T18:33:09.856329Z","submitted_at":"2024-02-19T16:04:53Z","title":"Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14848","snapshot_observed_at":"2026-08-15T22:34:17.887626Z","title":"Same task, more tokens: the impact of input length on the reasoning performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.887626Z"},"links":{"cited_paper":"/paper/2402.14848","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:e7a79825bbaa5bd811d4b16115fc9c261363b97c9ac59d7b985f6f2346c7f043","observation_id":"c0c165a8-37ad-4168-a80c-a69032595ad7","resolution":{"observed_at":"2026-08-15T22:34:17.887626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.399225Z","title":"Srdiff: Single image super-resolution with diffusion probabilistic models","venue":null,"work_id":"3beb9a59-55d1-47ab-8e31-1d50cb4e29bf","year":2022},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.892310Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:9c73444df984b181edf66ee6db5ee1c104b5d5112094455d0eb2391810c3764a","observation_id":"350c3c54-55e9-4cfd-b6ad-94b5b668a6bc","resolution":{"observed_at":"2026-08-15T22:34:18.403618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.385538Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"29382ed0-199f-45a7-9585-532c733c639a","year":2022},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.896526Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:ad63192d0274f5aa7d14247d925ee6edba08cb22d065bbaadd9c319cd1a5e2fd","observation_id":"16772991-f2f9-487d-80b1-7787f2979754","resolution":{"observed_at":"2026-08-15T22:34:18.390375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.900595Z","title":"W., Zhang, Y., Kwon, Y., Yeung, S., and Zou, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.900595Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:0de7e8ce03dcdd4d72b5762b5a32e3b617542ce2f190c125792a2dd19d0f2e50","observation_id":"4cba8a6e-3137-4377-b17e-f01f40674e1b","resolution":{"observed_at":"2026-08-15T22:34:17.900595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.904703Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.904703Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:bdda571a0bf2bc98c9441e5d8e2f8a1fe9a6658ea42849d5392a4220200a6865","observation_id":"9900049e-fa98-4287-a9e7-e0eceab27d77","resolution":{"observed_at":"2026-08-15T22:34:17.904703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.354776Z","title":"and Jupp, P","venue":null,"work_id":"d2728277-916d-4628-bb62-76c145993fca","year":2000},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.909213Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:cdebcd4d0fad74beb6246789209d4f543979032f1e9adc3eadfef65b3d4a8e70","observation_id":"9850e2d5-7c59-40ee-9eb1-5bb5e4e3ff9d","resolution":{"observed_at":"2026-08-15T22:34:18.358944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-15T22:34:17.913659Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.913659Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:98d1d2c9cc5271d6e28a522e3b553a61e86f6f91e5d7062ec6a206fd150208b2","observation_id":"362b6fea-76fb-4356-b452-c770e2ea845b","resolution":{"observed_at":"2026-08-15T22:34:17.913659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.918107Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.918107Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:4fc31a9d8dc2a5257d9daa012dade4a801a80f31145d4cbd632a9f44849ada4a","observation_id":"0b06aba7-dc9a-4494-8936-36179e5ec7f2","resolution":{"observed_at":"2026-08-15T22:34:17.918107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.332112Z","title":null,"venue":null,"work_id":"99534a63-90cc-464a-b6df-c16c399aeed7","year":2024},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.922135Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:7567cee97c336c97afd9c04530810cfc5f62c6d69a1bccd81a5fefa293d6aeb8","observation_id":"f9829d71-7a3e-487e-ae6b-9f198f20072a","resolution":{"observed_at":"2026-08-15T22:34:18.336693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.317302Z","title":"Concentration of mass on convex bodies","venue":null,"work_id":"ce42ff56-f66a-4f93-8388-1e2db9c0718c","year":2006},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.926213Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:4f84627ab5b2c75ce128d54f4d600addb3cf1d6a34318eaa58f233f0a80b4c80","observation_id":"b3717184-e9c4-46ab-bde7-9ced7a08c4ca","resolution":{"observed_at":"2026-08-15T22:34:18.321787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.303255Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"91e2eade-5eb5-4c78-a510-c2fc805d8c76","year":2019},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.930447Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:4745e5ab91fcd491d5b0fc4507c5d90ceb05f98aa943e712e57bc3e0f89612b5","observation_id":"c6fa05ad-215b-43d2-b63d-2219b48756c6","resolution":{"observed_at":"2026-08-15T22:34:18.308042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.934755Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.934755Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:11f6f5ab110d5de9547466f799bccf64a2640741254fc6a12c882f33902b5303","observation_id":"f6a49c31-0ce2-419e-8705-2812b693bdde","resolution":{"observed_at":"2026-08-15T22:34:17.934755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T22:34:17.938749Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.938749Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:f3d0eb7e0163f65a1c82e8fb7910adfa039242118f3ec57afef98a5193928914","observation_id":"2f2434ef-95bb-4fd7-a07e-ddcebf779f38","resolution":{"observed_at":"2026-08-15T22:34:17.938749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.280998Z","title":"and Bialek, W","venue":null,"work_id":"0e36fd52-4215-430a-a7d8-446bd5777f85","year":1993},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.943140Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:e37b07dd93ed962af89840f9e969e569259eb543eaf348b5111a027d2aebabf8","observation_id":"3a3ff6f3-f1e4-4f39-afe8-976eed5d40da","resolution":{"observed_at":"2026-08-15T22:34:18.285184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-08-16T14:01:38.562057Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-08-15T22:34:17.947312Z","title":"T., Argus, M., Fischer, V., and Brox, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.947312Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:46b6f427840787856a1e50862167fd1d6a147717fdda811a75e36f58a38ae361","observation_id":"e761555f-6035-4164-a126-e74f218e673f","resolution":{"observed_at":"2026-08-15T22:34:17.947312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.267316Z","title":"C., Bj \\\"o rkman, M., and Kragic, D","venue":null,"work_id":"e9767065-90b6-4470-a3da-ce7a209357e8","year":2023},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.951660Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:1322ebd1d3498305715fb8856465d3534ff77b5f6df2849771b1de143a3c6f59","observation_id":"4e23addd-9f95-4f77-a000-a5e6e3eb759f","resolution":{"observed_at":"2026-08-15T22:34:18.271709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T22:34:17.955652Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.955652Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:a47ac9170f4aa4919af6b13311e2c238fedd8882cbaa778375c866fbfec40ddc","observation_id":"e0487c86-d998-418f-9f40-5554de8dd56d","resolution":{"observed_at":"2026-08-15T22:34:17.955652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.252625Z","title":"Deep learning on image denoising: An overview","venue":null,"work_id":"5dce134b-6ed8-48f7-b0cd-2b2f9daf9956","year":2020},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.959852Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:6c05dcecea2a88a51b79dbc9738d97bb65008cd40e3991a70a3f44dadd42eca9","observation_id":"68deb1ef-17a5-45db-86f5-0079f583f4ab","resolution":{"observed_at":"2026-08-15T22:34:18.257606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.237957Z","title":"High-Dimensional Probability: An Introduction with Applications in Data Science","venue":null,"work_id":"2867c1af-7ef1-43dd-b2d4-682f774d6359","year":2018},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.964017Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:0746e30902d0ff2663bf22f78eb63712f1b29bbc6a3b1447621d67cbb06350ad","observation_id":"cfec2dcf-6ddf-4109-a5c2-235a4c3f9783","resolution":{"observed_at":"2026-08-15T22:34:18.242503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-15T22:34:17.967817Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.967817Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:652e940c2076ffd8c89d38bcd38cb7ac50c22dc81d21eef71d49c08d3a837c03","observation_id":"38320f84-039b-4a93-994a-08aa5034d964","resolution":{"observed_at":"2026-08-15T22:34:17.967817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:17.972309Z","title":"and Isola, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.972309Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:d58a3b4a0d9ed39ad2f87061b61dfea45a612b5fc56ef357d96bf6de1ba53d0c","observation_id":"13d85c65-58c0-42f5-9971-5146dd7e37db","resolution":{"observed_at":"2026-08-15T22:34:17.972309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.214387Z","title":"Chatgpt or grammarly? evaluating chatgpt on grammatical error correction benchmark","venue":null,"work_id":"3769fb60-4e84-41b0-bf9c-e3526621a9cd","year":2023},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.976249Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:a5981ca6cbcf77ce85ccf37cba332b4fa2b2a230c36e9370141f840f8c2f0f7a","observation_id":"56f69a24-3af0-4571-ab38-a221c50a5d52","resolution":{"observed_at":"2026-08-15T22:34:18.219514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.200073Z","title":null,"venue":null,"work_id":"6a8c81fc-7c0a-4e9d-b62b-2b26f083f22b","year":2018},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.981297Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:f20f61b4199725439a10254a9e942b554416ff7f78b87b21a8279cb3a05e46ef","observation_id":"7752c016-c3ed-42f3-b318-36ebe8f223a6","resolution":{"observed_at":"2026-08-15T22:34:18.205072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T22:34:17.985540Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.985540Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:ac822da28057a5cab3eb77745939a0e20a76951349113d007c3ed42d74a57da7","observation_id":"d50a9a9e-743a-4b82-a5ae-35622544059d","resolution":{"observed_at":"2026-08-15T22:34:17.985540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:18.184359Z","title":"and Weiss, Y","venue":null,"work_id":"4167cfb8-fb24-4220-838a-6b38b9c5350c","year":2011},"citing_paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T22:34:17.989815Z"},"links":{"citing_paper":"/paper/2505.06934"},"observation_digest":"sha256:3052cadba5ee56a7df7eeb8c1ca916dfa7296d8a852f6b6c63e2e9dd0b1a7f32","observation_id":"c40c78e7-5fcc-4d18-ae2b-9ed445ea7d6e","resolution":{"observed_at":"2026-08-15T22:34:18.190039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.06934","last_updated":"2025-05-11T10:44:52Z","latest_version":1,"primary_category":"eess.IV","snapshot_observed_at":"2026-08-17T22:28:43.607955Z","submitted_at":"2025-05-11T10:44:52Z","title":"Whitened CLIP as a Likelihood Surrogate of Images and Captions"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2505.06934."}