{"as_of":"2026-08-10T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f7974f9f5a3aa9eb02e708c84c997ceab17e46da335265a7c08acca0306da8c","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:11:51.717772Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03683/citation-record","integrity":"/paper/2507.03683/integrity","json":"/paper/2507.03683/citation-record.json","paper":"/paper/2507.03683"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-06T20:11:48.623426Z","title":"Understanding intermediate layers using linear classifier probes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.623426Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:e586edf5d6bc5f68d7d543d8ce1dbdc3ba71445b08a9d274399b1248c51ba5f3","observation_id":"72fcb7d1-1878-4a5b-987a-7a8956bbd1b7","resolution":{"observed_at":"2026-08-06T20:11:48.623426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.674241Z","title":"Conditioned and composed image retrieval combining and partially fine-tuning CLIP-based features","venue":null,"work_id":"4d7a8add-3cf8-4722-aa58-11709cfc9f48","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.662843Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:ed1759d7d2ba37bc1ff4c32827d32c5e5dfa6502f318d0e50b454ded8fb3d013","observation_id":"72f8616e-862e-4547-92c6-4f8ae4d82f13","resolution":{"observed_at":"2026-08-06T20:11:53.679728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17142","last_updated":"2025-03-21T13:46:53Z","snapshot_observed_at":"2026-08-07T16:46:35.296260Z","submitted_at":"2025-03-21T13:46:53Z","title":"Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2503.17142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17142","snapshot_observed_at":"2026-08-06T20:11:53.133484Z","title":"Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models","venue":"cs.CV","work_id":"a6245f06-c6b2-4204-a5ac-26d0023decf2","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.742002Z"},"links":{"cited_paper":"/paper/2503.17142","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:1447a73fbbc85ef915b329bdf2cbb8dc19b9487daa5192a673ee5c73ffa0ef65","observation_id":"671d080d-4f91-48ef-b91b-bc3ff30dd0f1","resolution":{"observed_at":"2026-08-06T20:11:53.140579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.658635Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","venue":null,"work_id":"b323ea1f-d24f-480e-9af9-5e011207a289","year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.803202Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:827aade913967fc39906e90212746e7de1c8c18c6191a45024e36270e18dc65d","observation_id":"82b92998-93e2-45a5-9a65-d480c670884b","resolution":{"observed_at":"2026-08-06T20:11:53.663979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.641568Z","title":"Deep Learning for Instance Retrieval: A Survey","venue":null,"work_id":"b47c1d7e-e474-4488-a35c-224391c73e42","year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.894792Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:513d5cb4fdf5804ee40dc6157264ad9f95e9a7e9fe82e58a6a7c7701742525c2","observation_id":"511cf3cc-d07f-4c12-a0ae-b1d11993093b","resolution":{"observed_at":"2026-08-06T20:11:53.647220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.624653Z","title":"Deep learning for instance retrieval: A survey","venue":null,"work_id":"1395c446-5f13-4ce9-b55f-1af1204787e0","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.981497Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a19b1f7a301887819f10b7984e7642f20f07d9d86ba8d84b86b9e76e6dc0bbb9","observation_id":"0208f5c9-189e-4893-a53b-1e5093e7b4a4","resolution":{"observed_at":"2026-08-06T20:11:53.630656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:49.072090Z","title":"Composition Loss for Counting, Density Map Estimation and Localization in Dense Crowds","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.072090Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:995c0483baaddf345b633e76ba0ecfa830e0405fb0548aabc671870f2351573b","observation_id":"af97d169-f7c6-4cc0-8ed5-efa72c98a39c","resolution":{"observed_at":"2026-08-06T20:11:49.072090Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09172","last_updated":"2024-01-18T17:13:21Z","snapshot_observed_at":"2026-08-06T01:14:41.681744Z","submitted_at":"2023-04-18T17:59:45Z","title":"Hyperbolic Image-Text Representations","version":3},"cited_work":{"arxiv_id":"2304.09172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.09172","snapshot_observed_at":"2026-08-06T20:11:53.106483Z","title":"Hyperbolic Image-Text Representations","venue":"cs.CV","work_id":"309995b8-45c2-499a-a2cb-ece0375f373e","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.128084Z"},"links":{"cited_paper":"/paper/2304.09172","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:9a2b7d29f3afbf0d0c222b7e54047d20ad4fef9d9bf2f30047b1ddbeb200695e","observation_id":"94a871ac-e6e3-41c2-b3b3-06ddd5a78bde","resolution":{"observed_at":"2026-08-06T20:11:53.112878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:11:49.229769Z","title":"arXiv:2010.11929","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.229769Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8e614b1e801ef71ad05982adf6629ef0c2f0c2bdb709cabd321bb90260ba099f","observation_id":"2d825a8c-c3ea-4a01-a78d-877669bf5ce3","resolution":{"observed_at":"2026-08-06T20:11:49.229769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03574","last_updated":"2024-08-07T06:26:04Z","snapshot_observed_at":"2026-08-06T02:47:34.343973Z","submitted_at":"2024-08-07T06:26:04Z","title":"Teach CLIP to Develop a Number Sense for Ordinal Regression","version":1},"cited_work":{"arxiv_id":"2408.03574","doi":"10.48550/arxiv.2408.03574","metadata_source":"pith","pith_arxiv_id":"2408.03574","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Teach CLIP to Develop a Number Sense for Ordinal Regression","venue":"cs.CV","work_id":"dd4cc20d-ec5d-4f30-b0c0-3fe48d0b3e88","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.329152Z"},"links":{"cited_paper":"/paper/2408.03574","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:3a0d0c720a8fa4abf8a18a3652b4776c5c755b350579b18d3f505c25e624fead","observation_id":"b6cc826c-934f-489b-94e1-f44b9422ddc1","resolution":{"observed_at":"2026-08-06T20:11:52.059438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/6906255","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.079846Z","title":"Age and Gender Estimation of Unfiltered Faces","venue":null,"work_id":"0ff40bc1-2906-4478-9ae9-1b44716b9e98","year":2014},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.450137Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:34b79a3e0caa5a74ea84dbc40c342511fb4414d9ad15be5caf7fed256311195a","observation_id":"8883acf4-b68b-4343-903e-8706086d6021","resolution":{"observed_at":"2026-08-06T20:11:53.088420Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-06T20:11:49.531103Z","title":"Its Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.531103Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:b8de18fbac05a089bf0edd277c62e262d1568caa0284d212c5c63bb5b6fbc758","observation_id":"9cfaf071-0d3c-4582-83b4-b5dd8d280749","resolution":{"observed_at":"2026-08-06T20:11:49.531103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.608040Z","title":"Heterogeneous face attribute estimation: A deep multi-task learning approach","venue":null,"work_id":"83d56901-2879-4ae6-bd9b-076360896086","year":2017},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.721697Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:37ad08c5763f73d946eb1ef20c8a6be0fac9c8b105c339ae881924777b77165b","observation_id":"9dd7610a-3d37-4134-a268-e1343c54c0f3","resolution":{"observed_at":"2026-08-06T20:11:53.613502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:49.805256Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.805256Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8a089100446a4d5262cdd04a38ce933eb316b851e8544032fe79f6c8830c68d2","observation_id":"477da1c2-50ff-4f16-8b1d-05c3201567d5","resolution":{"observed_at":"2026-08-06T20:11:49.805256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.592201Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":"61342aea-6220-4f7c-b42c-c10a5e842cfc","year":1989},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.928316Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:55255cd12dcb78315304a7c3c3a9432e3d8bb73b7797f1686a2f0c4e74cecb12","observation_id":"307ea798-7ea6-4281-aa6e-2432bac0103f","resolution":{"observed_at":"2026-08-06T20:11:53.597532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.577335Z","title":"KonIQ-10k: An Ecologically Valid Database for Deep Learning of Blind Image Quality Assessment","venue":null,"work_id":"644dc0f8-09e1-4f4b-8b84-30f7d620a49f","year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.055806Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:5c27e9824e03d0e4c0e1ce7d9b2383939df5add7772ff582f167f709e2db63b9","observation_id":"bb2b5fda-2abe-47f1-b5e9-2c4c8f7635f0","resolution":{"observed_at":"2026-08-06T20:11:53.582027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.560926Z","title":"Lp++: A surprisingly strong linear probe for few-shot clip","venue":null,"work_id":"5301adc2-2e38-4fb3-9dae-72b501aff1d6","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.309455Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:cec0c54cd6cc34b55d660af5dedb023278d6fb05f1670f2231c04a5d75bc7b4c","observation_id":"97fb22fc-96d4-4760-9b18-e002309f4483","resolution":{"observed_at":"2026-08-06T20:11:53.566871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-06T20:11:50.427501Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.427501Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:837a8965343f1ff86a9bdf76bf2af011c34ee94e713f5db14795efe409699464","observation_id":"9d9125c5-7393-4fdd-90fd-9213f230accf","resolution":{"observed_at":"2026-08-06T20:11:50.427501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:50.544893Z","title":"CLIP-Count: Towards Text-Guided Zero- Shot Object Counting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.544893Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:c93511d0ceb4029fcb82954eaa417bb62f44269750414966a54e99dc0f048e5b","observation_id":"1e02910c-73b7-4adf-a889-8aa29d70c8f0","resolution":{"observed_at":"2026-08-06T20:11:50.544893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.539735Z","title":"Hyperbolic Image Embeddings","venue":null,"work_id":"80b93f4e-063c-4fe1-a986-4be2ecee885b","year":2019},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.625607Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:587ff9dc6051dd9fd6f0465e7e245dea7d5c674638bb73a225c7d5d11dc19619","observation_id":"22adfc6d-f764-4110-8eea-9146e82b38b7","resolution":{"observed_at":"2026-08-06T20:11:53.549000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16837","last_updated":"2025-01-13T05:04:59Z","snapshot_observed_at":"2026-07-31T01:26:58.071569Z","submitted_at":"2024-07-23T21:02:38Z","title":"MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16837","snapshot_observed_at":"2026-08-06T20:11:50.693133Z","title":"CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.693133Z"},"links":{"cited_paper":"/paper/2407.16837","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8f6317c9d8815eb924370331d50fd9f4cfcf07a1867f71b30000e31242218d2d","observation_id":"86d92a71-4aea-4f83-ad09-41ba0cd792a0","resolution":{"observed_at":"2026-08-06T20:11:50.693133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.523978Z","title":"Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav)","venue":null,"work_id":"72ca0797-b67c-45fd-8988-8dce7633cc63","year":2018},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.813651Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:3251ade1c73a5abe4f95feb458c71f5f1349ac264cf0081934d13e1fe0b9e4d2","observation_id":"4c0d978c-48c2-461d-9110-e11b77b6153b","resolution":{"observed_at":"2026-08-06T20:11:53.529295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:50.960886Z","title":"CLIP Behaves like a Bag-of-Words Model Cross-modally but Not Uni-modally","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.960886Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8b728b658a927026a0e44e00fd116c2e91e0c5506c5373eb4ad4b7d31241630a","observation_id":"d74f666a-fe1f-4221-be11-5cb58b0a6fd4","resolution":{"observed_at":"2026-08-06T20:11:50.960886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.002032Z","title":"CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.002032Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d4ff88b06092d6bc6885d3588b6b2d2227107375f1f99603781f3f39e4ad9e1e","observation_id":"de4d0571-cc07-4331-a0c2-034a6b53f7b1","resolution":{"observed_at":"2026-08-06T20:11:51.002032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.506390Z","title":"Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning","venue":null,"work_id":"064740ce-7ac4-4469-b0c0-c02627fb7b0b","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.033881Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f7f85ab90661060308cae5edc5f9440eb0baa78ab3bdbdad024f840ed06706db","observation_id":"d160e3ef-edc5-4886-b0e0-5c3704ab4ed2","resolution":{"observed_at":"2026-08-06T20:11:53.512741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04616","last_updated":"2023-09-22T14:03:08Z","snapshot_observed_at":"2026-08-03T15:23:32.687072Z","submitted_at":"2023-07-10T14:58:10Z","title":"MiVOLO: Multi-input Transformer for Age and Gender Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04616","snapshot_observed_at":"2026-08-06T20:11:51.039704Z","title":"MiVOLO: Multi-input Transformer for Age and Gender Estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.039704Z"},"links":{"cited_paper":"/paper/2307.04616","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f9b1b434c2c50b8dbddb4f1d25cdb1337d026649b004df6426daece0b7891557","observation_id":"c5ada6c4-84e0-41ad-b510-1f10d8b09f98","resolution":{"observed_at":"2026-08-06T20:11:51.039704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-08-09T12:59:57.754104Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-06T20:11:51.045027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.045027Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:852609e9df97ee67c3c2666514342f5a24872aa01b39add77fddc7f4de0452ba","observation_id":"9e393176-8412-4a5a-816e-ea283721eaac","resolution":{"observed_at":"2026-08-06T20:11:51.045027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10537","last_updated":"2024-08-30T04:51:28Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:46:28Z","title":"Does CLIP Bind Concepts? Probing Compositionality in Large Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10537","snapshot_observed_at":"2026-08-06T20:11:51.071811Z","title":"Does clip bind concepts? probing compositionality in large image models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.071811Z"},"links":{"cited_paper":"/paper/2212.10537","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f4797b535f16321319873a9cfdd36fed80ad7c0a32b46c30df9d229243fd821d","observation_id":"4d502446-6440-47de-b3a7-37f7735ac5f9","resolution":{"observed_at":"2026-08-06T20:11:51.071811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.489819Z","title":"Align before fuse: Vision and language representation learning with mo- mentum distillation","venue":null,"work_id":"0a539a8c-b955-47d0-b6ed-ec32514ce199","year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.171974Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:85b0ce2d2418c9fe2f5496ee0e671d732c7a3f102834e3fef7a3ef45d3415f71","observation_id":"2624fd97-d6cf-4533-b4f8-02e1e764d3dd","resolution":{"observed_at":"2026-08-06T20:11:53.494930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.473160Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision- Language Understanding and Generation","venue":null,"work_id":"f5327923-6af3-4940-9e9f-730940c0f4bc","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.232772Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:b8171ab7e9c2f6f47a6aa153414b697287024011b71220b19795666dbf8e7966","observation_id":"bf413c30-217d-4123-95e4-6fe4efb58ffe","resolution":{"observed_at":"2026-08-06T20:11:53.478419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02338","last_updated":"2022-10-01T13:45:55Z","snapshot_observed_at":"2026-08-05T13:34:20.335749Z","submitted_at":"2022-06-06T03:54:53Z","title":"OrdinalCLIP: Learning Rank Prompts for Language-Guided Ordinal Regression","version":2},"cited_work":{"arxiv_id":"2206.02338","doi":"10.48550/arxiv.2206.02338","metadata_source":"pith","pith_arxiv_id":"2206.02338","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"OrdinalCLIP: Learning Rank Prompts for Language-Guided Ordinal Regression","venue":"cs.CV","work_id":"f012a182-91c9-411d-8f5f-8c1ed69e3bb6","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.302801Z"},"links":{"cited_paper":"/paper/2206.02338","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0d266532367f199271f07f9ec2ff9a834aee258dc4f9a36fdc9efa05eac7c34a","observation_id":"f366b8f4-65fd-4e5b-8ae5-52c09621ca3b","resolution":{"observed_at":"2026-08-06T20:11:51.956760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04231","last_updated":"2023-04-09T12:56:54Z","snapshot_observed_at":"2026-08-09T21:41:40.756831Z","submitted_at":"2023-04-09T12:56:54Z","title":"CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2304.04231","doi":"10.48550/arxiv.2304.04231","metadata_source":"pith","pith_arxiv_id":"2304.04231","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model","venue":"cs.CV","work_id":"b1d45e2e-5b7c-436d-bc99-46561916db73","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.386439Z"},"links":{"cited_paper":"/paper/2304.04231","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:7bd3bee138360658498cfc933c5c1bd0cd775bfbf19a2711d6adc3f7f9f52200","observation_id":"00efac1b-a70d-4467-b8f4-0ba5c81b0c6d","resolution":{"observed_at":"2026-08-06T20:11:51.933505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.456223Z","title":"Beyond comparing image pairs: Setwise active learning for relative attributes","venue":null,"work_id":"8132f5ec-400c-450b-af48-8810ff2a50a4","year":2014},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.467629Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:7ad08d136fc61cd0c906d0c46c98b4d4a1f954e0644b8aa4bf4eaec57d11724f","observation_id":"ffb1b424-5803-447c-983e-274b6ec42009","resolution":{"observed_at":"2026-08-06T20:11:53.462867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09281","last_updated":"2025-03-25T16:47:11Z","snapshot_observed_at":"2026-08-09T18:33:56.913148Z","submitted_at":"2024-03-14T11:08:33Z","title":"CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09281","snapshot_observed_at":"2026-08-06T20:11:51.500131Z","title":"CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.500131Z"},"links":{"cited_paper":"/paper/2403.09281","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:129bfaad6c8a61ceb0176e6559798b9446e02365c688889564786ff909978843","observation_id":"9cdd71ea-a5ce-4033-93fd-6d02518fd554","resolution":{"observed_at":"2026-08-06T20:11:51.500131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T20:11:51.511161Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.511161Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:89b05099011a786ca7635d9c3532428f0efc3a68dbbeec842c7ddcfaebce83c5","observation_id":"ca8ccce3-3a66-418b-96d1-4e4cd7f48a02","resolution":{"observed_at":"2026-08-06T20:11:51.511161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.516129Z","title":"A V A: A Large-Scale Database for Aesthetic Visual Analysis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.516129Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:3964dccadd1645197c72a243e7b566689f88cf1d161960a840fdb00e70b87a71","observation_id":"ead6e43e-4d76-4484-8b92-a25d7b2ded35","resolution":{"observed_at":"2026-08-06T20:11:51.516129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.435049Z","title":"A metric learning reality check","venue":null,"work_id":"56a22358-1022-4d2d-877e-23f8800f2480","year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.520788Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:2e759ead5f4a0726fadb7510336715c64fc3c485e57ddf75bb96a563de759c0c","observation_id":"55c49fff-8449-4320-8028-83eba01abd3f","resolution":{"observed_at":"2026-08-06T20:11:53.441046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14053","last_updated":"2023-11-12T20:17:47Z","snapshot_observed_at":"2026-08-03T16:44:35.384738Z","submitted_at":"2023-05-23T13:32:19Z","title":"Parts of Speech-Grounded Subspaces in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2305.14053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14053","snapshot_observed_at":"2026-08-06T20:11:52.528058Z","title":"Parts of Speech-Grounded Subspaces in Vision-Language Models","venue":"cs.CV","work_id":"9ca9943e-01b7-4ef5-83c9-003cd72b5788","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.526319Z"},"links":{"cited_paper":"/paper/2305.14053","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:39244869a9368601a965ed9895e0e9dc9df3badb4d4981f8e4803c5bc6ac530f","observation_id":"f8ee04c5-2aa8-46e1-be7d-9572b7fa1707","resolution":{"observed_at":"2026-08-06T20:11:52.533367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T20:11:51.531605Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.531605Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:135366c2166a332ad34f8265fca062b1510e6827065e2e10b6938d077c3dc77c","observation_id":"18e7cfd6-4087-4ef9-beec-b45a1a211e6a","resolution":{"observed_at":"2026-08-06T20:11:51.531605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12066","last_updated":"2023-02-23T14:43:53Z","snapshot_observed_at":"2026-08-09T17:48:21.480303Z","submitted_at":"2023-02-23T14:43:53Z","title":"Teaching CLIP to Count to Ten","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12066","snapshot_observed_at":"2026-08-06T20:11:51.537121Z","title":"Teaching CLIP to Count to Ten","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.537121Z"},"links":{"cited_paper":"/paper/2302.12066","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:c989fa2406c19355928b1376499577cd8b9b18301320b2516983326db47ff1c7","observation_id":"bd3a1569-da58-45a3-826f-5ab8b6110eaf","resolution":{"observed_at":"2026-08-06T20:11:51.537121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.542600Z","title":"Dating Historical Color Images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.542600Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a0538da1c891eaa434962accbadd03d09697e1499d16c873381fbe6efbb4f3b6","observation_id":"75fa21f4-3934-4458-8b3d-b3fd6aaebe20","resolution":{"observed_at":"2026-08-06T20:11:51.542600Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.548487Z","title":"Relative Attributes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.548487Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:9f6a2230dea28313d02343ac33211b429795b131c353d8b87f99e76018b699e4","observation_id":"5e8fa665-8c00-4a0b-b22f-f10365a35b98","resolution":{"observed_at":"2026-08-06T20:11:51.548487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.416787Z","title":"HYDEN: Hyperbolic Density Representations for Medical Images and Re- ports","venue":null,"work_id":"d0f2b7bf-6f5f-4485-b73f-78e8773355b8","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.553683Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a752cb2289d2d0fe27d99ab954689f4a6b5d09558182ba71f189e1caeb6049fc","observation_id":"0babb719-b950-468c-a839-5b56f2279032","resolution":{"observed_at":"2026-08-06T20:11:53.422955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T20:11:51.559058Z","title":"Learning Transferable Visual Models From Natural Language Supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.559058Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:62b13796e188f4f017a20bdbd68e4c03b1b989e28fabbac3fa8849ed3bdfae6d","observation_id":"a0e88aef-b4aa-4aff-90ec-4a7203a7dd5e","resolution":{"observed_at":"2026-08-06T20:11:51.559058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.398356Z","title":"Learning Transferable Visual Models From Natural Language Super- vision","venue":null,"work_id":"73e577fa-9203-41ec-8762-43be56141984","year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.564088Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:4cd7b2de5b3b595f313f26812053432336dbe80032b91a5ba1b01e6d63b60da2","observation_id":"025ec07b-d7e3-459d-99a9-9abf9a1a44e9","resolution":{"observed_at":"2026-08-06T20:11:53.404122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.569573Z","title":"Steering Llama 2 via Contrastive Activation Addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.569573Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:91f2b2c9e37108e487d0177df18a0a96d7ddfd55f34494eb9e0041f1ffc8f324","observation_id":"e2d4c7c3-cb2a-4eed-bf32-218603569642","resolution":{"observed_at":"2026-08-06T20:11:51.569573Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09721","last_updated":"2025-07-04T18:25:46Z","snapshot_observed_at":"2026-07-31T17:58:05.096612Z","submitted_at":"2024-09-15T13:02:14Z","title":"Finetuning CLIP to Reason about Pairwise Differences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09721","snapshot_observed_at":"2026-08-06T20:11:51.575686Z","title":"Finetuning CLIP to Reason about Pairwise Differences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.575686Z"},"links":{"cited_paper":"/paper/2409.09721","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:5cadbdc4fd59bca1c933714ffad178148e6dbdb75bd6be1df9eb23e4987fc2c6","observation_id":"fe3b8e31-c769-4e73-ae32-dd0e949665a4","resolution":{"observed_at":"2026-08-06T20:11:51.575686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1106.35922","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:52.382060Z","title":"Improving Image Encoders for General-Purpose Nearest Neighbor Search and Classification","venue":null,"work_id":"17b96a05-1ac5-43f4-99f4-15cab2ad3995","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.583085Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:99936cf8a48f85890798c7253cca5e04afe4322ade5e1dfb1ecccd41ddc6bf5f","observation_id":"3fd03dbe-f488-4d9f-be8d-8c43e02a1b47","resolution":{"observed_at":"2026-08-06T20:11:52.391746Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.380885Z","title":"Linear Representations of Sentiment in Large Language Models","venue":null,"work_id":"56ba7a58-ea17-4b21-a315-06467e97bb51","year":null},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.588973Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:193f12fa0dc44692527bd1614de74119610397243a9242655f768cb520aea6d8","observation_id":"bae4703a-499c-46ee-8035-7a7ab5c85cd7","resolution":{"observed_at":"2026-08-06T20:11:53.386329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.361436Z","title":"Linear Spaces of Meanings: Compositional Structures in Vision- Language Models","venue":null,"work_id":"37adf8f0-210d-4299-a4f1-bff2b25133d3","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.601038Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:7908eb97615644fc87aa1401f039e7deb3ee33878403149d72aaa1108384f969","observation_id":"3238f178-81da-4011-99c2-d6fe4be79ac2","resolution":{"observed_at":"2026-08-06T20:11:53.368075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.342333Z","title":"Deep image prior","venue":null,"work_id":"33199b1a-7b22-4b12-b01e-947e3376316e","year":2018},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.607467Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:230ca33bc5c0a296c554b618cafa6ed09223b2d39ab1b9cfd37f43ca2c9f7729","observation_id":"1b0cdd12-01f9-4d10-9361-19f08ebb1ee4","resolution":{"observed_at":"2026-08-06T20:11:53.348792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.322381Z","title":"BEYOND DECODABILITY: LIN- EAR FEATURE SPACES ENABLE VISUAL COMPOSITIONAL GENERALIZATION","venue":null,"work_id":"75a1b4ce-9dcd-4137-8ff3-24472d53fdbd","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.612865Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:695fb34e96a2df1d0b3204bd1ec16f0dd2e6d5bbdecce1cee1c251f7b8edf828","observation_id":"e4fe7ec6-2185-47a2-af26-0d7a5a3c787e","resolution":{"observed_at":"2026-08-06T20:11:53.330263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.301994Z","title":"Intermediate Layer Classifiers for OOD Generalization","venue":null,"work_id":"eac312eb-ed6b-4878-94fe-49ef22af9fb6","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.617981Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:ede319cd1360288216513efc4c36c0dca22daa2ddfa6f7c3f3315ecba5107db1","observation_id":"4230b46f-7018-4a08-8e07-12086fe5af61","resolution":{"observed_at":"2026-08-06T20:11:53.308628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06361","last_updated":"2016-03-01T08:23:50Z","snapshot_observed_at":"2026-08-07T18:55:40.634051Z","submitted_at":"2015-11-19T20:56:14Z","title":"Order-Embeddings of Images and Language","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06361","snapshot_observed_at":"2026-08-06T20:11:51.623271Z","title":"Order-Embeddings of Images and Language","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.623271Z"},"links":{"cited_paper":"/paper/1511.06361","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a45bb38257dd79f15870aac252c0035023d74b0f23ead4631a8ebe7fa6471cab","observation_id":"9247635d-3ab4-46b7-847f-bf53ff49548e","resolution":{"observed_at":"2026-08-06T20:11:51.623271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.628732Z","title":"Exploring CLIP for Assessing the Look and Feel of Images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.628732Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d8408ee9d0d3c6e6d7de149971bc1498cbf898b673118ebc48cea3ee036e1e86","observation_id":"6b5e8000-421a-459c-a408-8b76f589aed6","resolution":{"observed_at":"2026-08-06T20:11:51.628732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.284487Z","title":"Learning-to-Rank Meets Language: Boosting Language-Driven Ordering Alignment for Ordinal Classification","venue":null,"work_id":"54420b90-ddc8-4846-b1c6-0374940a8e0a","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.634171Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:662f055dd09603712c7a771d465a821f3e4cb846992591846fea95ba7b762c7f","observation_id":"936ac420-362e-4fbf-8e94-e91a8469f375","resolution":{"observed_at":"2026-08-06T20:11:53.290182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.265577Z","title":"Learning-to-rank meets language: Boosting language-driven ordering align- ment for ordinal classification","venue":null,"work_id":"718321d1-d21a-464b-a1e5-2c8270722896","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.640208Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:b364687ec3cbc898f9bf05ce2b39eac40ab9218970a84076ec11e15ce5664d42","observation_id":"e4732314-04f8-4044-ba8f-e92acfb33c58","resolution":{"observed_at":"2026-08-06T20:11:53.271360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.10242","last_updated":"2022-08-15T22:04:26Z","snapshot_observed_at":"2026-08-09T00:01:11.785313Z","submitted_at":"2020-05-20T17:59:57Z","title":"Understanding Contrastive Representation Learning through Alignment and Uniformity on the Hypersphere","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.10242","snapshot_observed_at":"2026-08-06T20:11:51.646034Z","title":"Understanding Contrastive Representation Learning through Alignment and Uniformity on the Hypersphere","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.646034Z"},"links":{"cited_paper":"/paper/2005.10242","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0c34005421b3afb122f6fff0e61325c7b7dd23cec230dccbc9a20a7dcb3af552","observation_id":"be34882b-7800-4c43-bc56-e814d8e5511c","resolution":{"observed_at":"2026-08-06T20:11:51.646034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.246012Z","title":"Disentangled representation learning","venue":null,"work_id":"b393d0e9-f587-438a-95df-9829a574e447","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.651508Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:e160474a40d08397f49e246fe87c367985be33d2a3aea7ba2951b4245fa8bf0f","observation_id":"6f1bb15f-0122-4804-9671-9633a12c7e06","resolution":{"observed_at":"2026-08-06T20:11:53.252755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00808","last_updated":"2023-01-02T18:59:31Z","snapshot_observed_at":"2026-08-08T08:01:57.986531Z","submitted_at":"2023-01-02T18:59:31Z","title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00808","snapshot_observed_at":"2026-08-06T20:11:51.656002Z","title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoen- coders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.656002Z"},"links":{"cited_paper":"/paper/2301.00808","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:2928f24fc833fccc01b9f764e41b9a70dda5c75749fc27cc8d49aa4ab065dc79","observation_id":"f0ff0cf9-3c50-4858-9037-a99cb6c6d5d9","resolution":{"observed_at":"2026-08-06T20:11:51.656002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15640","last_updated":"2025-08-02T13:50:28Z","snapshot_observed_at":"2026-08-07T12:22:09.338042Z","submitted_at":"2023-07-28T16:00:21Z","title":"CLIP Brings Better Features to Visual Aesthetics Learners","version":2},"cited_work":{"arxiv_id":"2307.15640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.15640","snapshot_observed_at":"2026-08-06T20:11:52.242928Z","title":"CLIP Brings Better Features to Visual Aesthetics Learners","venue":"cs.CV","work_id":"c815e581-cd5d-4437-8a94-358a68204f2d","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.661258Z"},"links":{"cited_paper":"/paper/2307.15640","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:36945460c237e32ea23e120ecc2e71cbe75988f29b487f163bd8ee979b707d71","observation_id":"c36c12cd-79c4-42e7-a276-151ea491f4ee","resolution":{"observed_at":"2026-08-06T20:11:52.250347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T20:11:51.667082Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.667082Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f7c9494713bfa09a5478de6ebf9adcbd70e6cccb20abf4aee26b5b38167cf94e","observation_id":"2dd22aa8-820d-4c84-b04a-02be321730dd","resolution":{"observed_at":"2026-08-06T20:11:51.667082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.227372Z","title":"Just noticeable differences in visual attributes","venue":null,"work_id":"8e403aca-2ac9-41a5-9005-57e45e995839","year":2015},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.673658Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:114acb71724f64f56169c666da8a68b436e38227dced27cb4e273ed809e1762b","observation_id":"01c94fe3-87ce-4cef-8ba2-51249241ef8a","resolution":{"observed_at":"2026-08-06T20:11:53.233523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.210499Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":null,"work_id":"bebd1fe0-17e6-4fd6-8fae-9212bd9b003b","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.679214Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d3dbcd7dde5901efb35b707d738631616ad1ab8b86e01a894e91f958464bcdb0","observation_id":"82ad9c1e-42a9-416c-b056-06aac0007fb0","resolution":{"observed_at":"2026-08-06T20:11:53.216137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.195321Z","title":"RANKING-AWARE ADAPTER FOR TEXT-DRIVEN IMAGE OR- DERING WITH CLIP","venue":null,"work_id":"1fe6bda1-2e9d-4f00-a760-cf516304e049","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.684176Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:44fd78b4ee1c482181f2a6dd5fead2540285adb5c0fffee8ac534da6b0ff821c","observation_id":"db9bfc04-6741-4d31-9d31-7c52aab8b687","resolution":{"observed_at":"2026-08-06T20:11:53.200041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06760","last_updated":"2025-02-08T03:25:39Z","snapshot_observed_at":"2026-07-06T20:04:06.216583Z","submitted_at":"2024-12-09T18:51:05Z","title":"Ranking-aware adapter for text-driven image ordering with CLIP","version":3},"cited_work":{"arxiv_id":"2412.06760","doi":"10.48550/arxiv.2412.06760","metadata_source":"pith","pith_arxiv_id":"2412.06760","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Ranking-aware adapter for text-driven image ordering with CLIP","venue":"cs.CV","work_id":"ab717cd3-a6f9-49b2-a6e0-5e4710415f31","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.689502Z"},"links":{"cited_paper":"/paper/2412.06760","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f6ab8cd2fa721f20a7252fc55725063d48828dc3ea2cf49bbf750cbbc9e4622c","observation_id":"3f14a96a-9b7b-416c-97c0-65bfe82f4afc","resolution":{"observed_at":"2026-08-06T20:11:51.801956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-03T09:40:32.201832Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T20:11:51.695389Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.695389Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:615b60f6c02f2e34014c7367e45cd9bc8b4a287f8b05372c25b0837232bb6826","observation_id":"3ed8fddf-ba6d-48cb-8c12-f3952ea698e1","resolution":{"observed_at":"2026-08-06T20:11:51.695389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.701459Z","title":"Single-Image Crowd Counting via Multi-Column Convolutional Neural Network","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.701459Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f3b683ff22db690ed501e4293b08fc45b8dcc9ccb219b828e5cca4afd8c46596","observation_id":"68d75df2-e218-4e43-b214-cd4e2f6db13d","resolution":{"observed_at":"2026-08-06T20:11:51.701459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/7780439","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:52.177893Z","title":null,"venue":null,"work_id":"ee48395c-afc4-4fdf-bcc9-c40c233f0c6f","year":null},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.706634Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:4f17fa23d9c2ff6996a974991659050dd4c16617a1783b123240f6e465f4acf8","observation_id":"ef6fcadf-a217-4378-ae55-e1e091615786","resolution":{"observed_at":"2026-08-06T20:11:52.187722Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.176133Z","title":"Learning Ordinal Relationships for Mid-Level Vision","venue":null,"work_id":"5e621164-8ea6-41cb-983e-055a0219bcbe","year":2015},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.717772Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:c96d653690365a447dfd7fa42a4f43214e8f10b867a8607e01b7607db22ddfb7","observation_id":"e330120c-f2ee-478c-809d-c67b5537b483","resolution":{"observed_at":"2026-08-06T20:11:53.183574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08423","last_updated":"2017-03-28T20:02:15Z","snapshot_observed_at":"2026-07-06T05:31:36.464061Z","submitted_at":"2017-02-27T18:28:58Z","title":"Age Progression/Regression by Conditional Adversarial Autoencoder","version":2},"cited_work":{"arxiv_id":"1702.08423","doi":"10.48550/arxiv.1702.08423","metadata_source":"pith","pith_arxiv_id":"1702.08423","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Age Progression/Regression by Conditional Adversarial Autoencoder","venue":"cs.CV","work_id":"9d6d34df-2ef5-406a-baf2-161f1f50c72c","year":2017},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.712243Z"},"links":{"cited_paper":"/paper/1702.08423","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:271f25c9170d413a8e1ac83f8f84f8c9fbd5a20f9e10b33e38d4c5148f6c6917","observation_id":"73c93712-e3f5-4205-97ab-3869d8d60f4d","resolution":{"observed_at":"2026-08-06T20:11:51.767240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-08-08T01:44:57.952179Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-06T20:11:51.594734Z","title":"48550 / arXiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.594734Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:149344af6c9d182ca27fca3b7aebb6d81da1634f9cc8f9a34482aeebc1ce2d21","observation_id":"ec1d0391-a4a0-4c85-84d5-c2f4ae582f49","resolution":{"observed_at":"2026-08-06T20:11:51.594734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:50.176194Z","title":"DOI: 10.1109/TIP.2020.2967829","venue":null,"work_id":null,"year":1941},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":4056,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.176194Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:956bf973fa77fba4cfed62179748c725b0dfed985e6005a9eff3ca03726b1083","observation_id":"7d03c2f3-6c39-41dc-89c0-7120d1ade950","resolution":{"observed_at":"2026-08-06T20:11:50.176194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":11,"verified_fuzzy":29},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2507.03683."}