{"as_of":"2026-08-09T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cb0f5aea03c83fbc0f0f06cfb62cdaa932c195b0060fdb327e2d0c90ab9b9d9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:56.316279Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T21:43:28.684801Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":"2407.12442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clearclip: Decomposing clip repre- sentations for dense vision-language inference","venue":null,"work_id":"fac6317c-c0f9-46d7-9fa2-b7941364fe76","year":2024},"citing_paper":{"arxiv_id":"2408.06747","last_updated":"2026-05-08T11:25:47Z","snapshot_observed_at":"2026-07-06T19:00:04.529141Z","submitted_at":"2024-08-13T09:10:48Z","title":"ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T21:42:34.305164Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2408.06747"},"observation_digest":"sha256:38d72f6d37573b39d13d64c36d3ead24ca7ff85cedeb9d868fa38fbbf46a524b","observation_id":"1d73ca2e-2d06-433e-bf66-3189fc8f657f","resolution":{"observed_at":"2026-05-23T21:43:28.691444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":"2407.12442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clearclip: Decomposing clip repre- sentations for dense vision-language inference","venue":null,"work_id":"fac6317c-c0f9-46d7-9fa2-b7941364fe76","year":2024},"citing_paper":{"arxiv_id":"2502.06818","last_updated":"2026-07-17T05:04:01Z","snapshot_observed_at":"2026-07-22T23:18:54.377661Z","submitted_at":"2025-02-05T03:37:50Z","title":"Rethinking the Global Knowledge of CLIP in Training-Free Open-Vocabulary Semantic Segmentation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T04:33:51.883348Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2502.06818"},"observation_digest":"sha256:e7726f1af432636a68e04b7037c02d4a0ea9c06c316d0d3f3a6603de3f065ed4","observation_id":"dd7ce8bf-859c-472a-8597-aa47c66b4327","resolution":{"observed_at":"2026-05-23T04:35:23.278056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-07T14:58:56.316279Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence.ArXiv, abs/2407.12442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16778","last_updated":"2025-05-22T15:20:39Z","snapshot_observed_at":"2026-08-07T14:53:01.331949Z","submitted_at":"2025-05-22T15:20:39Z","title":"Single Domain Generalization for Few-Shot Counting via Universal Representation Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.316279Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2505.16778"},"observation_digest":"sha256:418204d1d5c4527d02b1517f64cf9d5ed6121d3bf6aa9253af2f52de3e2cad11","observation_id":"41ac7d0c-10f7-4c94-82b0-dd1517596ae3","resolution":{"observed_at":"2026-08-07T14:58:56.316279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-07T10:26:00.474524Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence.arXiv preprint arXiv:2407.12442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05313","last_updated":"2025-06-05T17:55:16Z","snapshot_observed_at":"2026-08-07T10:19:09.794421Z","submitted_at":"2025-06-05T17:55:16Z","title":"MARBLE: Material Recomposition and Blending in CLIP-Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:00.474524Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2506.05313"},"observation_digest":"sha256:a0fbfa3d22e21e07045b0251721fe34d22c5e36b1ad72572d5c3d221639324cc","observation_id":"8e55e445-7107-4088-b075-769e426d8bab","resolution":{"observed_at":"2026-08-07T10:26:00.474524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-06T17:27:15.609442Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11003","last_updated":"2025-07-15T05:42:17Z","snapshot_observed_at":"2026-08-09T08:21:08.559916Z","submitted_at":"2025-07-15T05:42:17Z","title":"Bridge Feature Matching and Cross-Modal Alignment with Mutual-filtering for Zero-shot Anomaly Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:27:15.609442Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2507.11003"},"observation_digest":"sha256:fdcced241c8cd92802b95b6f82f5c85ccc0f9733ccd384200dc3ed2fd19fc0ea","observation_id":"1a54c288-6e1e-4028-a99c-ad479f2bbcc4","resolution":{"observed_at":"2026-08-06T17:27:15.609442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-05T16:41:45.551955Z","title":"Clearclip: Decomposing clip representations for dense vision- language inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18067","last_updated":"2025-08-25T14:22:57Z","snapshot_observed_at":"2026-08-09T01:30:33.453938Z","submitted_at":"2025-08-25T14:22:57Z","title":"Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:45.551955Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2508.18067"},"observation_digest":"sha256:461d38a0bdbc0941de0e965835dfd2647d45bc293523062c6842d4daa847f300","observation_id":"c1621a8f-eb6d-481f-8c7a-ff0aab5ac66a","resolution":{"observed_at":"2026-08-05T16:41:45.551955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-05T15:18:44.355578Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.355578Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:18a2b612c770cb23c0bfbc5f8421fdeb9a77f394de23f44f2011081ebaa60d6f","observation_id":"603f27bc-08f2-4cdf-ad3a-dea061a70b7d","resolution":{"observed_at":"2026-08-05T15:18:44.355578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":"2407.12442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clearclip: Decomposing clip repre- sentations for dense vision-language inference","venue":null,"work_id":"fac6317c-c0f9-46d7-9fa2-b7941364fe76","year":2024},"citing_paper":{"arxiv_id":"2512.08730","last_updated":"2026-04-22T15:53:23Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-09T15:42:28Z","title":"SegEarth-OV3: Exploring SAM 3 for Open-Vocabulary Semantic Segmentation in Remote Sensing Images","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T23:53:27.350335Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2512.08730"},"observation_digest":"sha256:cb98651c800e5685986fac682f0237370f88aa38feb2bec0d87b30324d781223","observation_id":"8b2aff63-856e-425b-8163-be6df4b3c8f2","resolution":{"observed_at":"2026-05-16T23:53:42.296301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-02T04:33:53.021547Z","title":"Meir Yossef Levi and Guy Gilboa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13660","last_updated":"2026-07-15T10:05:53Z","snapshot_observed_at":"2026-08-06T00:19:12.467067Z","submitted_at":"2026-07-15T10:05:53Z","title":"The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:33:53.021547Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2607.13660"},"observation_digest":"sha256:f224960e9cf2e4910bf54901e1c3f883191b08b146b5c3f6c5c1304034ab4444","observation_id":"33b53525-e1cc-405f-8c12-c178e005f3dd","resolution":{"observed_at":"2026-08-02T04:33:53.021547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.12442/citation-record","integrity":"/paper/2407.12442/integrity","json":"/paper/2407.12442/citation-record.json","paper":"/paper/2407.12442"},"outbound":[],"paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2407.12442."}