{"as_of":"2026-08-18T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74c048449ea60ace12037a18fefc4a7774b9ad29c923b30d40bf4dc643576742","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:17:04.584054Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00395/citation-record","integrity":"/paper/2508.00395/integrity","json":"/paper/2508.00395/citation-record.json","paper":"/paper/2508.00395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.505643Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"428b0393-75c3-40fa-adef-4c20f0d87007","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.304085Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a0bd4cf1340c65b8866c295918905394f57f77f8d0f1f5c80266dc726b0524dc","observation_id":"8632558a-6c95-4da2-a4a8-bc576b5a62a1","resolution":{"observed_at":"2026-08-06T10:17:05.509893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.490891Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"c1e1e6ee-1e78-4cf0-84a9-6d7e72051169","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.308608Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:ce5b6b3a6b3e496f5cdc0352a47dd20f44fd520112cd94d49bec1696f1141dfc","observation_id":"5091dcff-1478-4b3a-bb80-0cd17ec039b8","resolution":{"observed_at":"2026-08-06T10:17:05.496240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.476638Z","title":"Open-vocabulary object detection via vision and language knowledge distillation,","venue":null,"work_id":"403e2b76-5ff5-4570-ac38-3c0da1abc075","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.313112Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:edd7de1b068ebdb88ea77446e30487962fd7db19a71a35e12419bc4adc07d143","observation_id":"7a6abef0-88a1-45b9-ae4d-982f8a17477d","resolution":{"observed_at":"2026-08-06T10:17:05.481344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.463050Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting,","venue":null,"work_id":"342f9be3-eba2-4dd6-b8ab-ff5a14fcbe0a","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.317199Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:08fd36838337707a838977cfc75a7159844a683a669e12f756d28df3605415c9","observation_id":"a36114ee-e4ad-4964-a24e-18cf1af3f39c","resolution":{"observed_at":"2026-08-06T10:17:05.467285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T10:17:04.321912Z","title":"Bert: Pre-training of deep bidirectional transformers for lan- guage understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.321912Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e1be39dc8f792ddf5a030425645a7e53a9970afd8d61b68e35638c4d3dd3adba","observation_id":"c9d6aed8-9ae1-4fe8-94d5-e13d4f1f16ed","resolution":{"observed_at":"2026-08-06T10:17:04.321912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.448409Z","title":"Language models are few-shot learners,","venue":null,"work_id":"e45c3969-774e-4ee6-a17e-8dace38803f3","year":1901},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.326542Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:92913a39d7ed08cd794866f8d7fbd39e697ddbd01852b2c4b2dc957c37bfcee0","observation_id":"90f8933b-f5ac-48ae-8d4f-95003421b66f","resolution":{"observed_at":"2026-08-06T10:17:05.453312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.434197Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"32f5fcba-ab59-4fa9-a412-5c65e5d20b40","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.331473Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:cd76cfb2a1e58a0156b13c26b6fa3c6096be17b863c3f38621ccff1ac9e97533","observation_id":"58e08433-a596-4abc-97d1-4fbd70a97bf5","resolution":{"observed_at":"2026-08-06T10:17:05.438717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.420413Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":"a25d77b4-9bfc-4b9d-9376-fa425bdc7c0f","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.335395Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e9e6e6131f650c789b0fff25f655f739b0a370002acb9748c1fd51681cff7490","observation_id":"91a357cc-5361-4042-9cab-0aae4796dabf","resolution":{"observed_at":"2026-08-06T10:17:05.424974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.339259Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.339259Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e4763c2af2352c0840470c3d4bc940364cf3d4c3fee07291cf98c5bd331be8fa","observation_id":"5055badf-2fd0-4831-a8f8-0efad9fa4632","resolution":{"observed_at":"2026-08-06T10:17:04.339259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.398477Z","title":"Prompt- aligned gradient for prompt tuning,","venue":null,"work_id":"3f1b9483-219c-486f-b6db-5b1a23b24e41","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.342949Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:46aa812f1b2c9d20d3e2b876864ecde90a3a69459ca26405c572c7a8043b33a2","observation_id":"3228aebb-f75e-4380-a41e-cbe3867d2096","resolution":{"observed_at":"2026-08-06T10:17:05.402770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.385565Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":"306cc324-72f0-4ee8-ac4e-aac55378fd45","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.347004Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:56c6e4bc7bd1f578a7746bbbb380050eeba37693c4ee9927050155dcc007f4f6","observation_id":"db157fd6-4d06-43c0-8d8b-40fef442ee9c","resolution":{"observed_at":"2026-08-06T10:17:05.389577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-08-16T15:40:37.414697Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-06T10:17:04.350951Z","title":"What does clip know about a red circle? visual prompt engineering for vlms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.350951Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:7b2828091dadab705abf0f0148d8e05a267efa7a60f1463bd0c8251036da3ae7","observation_id":"b7290177-dbcc-48bf-afe5-da6924556643","resolution":{"observed_at":"2026-08-06T10:17:04.350951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T10:17:04.354989Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.354989Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:dd5f51f1ba6e5431bc6e7a9c9e43cb50a39e8e0110c35169d75caee0c78ba906","observation_id":"329963e4-2f87-4401-b2b4-9ef2f7e2a7f6","resolution":{"observed_at":"2026-08-06T10:17:04.354989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.373276Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":"b089d687-847f-431c-af30-91e9147e63e9","year":2017},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.359337Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f790e2b111704b1046b0b61868986f85a3fe85fb1446a7f23857f5a2524a8e75","observation_id":"843cadba-1961-4b0e-a955-8b8ff549fdb1","resolution":{"observed_at":"2026-08-06T10:17:05.377214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.360371Z","title":"Segment everything everywhere all at once,","venue":null,"work_id":"4aa732b5-529e-441e-8f8b-6bf5e6872e3d","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.363194Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:8b3f504402773b37de0a5e54b13778a727f3471d12bf0c96d93b1e100ed85999","observation_id":"e24704fb-5804-4974-9e33-866322ec62e6","resolution":{"observed_at":"2026-08-06T10:17:05.364420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.348023Z","title":"Plot: Prompt learning with optimal transport for vision- language models,","venue":null,"work_id":"9d70750c-86aa-4640-93bd-67f9a41f8cfd","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.367032Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:44cfb14cbbe080f807337eb25e9b65d1b0ff751d60b6227295bdd30b387f693c","observation_id":"35825a5e-64f2-4e44-9fd9-7bdab9f24535","resolution":{"observed_at":"2026-08-06T10:17:05.352031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.333435Z","title":"Visual-language prompt tuning with knowledge-guided context optimization,","venue":null,"work_id":"fae712a2-a7fd-4f1c-af00-0ec726a0bf54","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.371222Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:8c7a313c99101275521d9d2753fc704c50794cbfa47f1f23b93934c0d53b5f6d","observation_id":"46f1fbb1-31d4-44f8-af18-fda37a12369d","resolution":{"observed_at":"2026-08-06T10:17:05.338638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.320891Z","title":"Texts as images in prompt tuning for multi-label image recognition,","venue":null,"work_id":"8c1d9acb-681e-4518-8bde-36881ca7c522","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.375806Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:ab882a74b0c6e44db4c01a4e051ae8c64e628c588de27613021e6c27b1a7e1d3","observation_id":"49d9db32-b6f5-43aa-9917-b4505847b026","resolution":{"observed_at":"2026-08-06T10:17:05.324937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.308570Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":"f94f2869-fb33-40c9-96e7-882500dffdc8","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.379773Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:4c89f8dbec7a9cf879bc9f7935f45bd2766bf53819b0abbea205c9f281504961","observation_id":"82635ffc-243f-4c9b-82f4-47c61e036c57","resolution":{"observed_at":"2026-08-06T10:17:05.312631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.295761Z","title":"Promptkd: Unsupervised prompt distil- lation for vision-language models,","venue":null,"work_id":"07ab697f-de35-43c1-88dd-7ac512064432","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.383707Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:5c02e8c8ff6a0edede3f6bacfde973ced94b60dfa37beb241d566326a96531f4","observation_id":"b0e24e3e-a9ee-4426-a704-b1ff1a652e5f","resolution":{"observed_at":"2026-08-06T10:17:05.299961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.283423Z","title":"Domain prompt learning with quaternion networks,","venue":null,"work_id":"39984fdb-e4b6-4b43-93f3-75b66d86a835","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.388615Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c35084d4fc029b0140ee5a1b78cf09dbc17279efcede2be4f80c20130bd5a53d","observation_id":"6d88f0fe-861a-4fb3-8a2f-a4e6626333a8","resolution":{"observed_at":"2026-08-06T10:17:05.287465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.270856Z","title":"Generalized domain prompt learning for accessible scientific vision-language models,","venue":null,"work_id":"333393e4-f4e9-4b0e-8349-ced4a4edc095","year":2025},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.392734Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e36817b1eb3c1c780bf5ccad3a48d9b2282191abbe184c667e98b002267aed99","observation_id":"90f0c0a7-e27a-4721-9507-23202a36aa46","resolution":{"observed_at":"2026-08-06T10:17:05.275125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T10:17:04.396669Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.396669Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:9d83d245dba29d372092d423b53f763cecfa11306e390e4d2a4af74bdab46c5d","observation_id":"c204adb9-9f26-4c90-af62-1bd3c7c52e26","resolution":{"observed_at":"2026-08-06T10:17:04.396669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.256710Z","title":"Complementary patch for weakly supervised semantic segmentation,","venue":null,"work_id":"0a1b93e4-fc72-44a6-93be-ffe8d03f3038","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.401135Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:31bd4be5fc32f1217437f37adc4ae99cee99f6c710f2c504a305c69b4dcfd7eb","observation_id":"4af2ae64-23b7-4343-b49c-c0478581c7c7","resolution":{"observed_at":"2026-08-06T10:17:05.261312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.243868Z","title":"Uncovering prototyp- ical knowledge for weakly open-vocabulary semantic JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, OCTOBER 2024 14 segmentation,","venue":null,"work_id":"0e27e248-8316-4235-81b6-516185f3919e","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.405102Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c353609b44172fbf76fe5f4f6f11ff3ec4ff44881d608795f380d6416ecdb4c4","observation_id":"e413f948-1327-4e4b-a2ac-03f051e01a0f","resolution":{"observed_at":"2026-08-06T10:17:05.248356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.231246Z","title":"Attrseg: open-vocabulary semantic segmentation via at- tribute decomposition-aggregation,","venue":null,"work_id":"3f70d90c-77f5-4b88-ab7c-18cc36a6b275","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.408928Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:9a3042ca89d23a4a12e2bb71a3fe0db547611d1285e2a0a76c55923ddaabde41","observation_id":"9fa6da40-f9fb-423f-acfe-880aa7eeeee8","resolution":{"observed_at":"2026-08-06T10:17:05.235429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09813","last_updated":"2023-03-17T07:47:55Z","snapshot_observed_at":"2026-08-16T15:47:29.720774Z","submitted_at":"2023-03-17T07:47:55Z","title":"DiffusionSeg: Adapting Diffusion Towards Unsupervised Object Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09813","snapshot_observed_at":"2026-08-06T10:17:04.412924Z","title":"Diffusionseg: Adapting diffusion to- wards unsupervised object discovery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.412924Z"},"links":{"cited_paper":"/paper/2303.09813","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:d59fadfb729f9da6fff1a6f93ca648c045b763c1d32f108064acace1727f3126","observation_id":"92e5a3c8-82ef-46e7-af4d-a3929db0af43","resolution":{"observed_at":"2026-08-06T10:17:04.412924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00096","last_updated":"2024-01-06T04:10:27Z","snapshot_observed_at":"2026-08-16T15:04:11.564820Z","submitted_at":"2023-08-31T19:34:09Z","title":"AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation","version":2},"cited_work":{"arxiv_id":"2309.00096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00096","snapshot_observed_at":"2026-08-06T10:17:04.776272Z","title":"AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation","venue":"cs.CV","work_id":"68e9bfc3-424d-48f8-9be6-da6bed7f3c2d","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.417946Z"},"links":{"cited_paper":"/paper/2309.00096","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:ad0d6dca7fa2d758aa9b4539d25f4ef1f09dcb29a2f14b0ba629ddb5394e19e0","observation_id":"b6620bff-3b9f-424f-a783-64faa8d8b597","resolution":{"observed_at":"2026-08-06T10:17:04.780664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.218469Z","title":"Probabilistic conformal distillation for enhanc- ing missing modality robustness,","venue":null,"work_id":"c863a23c-3889-405d-9773-afbb3dac36c6","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.422986Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:39384494e98558a225b73f1ec550a6493e391144b49c436033c3e9e844a7359e","observation_id":"ecd0fce9-c3ec-473a-87c9-d5c271454a58","resolution":{"observed_at":"2026-08-06T10:17:05.222713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03799","last_updated":"2025-06-04T10:06:32Z","snapshot_observed_at":"2026-08-17T21:56:46.635785Z","submitted_at":"2025-06-04T10:06:32Z","title":"ConText: Driving In-context Learning for Text Removal and Segmentation","version":1},"cited_work":{"arxiv_id":"2506.03799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03799","snapshot_observed_at":"2026-08-06T10:17:04.757643Z","title":"ConText: Driving In-context Learning for Text Removal and Segmentation","venue":"cs.CV","work_id":"5ee023d9-c9e3-43de-a87b-79ece14b85ae","year":2025},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.427228Z"},"links":{"cited_paper":"/paper/2506.03799","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c0e07c5f462664d813abba243ddf403a52927a51764505f17d379493ee4f11e6","observation_id":"67d5aa8e-f874-4373-bc2a-3b5bcc26b4d2","resolution":{"observed_at":"2026-08-06T10:17:04.762107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01539","last_updated":"2025-06-02T11:05:28Z","snapshot_observed_at":"2026-08-08T06:00:29.569012Z","submitted_at":"2025-06-02T11:05:28Z","title":"G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.01539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01539","snapshot_observed_at":"2026-08-06T10:17:04.738485Z","title":"G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models","venue":"cs.CV","work_id":"45e73a67-a9cc-4736-8423-c56a8d092f9e","year":2025},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.431281Z"},"links":{"cited_paper":"/paper/2506.01539","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a959e58563ea57afa86426386d54b8c3906b1dbe202d8feb88b960f22fafe4ce","observation_id":"1a1a3170-d693-448e-9ce7-18397ec3bc8c","resolution":{"observed_at":"2026-08-06T10:17:04.743285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.206092Z","title":"Fine- grained visual prompting,","venue":null,"work_id":"1af47100-af75-4049-bdf6-a53cbdf61342","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.435654Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:50622c49a44ae0deda9ffc50ffca61fe72bcb73ddc7845e0d5b424111777b2de","observation_id":"b82e79ae-eca6-4195-8f4e-81fa959d533a","resolution":{"observed_at":"2026-08-06T10:17:05.210154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.192887Z","title":"Alpha-clip: A clip model focusing on wherever you want,","venue":null,"work_id":"bd1b7eee-3553-4d68-aa1c-cbdcf574a03e","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.439352Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:76b9007f342349ee4e2e90d812c70b26e33118267d63d9639d53a541e4bd2bd8","observation_id":"33492d0b-5933-4532-80aa-5a9c1a96a1d7","resolution":{"observed_at":"2026-08-06T10:17:05.197312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.180383Z","title":"Vip-llava: Making large mul- timodal models understand arbitrary visual prompts,","venue":null,"work_id":"e38485b4-926f-43b0-bc6c-af700c63aee1","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.444130Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:442584da87fb69d33eee46e7ee49446042eac02e35979c02fcec56ef9b28d3ad","observation_id":"8542b140-649b-4055-9c84-073e34113362","resolution":{"observed_at":"2026-08-06T10:17:05.184585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.168293Z","title":"Learning deep features for discriminative localization,","venue":null,"work_id":"52b4e4ff-3505-4403-bfd3-e9e3c46bd34c","year":2016},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.448496Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:d3fd8af86f62bdf2a7e5dcebb569bd7d7a72416a12e182e30022f509eb6675b0","observation_id":"b8b1a979-c9c9-496f-93cc-c05b53b18b6d","resolution":{"observed_at":"2026-08-06T10:17:05.172186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.155064Z","title":"Weakly-supervised semantic segmentation by iteratively mining common object features,","venue":null,"work_id":"9b4196dd-1010-4d48-b8f7-acd93eeba4d0","year":2018},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.452270Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c8db4b0d81d24dceb8d3f1a35fa16f6d573d16c2e69bf2b4c8146c65de6a3090","observation_id":"8fb1669c-1190-4642-84eb-bd258fe69637","resolution":{"observed_at":"2026-08-06T10:17:05.159498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.142426Z","title":"Learning affinity from attention: end-to-end weakly-supervised semantic segmentation with transformers,","venue":null,"work_id":"ca339a9b-e1ed-4117-9baf-627d73f76173","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.456544Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:5bfd3e6c6e779d29121cdb72369d03b1dfbab2197345198fc10201ff8a4710fa","observation_id":"4cda64fe-3a06-4736-bdd4-f7f7f7211c48","resolution":{"observed_at":"2026-08-06T10:17:05.146563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-16T15:42:11.267112Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-06T10:17:04.461068Z","title":"Seggpt: Segmenting everything in context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.461068Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f156c20159a144306b3daf6c3ca31c3075351c984704af09d8d9aef43d9e69a6","observation_id":"62873a9b-c56b-4f7f-98bf-49240d3e6394","resolution":{"observed_at":"2026-08-06T10:17:04.461068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.129748Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation,","venue":null,"work_id":"cd7b9c7c-922e-42de-a44b-9444e221fce2","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.465117Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:0acf2d5b26b4d902e94b46e21c083082ee845057ca86c9b262af532f0db5422a","observation_id":"6ab70f0f-1fca-49a2-89c9-53fae3069442","resolution":{"observed_at":"2026-08-06T10:17:05.133890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.116466Z","title":"Learning to rank in person re-identification with metric ensembles,","venue":null,"work_id":"ac1d7230-b974-4ece-ab01-dca47dfad3b5","year":2015},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.468964Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:b6fdafafa33b64fbacecf259228da5616b0abbbfb0bc638efa0c3baec316cb58","observation_id":"f897479b-681a-4a5c-b383-0389db5b1d4b","resolution":{"observed_at":"2026-08-06T10:17:05.120661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.104115Z","title":"Large-scale unsupervised semantic segmenta- tion,","venue":null,"work_id":"ab154ca1-5fb7-4a42-aa0e-07f56d5497ef","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.472820Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:94272ace8e0ebe2f2d9061db351f69aa4110e2f7cb8531de3e6f17d368422ecf","observation_id":"db7a3e62-8145-44e6-ad75-38f22b6a476f","resolution":{"observed_at":"2026-08-06T10:17:05.108147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.090789Z","title":"Learning gener- ative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":"ec46e240-5d1f-428e-af7d-d41f8758f7c5","year":2004},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.477223Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:d07b78f33a8d54975b10516c1c825cc682d9219e4e69fd3c180dfc246379e814","observation_id":"51d94a14-c22e-4cf8-8d4e-fb8564735adc","resolution":{"observed_at":"2026-08-06T10:17:05.095104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.077431Z","title":"Cats and dogs,","venue":null,"work_id":"23391b04-b54e-416b-b6cd-8aa686ada7c7","year":2012},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.481228Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3a9cd598b468da87ce6cab097b1c1872675cf2e78eee4d02fba6d8bcfebaa085","observation_id":"96dfb658-8e52-4658-9f1f-fa98c5429d56","resolution":{"observed_at":"2026-08-06T10:17:05.082054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.064879Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":"0eb665e7-548b-402a-93ec-d9059ce49e89","year":2013},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.485227Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:dea52832961fa1bcf0ef5f82e0d2753104fd76d12296ccfabed9e4102785e6f2","observation_id":"cca6fbb5-1cef-48ef-bde5-d3b86b3ea342","resolution":{"observed_at":"2026-08-06T10:17:05.069197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.051681Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":"5e0cd358-1819-4bf9-bf4b-6f9e3b768560","year":2008},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.489561Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:1525762d4ce81da79c5968f5252462cc55fca04eb9b79441620ad85b9ee48a72","observation_id":"0ee894b3-fc2d-445d-ad8e-cf3b15845764","resolution":{"observed_at":"2026-08-06T10:17:05.055872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.039056Z","title":"Food- 101–mining discriminative components with random forests,","venue":null,"work_id":"0683c8a8-135f-4ac1-b337-2819e50cdf64","year":2014},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.494173Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a5824a9806540995d736eec829f67760347f4c9b893911292978a1bd08962df6","observation_id":"76fce46b-8fed-46d9-abb2-da05f5de353f","resolution":{"observed_at":"2026-08-06T10:17:05.043246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T10:17:04.498073Z","title":"Fine-grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.498073Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f26891397e5749f86ac33c9c31992344fc03ad9c076b7bee1578771c1d9e3c0f","observation_id":"83a4b08d-0b25-40ff-98b6-030db720cfd3","resolution":{"observed_at":"2026-08-06T10:17:04.498073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.025586Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":"1c2af3b2-b2c4-4f74-8e7f-d40dfc606a53","year":2010},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.502419Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:aefd11ff49cb10b91d846a2062bfa5f1ab3764a6f8aed76e628b9444e51ffa63","observation_id":"61aa026d-264a-4c8e-8270-78b07e5d8c37","resolution":{"observed_at":"2026-08-06T10:17:05.029654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T10:17:04.506212Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.506212Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:9ebae977aeb619a2c0d0fb63648e23f94bdf6e5821242ec260df1427889625f5","observation_id":"15b3c7cf-32bf-4421-a999-6458a82b8657","resolution":{"observed_at":"2026-08-06T10:17:04.506212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.012255Z","title":"Describing textures in the wild,","venue":null,"work_id":"28b79496-3870-4c05-8ad4-a406f84b067a","year":2014},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.510226Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:2c1410f416055d016308901ba3108d599a043f7f72bf996d18fd6f8c17e75fad","observation_id":"6b19a19f-c70a-4145-a876-69db582470c6","resolution":{"observed_at":"2026-08-06T10:17:05.016654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.999745Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":"b67e2366-89c4-4622-9792-e15aa775d4e3","year":2019},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.514270Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f1e73aa829e66feee73cfa67cf9b2de506de531a43284e401be506931458b3f3","observation_id":"20d35196-5701-4bce-a800-efb767c63838","resolution":{"observed_at":"2026-08-06T10:17:05.003783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.987068Z","title":"Do imagenet classifiers generalize to imagenet?","venue":null,"work_id":"8c2f6059-1a19-41af-a359-03504549a0c5","year":2019},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.518111Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:6ceb73d205401d8fc74bed9ce25d2acbb944764c9b824399bdeb20658e75cd6f","observation_id":"5545c0cd-1845-46b0-b809-fb4eab9fe644","resolution":{"observed_at":"2026-08-06T10:17:04.991215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.974670Z","title":"Learning robust global representations by penalizing local predic- tive power,","venue":null,"work_id":"e553d814-ce1d-4a68-a655-db8f80702025","year":2019},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.521878Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:63ea5e88be9294e9af0f04acdcecf8f7c56a9954194f1d8689cfe596d955e414","observation_id":"3449f01d-c8dd-409c-ae09-de7eeeb76181","resolution":{"observed_at":"2026-08-06T10:17:04.978756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.962041Z","title":"Natural adversarial examples,","venue":null,"work_id":"08646465-6ec1-47ab-89c9-9904e45ca764","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.525848Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:2c2885304caa71dc4eaa7c4849fdf149af987749ade61e9260c1bd7637ba5484","observation_id":"9b1975b8-52e7-4d5d-8696-db0ea5345977","resolution":{"observed_at":"2026-08-06T10:17:04.965947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.948726Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":"a6fe453c-39dc-4f13-93e8-779a4782c971","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.529566Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:7254b3aa0dd88c787ed608d5624c6d88257320ead6178401d3cfb36083ff180d","observation_id":"3a502d18-e5fc-4cfc-ae0d-415ddd33f752","resolution":{"observed_at":"2026-08-06T10:17:04.952874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.935753Z","title":"Blip-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"c6fe3adf-463a-48f6-a471-2fc5788b5c72","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.534064Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:97a72598bcaa70bba18fa688e79296749a10665f4ad8b0228f576158e8bede1c","observation_id":"3c2b402b-3c24-4b85-a875-0c30f15ac9d9","resolution":{"observed_at":"2026-08-06T10:17:04.940251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.922004Z","title":"Deepcore: A comprehen- sive library for coreset selection in deep learning,","venue":null,"work_id":"d22b78bd-363a-4bab-89c9-f8518f125c57","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.538609Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a55d12e791cadd7d46be961eb7edeb85333149fc9078800cd43aa64b83ccf67c","observation_id":"7bec0db0-b627-4e0c-8a1b-958301d1a790","resolution":{"observed_at":"2026-08-06T10:17:04.926640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.907660Z","title":"A combinatorial strongly polynomial algorithm for minimizing submod- ular functions,","venue":null,"work_id":"84dce8ce-b2e6-4e1e-baa2-1c6fc246b06a","year":2001},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.542423Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:1a8280ab8965c6ac76451d23e37fc7dda8f7c114c012171aee575e88f8f4ec44","observation_id":"55cd18a0-5646-4caa-96ee-c4dce0946636","resolution":{"observed_at":"2026-08-06T10:17:04.911820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11829","last_updated":"2020-10-27T00:52:20Z","snapshot_observed_at":"2026-08-15T14:35:34.584882Z","submitted_at":"2019-06-26T23:01:47Z","title":"Selection via Proxy: Efficient Data Selection for Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.11829","snapshot_observed_at":"2026-08-06T10:17:04.546588Z","title":"Selection via proxy: Efficient data selection for deep learning,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.546588Z"},"links":{"cited_paper":"/paper/1906.11829","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:28f4f462bd01c871938faf4940c33ba8c4577d89c58d8580ee4aedf1106bf752","observation_id":"4d154144-7ada-4e10-bd63-a14f107b3b9b","resolution":{"observed_at":"2026-08-06T10:17:04.546588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.894768Z","title":"Glister: Generalization based data subset selection for efficient and robust learning,","venue":null,"work_id":"9b8e2b66-52e3-415a-bf9b-23f4787cf52e","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.551460Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c70d16cf7e88d05ec4c59a0780a08f030cdc976ce0a096500fbc0e65928b2672","observation_id":"903a19b4-b084-4cf0-92df-b3a8b943b177","resolution":{"observed_at":"2026-08-06T10:17:04.898942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.881646Z","title":"Deep learning on a data diet: Finding important examples early in training,","venue":null,"work_id":"43ca53ff-ab43-4ef3-a600-82a2ea5fe82a","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.555307Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:662c67bf5c9445d61037f61ace4289953c2067cc0095847bc0d4df1b1f583100","observation_id":"99b34c44-5825-411c-b2f1-7b5efc6b5924","resolution":{"observed_at":"2026-08-06T10:17:04.886054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03764","last_updated":"2021-09-08T16:40:18Z","snapshot_observed_at":"2026-08-16T17:58:01.411236Z","submitted_at":"2021-09-08T16:40:18Z","title":"Active Learning by Acquiring Contrastive Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03764","snapshot_observed_at":"2026-08-06T10:17:04.559004Z","title":"Active learning by acquiring contrastive examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.559004Z"},"links":{"cited_paper":"/paper/2109.03764","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:0a30eecdf8e974c55cdbe469559c7809e0ba4df1e06db1876c6d3d0912537f1b","observation_id":"601c9ab7-57e0-48d3-b90f-955fa93aa16d","resolution":{"observed_at":"2026-08-06T10:17:04.559004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.868284Z","title":"A survey on label- efficient deep image segmentation: Bridging the gap between weak supervision and dense prediction,","venue":null,"work_id":"28640b8c-88b9-402d-ae8e-d4419cf56e3e","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.563379Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f52412a83f1d2a81ae0de7ab0123d383f56d89188dbe98fcf361ce2929938ad2","observation_id":"2402a63d-9b96-4615-8a1b-c9b39f7476be","resolution":{"observed_at":"2026-08-06T10:17:04.872609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17225","last_updated":"2023-03-30T08:42:49Z","snapshot_observed_at":"2026-08-16T15:44:08.817605Z","submitted_at":"2023-03-30T08:42:49Z","title":"FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation","version":1},"cited_work":{"arxiv_id":"2303.17225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17225","snapshot_observed_at":"2026-08-06T10:17:04.653645Z","title":"FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation","venue":"cs.CV","work_id":"a46e4d2b-4846-4d69-bd23-4885642cab5c","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.567254Z"},"links":{"cited_paper":"/paper/2303.17225","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:78b34a623278b7f777b5dc108005c94475c7085a9130bc116c18391728649095","observation_id":"e7e731e8-eed8-44f6-9dd0-1ce37b11096b","resolution":{"observed_at":"2026-08-06T10:17:04.659799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04356","last_updated":"2023-12-12T06:36:53Z","snapshot_observed_at":"2026-08-16T15:25:51.772160Z","submitted_at":"2023-06-07T11:39:56Z","title":"Fine-Grained Visual Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04356","snapshot_observed_at":"2026-08-06T10:17:04.571789Z","title":"Fine-grained visual prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.571789Z"},"links":{"cited_paper":"/paper/2306.04356","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a6bb4ac70ad1f9ac3dd1fcc4bc86daf6ad9630cb5da600bf384a241fdd896970","observation_id":"0276194c-b1d0-4698-9f5e-68a15d521121","resolution":{"observed_at":"2026-08-06T10:17:04.571789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-17T18:58:45.514336Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-06T10:17:04.575798Z","title":"Distributionally robust neural networks for group shifts: On the importance of regularization for worst-case generalization,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.575798Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f008b7942159524223bc4f756ae43842ef2a9c350f500999f7330a00d87210ac","observation_id":"95fb7e37-6ce4-43ab-8e00-532a4ecd17e2","resolution":{"observed_at":"2026-08-06T10:17:04.575798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.854431Z","title":"A compre- hensive study of image classification model sensitivity to foregrounds, backgrounds, and visual attributes,","venue":null,"work_id":"fcdaffa6-289b-4e2a-91d6-3834e4dac71f","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.580142Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:8b3ab2a43f513a5adb5161005b01a5f9e57540738d7c180308f7399e5b1b644a","observation_id":"8f8c706e-e85d-4188-81c3-27907f1e66ae","resolution":{"observed_at":"2026-08-06T10:17:04.859296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09994","last_updated":"2020-06-17T16:54:43Z","snapshot_observed_at":"2026-08-14T12:00:40.095980Z","submitted_at":"2020-06-17T16:54:43Z","title":"Noise or Signal: The Role of Image Backgrounds in Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09994","snapshot_observed_at":"2026-08-06T10:17:04.584054Z","title":"Noise or signal: The role of image backgrounds in object recognition,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.584054Z"},"links":{"cited_paper":"/paper/2006.09994","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c26ca0db2e89db38219e50b393f83539731e085c93def761d1c97aecef1d5e32","observation_id":"4b4cec6f-1885-4c62-aeb6-936a2a2d803c","resolution":{"observed_at":"2026-08-06T10:17:04.584054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T18:59:12.228906Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":4,"verified_fuzzy":50},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2508.00395."}