{"as_of":"2026-08-11T02:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1adb8f7a157aa04d3214dd2328449190b41c51e6eaed1184130910d3c7e6d42","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:18:47.795677Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T09:04:34.878288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T09:05:20.226087Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":"2508.20265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20265","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plataniotis","venue":null,"work_id":"a23378aa-1a3a-4480-807d-d0125c060f65","year":2025},"citing_paper":{"arxiv_id":"2604.18591","last_updated":"2026-03-18T08:09:51Z","snapshot_observed_at":"2026-08-08T22:08:23.393241Z","submitted_at":"2026-03-18T08:09:51Z","title":"SPRITE: From Static Mockups to Engine-Ready Game UI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T09:04:34.878288Z"},"links":{"cited_paper":"/paper/2508.20265","citing_paper":"/paper/2604.18591"},"observation_digest":"sha256:b0981357863c14ed40f632e6d8108a2ce5c889e1083d13e5819120597465c57f","observation_id":"455d405c-e5f4-4a8b-9932-a6ff6e07a076","resolution":{"observed_at":"2026-05-15T09:05:20.228294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20265/citation-record","integrity":"/paper/2508.20265/integrity","json":"/paper/2508.20265/citation-record.json","paper":"/paper/2508.20265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T15:18:42.285589Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.285589Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:460087a4028904245493d630e3a7695ec9be5a8f82ddb33bb31e8a00f5523021","observation_id":"4c8f8402-7d7d-4fb7-813c-9a15ff75e70f","resolution":{"observed_at":"2026-08-05T15:18:42.285589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00878","last_updated":"2023-12-14T11:24:46Z","snapshot_observed_at":"2026-07-06T16:55:49.813116Z","submitted_at":"2023-12-01T19:06:12Z","title":"Grounding Everything: Emerging Localization Properties in Vision-Language Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00878","snapshot_observed_at":"2026-08-05T15:18:42.385138Z","title":"Grounding everything: Emerging localization properties in vision-language transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.385138Z"},"links":{"cited_paper":"/paper/2312.00878","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:99110ea6ac9e16cdf2a2b3c1fca07d0d03047b416ea36f3e3c873048ebd96dd9","observation_id":"1e99a581-e5d0-4226-b63f-5398805a4cd3","resolution":{"observed_at":"2026-08-05T15:18:42.385138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.770128Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"b06846d9-adc2-49d6-9cb5-5edbe5bfc099","year":2018},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.463919Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:a15336323d4ef3b460f4052af4b44990a5531551f71f761d9a7240975b191d4f","observation_id":"53fe491c-f44d-4167-9462-0a41a3881163","resolution":{"observed_at":"2026-08-05T15:18:57.773962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.758724Z","title":"Cascade r-cnn: Delv- ing into high quality object detection","venue":null,"work_id":"059de378-4451-48fd-b5f2-8620f855b9c6","year":2018},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.550235Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7c4c6255e23d7308725c6ae9fe93a3fded736baf6188cdd42f750f38eaa33f52","observation_id":"825aead8-d9ed-4931-aa78-403c170de4d1","resolution":{"observed_at":"2026-08-05T15:18:57.762350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.746694Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c957c38c-c2ba-46d1-a22b-909d04639618","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.644743Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:faa5709bb06b5fb100a1329e2fdcf973cd3cc8443c0fe7af0bd9dffeedd378ae","observation_id":"503c34d5-f7e9-456d-93c8-ea29ce84987c","resolution":{"observed_at":"2026-08-05T15:18:57.750623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.734090Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":"5ad93665-a4e3-4f48-91f8-de3cc9b2e594","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.755748Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:50916264537a7183a78fb64875069a4464a2860f39ae86ceb3e13ded36d2d189","observation_id":"63b5cf86-6f0a-4a67-a5fc-fe790ec0dd48","resolution":{"observed_at":"2026-08-05T15:18:57.738599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.720957Z","title":"Exploring open-vocabulary semantic segmentation from clip vision encoder distillation only","venue":null,"work_id":"e31fa0de-94a4-425c-9cd3-c0f5b0a06245","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.832122Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:23d23454234179de98d88272dccb134da6000788f788d7ae9d7f3d643552c559","observation_id":"2f289abe-a247-47f6-b01b-bf08837be19c","resolution":{"observed_at":"2026-08-05T15:18:57.725300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.708518Z","title":"A simple framework for contrastive learn- ing of visual representations","venue":null,"work_id":"117de4cd-e4da-4837-9702-521e96b377be","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.905767Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:51058f7e5db1cdb2eb864494f95a1f6713bac1a934807083c71f91a9167ab0d9","observation_id":"958a5d45-d0db-4db2-8a6d-c04114790529","resolution":{"observed_at":"2026-08-05T15:18:57.712264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.695136Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"6a2891cb-fda5-4394-ba07-2c4ad8bee146","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.015369Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:76e6ade4551cffd80135cc97e7e421cd4312f434a05bb0878509a9e338c60470","observation_id":"5b0f5a70-6349-4a51-9dcc-f9babf4c1aed","resolution":{"observed_at":"2026-08-05T15:18:57.700275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.682826Z","title":"All at once: Temporally adaptive multi-frame interpolation with advanced motion modeling","venue":null,"work_id":"aea83951-89bc-40d8-90b1-b9b5ec3da9e5","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.121151Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:ca3b4808d14125374d37b718187d050d55bd6eef1c8ef968b8104b25adb9e73a","observation_id":"91429799-8732-4d90-89ec-5092f0aac9ee","resolution":{"observed_at":"2026-08-05T15:18:57.686648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.654978Z","title":"Test- time fast adaptation for dynamic scene deblurring via meta- auxiliary learning","venue":null,"work_id":"5211d1ff-d020-40b6-80b9-ceee25698df1","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.228506Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:d83b45f0b207c0342d2bc2581b77dfdaf02be0efaa99e44a22e2e993ff7bb5c5","observation_id":"26d84858-cf1a-45a9-9a66-0e9ac278fc57","resolution":{"observed_at":"2026-08-05T15:18:57.674316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.436649Z","title":"Adapt- ing to distribution shift by visual domain prompt generation","venue":null,"work_id":"bdcca62b-05e2-443c-8183-cfa201ab2b70","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.299602Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:54c3abaa5c66b1c1772b2e4e4f96fb63404e78390c4062e51f4cf39893ee85c5","observation_id":"e66c17d7-8f9d-44da-9760-51f451da07a9","resolution":{"observed_at":"2026-08-05T15:18:57.543871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17307","last_updated":"2025-06-18T03:49:22Z","snapshot_observed_at":"2026-08-06T23:59:52.952407Z","submitted_at":"2025-06-18T03:49:22Z","title":"Learning to Adapt Frozen CLIP for Few-Shot Test-Time Domain Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17307","snapshot_observed_at":"2026-08-05T15:18:43.364366Z","title":"Learning to adapt frozen clip for few-shot test-time domain adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.364366Z"},"links":{"cited_paper":"/paper/2506.17307","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6e34cbab8f7a441ece9ed3d0e3eca0b1c79778e66f413cc916a2d98e8ef6f95b","observation_id":"919d2c6c-5556-4503-af56-b14b3b72d9b1","resolution":{"observed_at":"2026-08-05T15:18:43.364366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.406423Z","title":"Mmsegmentation: Open- mmlab semantic segmentation toolbox and benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.406423Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:43074d56ee3850dbd3a2f1bdd225a1b2da9558ffa3db8e2c09b76e2bac501f58","observation_id":"da6b2e51-d392-442d-9ae2-565e777873b1","resolution":{"observed_at":"2026-08-05T15:18:43.406423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.300508Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"3cde9486-4219-443b-b064-0a942462ea7b","year":2016},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.479890Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:c24e57a5e016b6486b7aaf3e410ebb2295fb5acab17163cbac376176e3a01e63","observation_id":"c4b94bda-7e23-4e03-b6e6-f96e1ae3b0b9","resolution":{"observed_at":"2026-08-05T15:18:57.409083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T15:18:43.575743Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.575743Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:e36d520f17cafd6c7371ca92c7bc283a1e0f932ecaf53bc3bb87cfeef718fbec","observation_id":"8ae0564f-4689-4d09-a9df-c64dc7ae4086","resolution":{"observed_at":"2026-08-05T15:18:43.575743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.095764Z","title":"The pascal visual object classes challenge 2012 (voc2012) development kit","venue":null,"work_id":"a47dbe1f-b0dd-4964-ae23-6c3939a93d2e","year":2012},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.688272Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f119c7e22ffd357f8c7de334c1c9d00f948a41a6d57e2d50d18f4b3ba9c10e49","observation_id":"b3c67d09-6874-42af-b016-0727b79101eb","resolution":{"observed_at":"2026-08-05T15:18:57.199905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:56.844278Z","title":"Bootstrap your own latent: A new ap- proach to self-supervised learning","venue":null,"work_id":"63fa37d1-860b-4f6c-ba79-8d116681a194","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.781342Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:225ca63681e32ca6d796d27a183da1277226704628588477f0765726f41ff17c","observation_id":"a3c26533-838f-4a27-b39b-66b72f3cb032","resolution":{"observed_at":"2026-08-05T15:18:56.954334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:56.301097Z","title":"On calibration of modern neural networks","venue":null,"work_id":"2c66875c-468f-47fc-98bd-fd6a5a492fb6","year":2017},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.858372Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6234c49e3ec5bcd8bacd740128b74a88e94e8a77244d669a8cedcd512ab48827","observation_id":"0eff3dce-0df9-4571-a3a3-2f193065a986","resolution":{"observed_at":"2026-08-05T15:18:56.628099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.976457Z","title":"How to train the teacher model for effective knowledge distillation","venue":null,"work_id":"4e550b1e-b731-4c97-bce2-87db3f2f1b70","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.906917Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:0592b094e359e587ac858d9c77aa60a8f7f2fb24dd96bd17419010eb84577dba","observation_id":"abf92fe5-a9f0-467d-8fa1-65202325a0f4","resolution":{"observed_at":"2026-08-05T15:18:56.081935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.749310Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"b6c1a1d7-2c9f-42d0-9277-29b61b6bed10","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.987085Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6a3b110fdc4db5f7cca12ae3e9761518bb2e26f5f02d2e5eba51c908502f4c1e","observation_id":"c589d13c-8665-4f67-b4ac-e7ae8471392e","resolution":{"observed_at":"2026-08-05T15:18:55.844000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T15:18:44.061490Z","title":"Distill- ing the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.061490Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:33c8bd00eef1c83e5855324f0197407664d80b4627ff617c8428ed0e812ae31e","observation_id":"3a9d5026-064e-408e-9590-07429dadc2ef","resolution":{"observed_at":"2026-08-05T15:18:44.061490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.133792Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.133792Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:057ee034975af2977dab08ab3d5181c0209b1a45fee137586da99ebfde917922","observation_id":"b2b6651f-36af-44d1-9fd9-7d475ff6ea85","resolution":{"observed_at":"2026-08-05T15:18:44.133792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.395159Z","title":"Weakly supervised ground- ing for vqa in vision-language transformers","venue":null,"work_id":"384f03e5-52ec-4da6-ac67-baae95495c69","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.204473Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:fa880909611f3082e3e03dd763217daa8b7aef7b2687bdd754b618d587963a89","observation_id":"02215da3-bd15-41e9-8684-68c833753649","resolution":{"observed_at":"2026-08-05T15:18:55.559972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T15:18:44.277725Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.277725Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:104e6b585e7447fc34cb565c604c7332e2bbd8f23a584c731cc89fe9b8c5eb68","observation_id":"5984d493-cf17-41a8-91d1-a81ce13eb5b9","resolution":{"observed_at":"2026-08-05T15:18:44.277725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-08-09T10:53:08.139522Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-05T15:18:44.355578Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.355578Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7debf30572ed89d94eb8220a85b128cab83c898c4cb9d94ab16c60664209ca55","observation_id":"603f27bc-08f2-4cdf-ad3a-dea061a70b7d","resolution":{"observed_at":"2026-08-05T15:18:44.355578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04883","last_updated":"2024-08-09T06:17:00Z","snapshot_observed_at":"2026-08-06T04:42:43.823313Z","submitted_at":"2024-08-09T06:17:00Z","title":"ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04883","snapshot_observed_at":"2026-08-05T15:18:44.439993Z","title":"Proxyclip: Proxy attention improves clip for open-vocabulary segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.439993Z"},"links":{"cited_paper":"/paper/2408.04883","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6f5513e3e869a250a9f960651a59634679053ebfb588ea445c77947c98b08482","observation_id":"0fb55852-2750-47b3-94b2-6378990cdffd","resolution":{"observed_at":"2026-08-05T15:18:44.439993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.113416Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"f243af3a-fa71-4da7-ae9b-6453091be93b","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.544507Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:8810661557fe0599036601dd18287d2e46faf688a00283da2bbaaa8a4e24285c","observation_id":"3a4bae03-dc9e-46da-aa3f-2f522202a075","resolution":{"observed_at":"2026-08-05T15:18:55.261872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05653","last_updated":"2024-09-16T09:10:00Z","snapshot_observed_at":"2026-08-10T13:07:09.026586Z","submitted_at":"2023-04-12T07:16:55Z","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05653","snapshot_observed_at":"2026-08-05T15:18:44.610754Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.610754Z"},"links":{"cited_paper":"/paper/2304.05653","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:fcfad0d8ff036e9d1e199cda6ed979ed1333aee0b3cda2638b1bd1a612af4b96","observation_id":"cff859a8-04cd-4ba5-852a-da86b2977f00","resolution":{"observed_at":"2026-08-05T15:18:44.610754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.897485Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"8ee82ae9-1f47-401d-bac7-fb68db20e279","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.684723Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:22cd1c7440251532a840993a8d6997596972176017c9bcc2d097d2d7632f90f0","observation_id":"cfa6775c-8685-4c5a-8234-14510cf58537","resolution":{"observed_at":"2026-08-05T15:18:55.010279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.562044Z","title":"Self-supervised spa- tiotemporal representation learning by exploiting video con- tinuity","venue":null,"work_id":"260ed1f5-380f-4f2d-8c56-3333729a9dcf","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.761125Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:a0cf20a42d635ae4f13ac4746c0f4a8b18393e055f54838bab596d0f697159a5","observation_id":"392ca7c1-e396-456a-ae19-ff6534184b32","resolution":{"observed_at":"2026-08-05T15:18:54.716306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.311815Z","title":"Refinenet: Multi-path refinement networks for high- resolution semantic segmentation","venue":null,"work_id":"cbee0295-3648-476d-8974-fc7be1123043","year":1925},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.831199Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7596fee5fbcd1e2efc4a8fe44cad15c0069fa174691a12b053ea92bea0817d31","observation_id":"62771230-047f-4d51-91dd-3e3821d72f1b","resolution":{"observed_at":"2026-08-05T15:18:54.431218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.033098Z","title":"Few-shot class-incremental learning via entropy-regularized data-free replay","venue":null,"work_id":"d40600d7-fee0-4a2b-9d4c-6217c115bf1c","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.937846Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7c408425068dabd40b0b771851f78b0349c67e5394da7e1802eafb1c826c9d0a","observation_id":"99b9f23d-256b-4135-937e-fe73f395562c","resolution":{"observed_at":"2026-08-05T15:18:54.139437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.798360Z","title":"Meta-auxiliary learning for future depth pre- diction in videos","venue":null,"work_id":"b0b53a00-d633-4baf-851d-50717ff2bd40","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.014092Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:015e384f5e6fd25de1110e6819af40bec307cbba3792b63572489dafaed21f9c","observation_id":"e9f1c4a2-1f2c-415f-a16f-5dfc700ad698","resolution":{"observed_at":"2026-08-05T15:18:53.911814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-05T15:18:45.100187Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.100187Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:d12cb6dd3ba6268fc896f4584cb47e6b7855c8ebff8e85423e4ddac10b65cc87","observation_id":"3c652007-8bbb-467f-bb70-c46512418adb","resolution":{"observed_at":"2026-08-05T15:18:45.100187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.548117Z","title":"Ttt++: When does self-supervised test-time training fail or thrive? Advances in Neural Information Processing Systems , 34: 21808–21820, 2021","venue":null,"work_id":"cb11b1e2-443d-46cd-8dea-1a9146249dd5","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.197884Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:78272b358ce3e1a196ca940eb6277ee84c84fb75f7838acb5b57045fffd7562a","observation_id":"4bce4cd7-1536-4056-a57a-70ff3e4e9566","resolution":{"observed_at":"2026-08-05T15:18:53.672703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.500114Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"09f57d6f-ef64-4881-bf3b-6c65d89123bc","year":2014},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.304968Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:36fe2ce69e348ee41b61dc8a8519701ddf4c0608157df7fbab8001dce9a01b39","observation_id":"61f4784f-b55d-4b31-95e5-164c86bfcfd0","resolution":{"observed_at":"2026-08-05T15:18:53.535910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.253388Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":"6d9c9495-283d-4b2c-b668-66649776687d","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.416190Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:405486bb108e9711bd03cc4bae34a121f1ad5fa8587d046cc29bc46335a445e1","observation_id":"c899dbd3-7563-4cf7-968b-9126c882c740","resolution":{"observed_at":"2026-08-05T15:18:53.367629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T15:18:45.489307Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.489307Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:36928f8796b666ac212d21f082c8fd72d1864ba56ee9b8fd3897e8a4b39aef9b","observation_id":"c02d1780-a156-4c57-8abd-f17f04a570e6","resolution":{"observed_at":"2026-08-05T15:18:45.489307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.980074Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"38e83dec-27b2-40aa-8665-250e1e052bd7","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.559026Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:daca2972ea3704974a0e6038a7cc55a131561578f4987ffd853457eae2e86885","observation_id":"aa78c7fe-3489-4e73-a576-e598d8fe16bc","resolution":{"observed_at":"2026-08-05T15:18:53.094673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.738204Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"9ab45c80-99f4-4bb6-800a-f23825b92840","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.626186Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:a260ac7a7da350030c79ee13c22b423966632868bc8667c9119dc5096a6d8300","observation_id":"aede51ec-74e4-4696-9490-7ca4316bd5b8","resolution":{"observed_at":"2026-08-05T15:18:52.860246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.501886Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"bbaf75a1-1434-4476-b8e2-6899b35a5e76","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.699685Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:bbe122b09a54237b7dec594d69a8ada37a9dc8611d9f206f1013e47ac1fcfbcd","observation_id":"3ef7b6bd-ae45-4403-8b87-a44c258b55c3","resolution":{"observed_at":"2026-08-05T15:18:52.629830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.265095Z","title":"Test-time training with self- supervision for generalization under distribution shifts","venue":null,"work_id":"6586e8c9-7878-4b11-ac14-6a95b013987a","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.769552Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9cb4b8fe765ee406b8afa9973d022574cfee9d1707cf076fec7c96e81a11b00e","observation_id":"c192cda1-503a-4fb6-94a5-a98e27c5e50c","resolution":{"observed_at":"2026-08-05T15:18:52.379024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-05T15:18:45.818485Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.818485Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:1ad6fb47df03f504411c1959e9893b27cef062c578607f24aaf7d09bd7e4279a","observation_id":"3b23de30-b662-4ab4-95a7-07f31bbaae39","resolution":{"observed_at":"2026-08-05T15:18:45.818485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.032079Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":"cb884792-5c8e-49a3-ade5-ee673f1b471e","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.884601Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:94f5819da70b150efac69b6ae97c9b7d2a67bd065bd5eb07aa927a2fd204e861","observation_id":"01407358-22be-474e-b0ef-b08a94f818ba","resolution":{"observed_at":"2026-08-05T15:18:52.144342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-07-06T16:56:21.561513Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-05T15:18:45.993153Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.993153Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:b5144b9aea60c38e18210e28839e8019685311c9e43b8e08d9266e59ac8956c6","observation_id":"e2bf5ff8-3e61-47e1-87bc-2b01717e3ca2","resolution":{"observed_at":"2026-08-05T15:18:45.993153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.857429Z","title":"SAM-CLIP: Merging vision foundation mod- els towards semantic and spatial understanding","venue":null,"work_id":"dad894ea-46af-4400-b495-5f5677e0390b","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.079912Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9a60f8d8a0e79fd459ad74d11661043f6ed2ce4e37cc808848cf09c40b28b822","observation_id":"97e1706f-286a-437f-8223-9b9b0c14d122","resolution":{"observed_at":"2026-08-05T15:18:51.962413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.619765Z","title":"Distribution align- ment for fully test-time adaptation with dynamic online data streams","venue":null,"work_id":"d6e73f8c-17ff-4e65-93bb-0c56e0a39bef","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.140194Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:2bb4c0ff518d36ed87e6d01be415866de0ef5fe17acc07b89ca8d6a5626830ea","observation_id":"6c6bbe76-ec2d-4cda-a6e5-d46a983f1f02","resolution":{"observed_at":"2026-08-05T15:18:51.733788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.441549Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"8694d059-3582-499d-a9be-35df556504fa","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.209486Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:34644fe763e2472b5f3667ba3753bbc9094bb0657b0971d154779709c34a064b","observation_id":"9f9b4050-7074-4a82-82f4-2fb4c125ee8c","resolution":{"observed_at":"2026-08-05T15:18:51.506714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-05T20:11:45.942545Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-05T15:18:46.285386Z","title":"Clipself: Vision trans- former distills itself for open-vocabulary dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.285386Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:674408cd57ed9c8f9eed5e0f90d62c568e69596ff737f4b14837a18ffad0bf7d","observation_id":"11049448-0be3-4165-b231-f11384954726","resolution":{"observed_at":"2026-08-05T15:18:46.285386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.222341Z","title":"Metagcd: Learning to continually learn in generalized cat- egory discovery","venue":null,"work_id":"500f4458-2045-40c5-b4fe-2956ba38b309","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.346372Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:841f9daf3268d5358fd7df6603469ccb9c21adc7e84aedde4086ef617765d880","observation_id":"452a3e49-6ddb-4fe7-9bd4-21b489b43d46","resolution":{"observed_at":"2026-08-05T15:18:51.300948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.996155Z","title":"Test-time domain adaptation by learning domain-aware batch normalization","venue":null,"work_id":"a2b82fda-a2d1-4d9d-9182-a35b9c8fdd7f","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.443600Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:11e7147494fb6636683f2ec3680082464ff36b95063f829e70e7ac35d3bd9167","observation_id":"767de156-5785-431c-866f-2d0550357d28","resolution":{"observed_at":"2026-08-05T15:18:51.105747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12359","last_updated":"2024-03-27T10:18:04Z","snapshot_observed_at":"2026-08-10T01:21:49.854534Z","submitted_at":"2023-12-19T17:40:27Z","title":"CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12359","snapshot_observed_at":"2026-08-05T15:18:46.555130Z","title":"Clip-dinoiser: Teaching clip a few dino tricks.arXiv preprint arXiv:2312.12359, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.555130Z"},"links":{"cited_paper":"/paper/2312.12359","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:4b26e5b09af2f75b5822031a4b0a38e895cfc7ece5f9d56099b12fcba4695822","observation_id":"32ddfacc-5600-41c8-9c72-85f9cbef18d3","resolution":{"observed_at":"2026-08-05T15:18:46.555130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.746451Z","title":"Clip-diy: Clip dense infer- ence yields open-vocabulary semantic segmentation for-free","venue":null,"work_id":"8125cb74-3e0e-495c-99f5-e80886046133","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.651667Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f99288e28813cfe759bf3e0546aa757d8e3bc465d3a07f22c6a68219fa7a2dae","observation_id":"41eacf99-e32c-4ed0-9ead-b95f248e42be","resolution":{"observed_at":"2026-08-05T15:18:50.873604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-05T15:18:46.726110Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.726110Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:d728247c9ab95c0adaf45e9dc8acb0cefedc4d3798b927dfed626326fe9b8e68","observation_id":"8200cad9-845d-4632-8902-1b7b0eb19665","resolution":{"observed_at":"2026-08-05T15:18:46.726110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.511203Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"5c2f4798-a024-4350-a3db-8ddad9e721d8","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.821584Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:a207e719e13e7c884771d13890e864f48f40264ad41c911222e9bb78a7325b30","observation_id":"f6c48f5f-4cae-4540-bd05-d69b88cdfe90","resolution":{"observed_at":"2026-08-05T15:18:50.620230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.275650Z","title":"Markov knowledge distil- lation: Make nasty teachers trained by self-undermining knowledge distillation fully distillable","venue":null,"work_id":"adf4b2bb-808e-449c-8594-ece214b4beb1","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.895351Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9885a17c5f70834b50730039edc0f5063d90ade55fd1d9b6f1c4a6b4a1291349","observation_id":"5445e7df-5a99-4794-974e-3c6b94c3f27e","resolution":{"observed_at":"2026-08-05T15:18:50.386358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.913802Z","title":"Conditional mutual information con- strained deep learning: Framework and preliminary results","venue":null,"work_id":"a9229de6-91ab-4f81-8acb-78103b838f32","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.973745Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6a90128a4cffc6a55997882c14938f3ef92a90fbc64cfba32d8213143e32f3f4","observation_id":"e04b65be-2ab3-4623-ba98-de063c856119","resolution":{"observed_at":"2026-08-05T15:18:50.089977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.660693Z","title":"Bayes conditional distribution estimation for knowledge distillation based on conditional mutual informa- tion","venue":null,"work_id":"1a2c4885-f7f7-459b-8344-7f868dc8a786","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.098442Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:be8630cc845a2067bc1985ef5b1cfd489c162ec8319f776042167347220441f5","observation_id":"d453b326-abd3-4c96-952d-b793ab74e514","resolution":{"observed_at":"2026-08-05T15:18:49.777746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.483744Z","title":"Towards undistillable models by minimizing conditional mu- tual information","venue":null,"work_id":"1efacedc-f2c4-4d6c-a7dd-8f12dc18ebc8","year":2025},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.196825Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:8d023cba385c1edab1217308f17a20559d93f3f90b37abf44b7bd5018308fa9b","observation_id":"68faeeef-c03d-4e8f-b2aa-87c75fda512c","resolution":{"observed_at":"2026-08-05T15:18:49.569716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T15:18:47.280828Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.280828Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:ae38fd299de078c97d66137e581553b44ab8855b61d077495d4b7a26b314d061","observation_id":"71e4a3e5-1462-4f26-a39b-c1299d645184","resolution":{"observed_at":"2026-08-05T15:18:47.280828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02955","last_updated":"2024-09-14T00:26:00Z","snapshot_observed_at":"2026-08-03T22:00:24.530023Z","submitted_at":"2024-01-05T18:59:22Z","title":"Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively","version":2},"cited_work":{"arxiv_id":"2401.02955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02955","snapshot_observed_at":"2026-08-05T15:18:47.926547Z","title":"Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively","venue":"cs.CV","work_id":"5084b05c-9f86-4e11-9ffa-3174ed9a8dc1","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.360944Z"},"links":{"cited_paper":"/paper/2401.02955","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:097a85c6911a636de2738c0c099f23d110c015c962bac1202d5aa73b5de92db7","observation_id":"632dfc9b-daa1-42d8-bbc5-a7939c911bd0","resolution":{"observed_at":"2026-08-05T15:18:47.960712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.228853Z","title":"Be your own teacher: Improve the performance of convolutional neural networks via self distillation","venue":null,"work_id":"bae77ca5-a9ce-47d8-a81b-919e4a346665","year":2019},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.432871Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:bfa3398510d49aedf244d97ca219d6be7be4b3577839886f140f1db2cea0f13d","observation_id":"0de2b30c-e202-4f2b-b83a-d71e8e3f6d49","resolution":{"observed_at":"2026-08-05T15:18:49.317783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.984784Z","title":"Self- distillation: Towards efficient and compact neural networks","venue":null,"work_id":"4fec6211-1db2-4daf-bb2b-3c92ec519e78","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.508836Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9c45bb693642354edbb8195c989ed3a3eb1876196d779b8ef11c043b6acfecd1","observation_id":"d6ac0135-095d-4f49-b2b3-33a426c69a0c","resolution":{"observed_at":"2026-08-05T15:18:49.081325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.697130Z","title":"Meta-dmoe: Adapting to domain shift by meta- distillation from mixture-of-experts","venue":null,"work_id":"a0a454e9-47dd-44a7-8146-3e4e5da2be62","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.614409Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:225578349c8277a85372549e3920e2659d20417c62c75c927219df2c64996b36","observation_id":"9943b111-95f2-4d86-801c-61ae06673861","resolution":{"observed_at":"2026-08-05T15:18:48.831920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.470901Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"bde51975-70d4-4c75-8bcd-224ba43674e2","year":2019},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.719855Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:cbc48df4dacd9f4a67136bb808925cc533bad6bb125d462a48fff6ca6458dc0e","observation_id":"b821efcd-7313-4474-a892-5e669569f3c5","resolution":{"observed_at":"2026-08-05T15:18:48.588304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.278086Z","title":"Extract free dense labels from clip","venue":null,"work_id":"eb6ab370-97a4-4871-bdeb-cc8074c18e6a","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.795677Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7717436ef92db69a9902006bf42f92b3c389a355cf4592bb4a95daf64a6faf8f","observation_id":"b249469a-dfb8-4fc5-93c8-81469ebd2797","resolution":{"observed_at":"2026-08-05T15:18:48.387446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T11:39:56.483396Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2508.20265."}