{"as_of":"2026-08-16T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08e76935b546576fd0b63599d87b1e6a6db67399ff5f1c1113ad4380c8a8219c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:53:33.608671Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15851/citation-record","integrity":"/paper/2411.15851/integrity","json":"/paper/2411.15851/citation-record.json","paper":"/paper/2411.15851"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.254330Z","title":"Self- supervised multimodal versatile networks","venue":null,"work_id":"e0a2c6c0-9d6f-4aff-baa2-47278e54b5e6","year":2020},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.563359Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:b8c662bbb8a4efeabe5bbe20f39587cd5e6d778f3ca95cca28377f99f9243540","observation_id":"b298baa7-e8e4-4466-8c33-215c03636890","resolution":{"observed_at":"2026-08-12T13:53:36.259398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.105182Z","title":"Vqa: Visual question answering","venue":null,"work_id":"d48b9285-3118-4e31-92d5-9eeae5c04626","year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.740385Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:f17c9fac665376834d929b0a14a38bc90bdebb7b2fb09fb563704dcd6b3f565f","observation_id":"f2b0ec18-3fad-4177-aa0e-b39aae75fd0c","resolution":{"observed_at":"2026-08-12T13:53:36.192976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.080572Z","title":"Single-stage semantic segmentation from image labels","venue":null,"work_id":"a84fbb11-d70d-4af3-8035-966a58f56424","year":2020},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.809661Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:b71003fb9768612ef05e579032528df57382b2cb882719504b4efb387c5a357b","observation_id":"bcfe492a-4536-4a33-9dc6-109cb470c38c","resolution":{"observed_at":"2026-08-12T13:53:36.085633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.064138Z","title":"Fossil: Free open-vocabulary semantic seg- mentation through synthetic references retrieval","venue":null,"work_id":"29f88a18-1b00-483b-84fb-88d6450f6166","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.817434Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:4e44583486b3f6cd9dc96565cb2ba507af67bcaceb761b03ca7311a61ecb3835","observation_id":"78d05ed0-9048-44e8-b94c-765f9f6bf9f4","resolution":{"observed_at":"2026-08-12T13:53:36.070007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.047778Z","title":"Grounding everything: Emerging localiza- tion properties in vision-language transformers","venue":null,"work_id":"8c944183-a30b-4ba4-88d0-c07278259ee8","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.826968Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:22adac25d963cae6a519481860969acd923a97ee87acf472527681ba2f193dc3","observation_id":"b64f6d17-a166-48fc-9519-e760de86b75a","resolution":{"observed_at":"2026-08-12T13:53:36.052570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T13:53:32.834829Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.834829Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:f27e5b33d419a633b9e77fa81ca32bd6cd11516ba333532ae9b5e4550be33721","observation_id":"1d9a4e0e-d4e1-4ef4-b8f2-087d251ad34b","resolution":{"observed_at":"2026-08-12T13:53:32.834829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.033208Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"be3e06a5-65bb-420d-a261-2f2481c2702d","year":2018},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.839966Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:b934910f2bb3e2bbe40544810bd4fe45034413a3645ff85ead921924be7c462f","observation_id":"39fcef99-4425-417e-a316-34af1ae24a62","resolution":{"observed_at":"2026-08-12T13:53:36.037620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:36.003385Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"bb7bdca7-1d91-4c50-b7b6-061270865ecf","year":2021},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.844364Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:5f730abe20e9e783ed1fb993e3f05a268cb44b3eb97d4a3a74d609b1f6b70753","observation_id":"e6cb987b-2747-43c4-b9fc-f252f3e88bd2","resolution":{"observed_at":"2026-08-12T13:53:36.022720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.904882Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":"0037e964-6267-4101-b42c-2dab97b83455","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.849187Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:8ba132ff7121ea3c55ecbb5b7491689a98afe372b5399cf6b288a07828193a41","observation_id":"720e2a45-2f21-4802-bd70-94c76f7817f6","resolution":{"observed_at":"2026-08-12T13:53:35.909851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.888248Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"5b02ded0-24a9-45df-ad38-1221800a514a","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.854083Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:16c77e86a52b33030f9e7018306fc7ce8f718a3970b6fb530617181f24631f0e","observation_id":"59add72b-cbed-41f5-9e12-e55cbe5d4cfc","resolution":{"observed_at":"2026-08-12T13:53:35.893379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:32.858803Z","title":"Mmsegmentation: Open- mmlab semantic segmentation toolbox and benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.858803Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:5bfa228d5982b9b0a17f43e4b648c51725c2a2be918b70d8d622382bb0268788","observation_id":"6bcddcd9-c84b-4a20-b53c-8ccdaa8da91f","resolution":{"observed_at":"2026-08-12T13:53:32.858803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.862279Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"3f1d7f6b-3ef7-457c-a212-9fae1427674f","year":2016},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.863655Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:39b57eb5ca9e8f2778176b4926836e8bd990c0f3c5c8e640c6eb3b498db205b7","observation_id":"05dd4e8e-6feb-4753-a520-e088b664eade","resolution":{"observed_at":"2026-08-12T13:53:35.867348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-12T13:53:32.868403Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.868403Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:07411b38fbcbe6ee6328bbd6659c78e3e2c7e72571d0057ab0f505c19c6a986f","observation_id":"65821c0f-2527-4333-a5a6-b022c59676b1","resolution":{"observed_at":"2026-08-12T13:53:32.868403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T13:53:32.873421Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.873421Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:6c12593839a3272c5a8b6ecc83b75768d88fe2d6bc21b4c486389ed413a2c202","observation_id":"e2e783d8-34df-405e-9b0f-a595dc122f2f","resolution":{"observed_at":"2026-08-12T13:53:32.873421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T13:53:32.878221Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.878221Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:39a7301cc92f70830d067d303f795e7beaa7e023c5e9b66c536c137cd0bfd862","observation_id":"5ce91ed8-829d-4a69-ae6b-be0bb16edddf","resolution":{"observed_at":"2026-08-12T13:53:32.878221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.798818Z","title":"The pascal visual object classes challenge: A retrospective.IJCV, 111:98–136, 2015","venue":null,"work_id":"683c871f-93de-4aac-8cb4-aaa59d9ea3b2","year":2015},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.882936Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:ece46dbf54d2cef1874b7f6b40e04e74ba30387d636e8a68ea27056e3c6f9080","observation_id":"f4a721d3-574e-4cfa-98fa-d8452bc59ba2","resolution":{"observed_at":"2026-08-12T13:53:35.847718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08675","last_updated":"2023-11-04T17:55:12Z","snapshot_observed_at":"2026-08-13T11:42:30.247273Z","submitted_at":"2023-05-15T14:31:49Z","title":"Improved baselines for vision-language pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08675","snapshot_observed_at":"2026-08-12T13:53:32.887371Z","title":"Improved base- lines for vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.887371Z"},"links":{"cited_paper":"/paper/2305.08675","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:dc908a8225332fefa40b09fd8c910db57a60265b64161c445001a803da4ecc87","observation_id":"9d6152d3-944f-4766-ba2c-87ff0c6d2b23","resolution":{"observed_at":"2026-08-12T13:53:32.887371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.587008Z","title":"Pay attention to your neighbours: Training-free open-vocabulary semantic segmentation","venue":null,"work_id":"bcbb1f71-03eb-47e0-af94-8f961a7dec5d","year":2025},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.893255Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:2c2109f1ef8bac0d8fd8c932496bfe221a11227774aa7fc6600c34945b1ce6bd","observation_id":"8f14eeba-163f-4c60-9780-699a1d138dcb","resolution":{"observed_at":"2026-08-12T13:53:35.635478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.570863Z","title":"Open-vocabulary semantic segmentation with decou- pled one-pass network","venue":null,"work_id":"686f36c3-dd20-4f28-8434-99dc905a6c9f","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.898117Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:6703bfb442838683b461c45e968c284e891994561ef3a94cb1be16d439eebde4","observation_id":"6121bcd2-b035-490e-94e8-23a5962e7320","resolution":{"observed_at":"2026-08-12T13:53:35.575648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:32.953042Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:32.953042Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:2f1a851012cb5d2a6854d1bb1f7588af8ecf94db5573f9d41ed617484c3940c3","observation_id":"e3a8ae2b-cd0f-4067-b4fe-e29cfeb11fa7","resolution":{"observed_at":"2026-08-12T13:53:32.953042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.013103Z","title":"Learning mask-aware clip representations for zero-shot segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.013103Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:123c7a5c8cbf164a12a87dba481eeb24809a1560d0eb9c17f057a0cece21e82e","observation_id":"5331fbc8-5e34-4f7d-83ea-1e3387bc8fe5","resolution":{"observed_at":"2026-08-12T13:53:33.013103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04961","last_updated":"2024-08-09T09:28:35Z","snapshot_observed_at":"2026-08-16T13:27:29.953413Z","submitted_at":"2024-08-09T09:28:35Z","title":"In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2408.04961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04961","snapshot_observed_at":"2026-08-12T13:53:33.946271Z","title":"In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation","venue":"cs.CV","work_id":"7aba98fa-9249-4008-a790-14ca456ef372","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.113821Z"},"links":{"cited_paper":"/paper/2408.04961","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:55c84be7046e0f61f2e089641cd7ac7c981d1e4aab166ecfbc2ccbf7e99f5a98","observation_id":"82495263-bf02-403d-aded-aefa128c51e0","resolution":{"observed_at":"2026-08-12T13:53:33.969268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.532874Z","title":"Weakly supervised ground- ing for vqa in vision-language transformers","venue":null,"work_id":"1dfda8e4-f5f0-47af-b86c-a7f3d379dc57","year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.211579Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:8ec8cedd9ad35cd47d90f92f50f97c72b2aac6f47b628e0c9aded7e15d23d438","observation_id":"a035c38d-50ba-4429-b6a1-7e054f3c9525","resolution":{"observed_at":"2026-08-12T13:53:35.537853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.516321Z","title":"Vilt: Vision- and-language transformer without convolution or region su- pervision","venue":null,"work_id":"9a08815b-12d3-41c2-87a3-99feaa6d2b65","year":2021},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.219038Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:91eaa532e684b4c72c63bec75b8c29cefd02688a9cc93ecd78293963790210ff","observation_id":"05a8c5c2-5c51-425b-a53f-b0a8f8c728fe","resolution":{"observed_at":"2026-08-12T13:53:35.522030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.495781Z","title":"Segment any- thing","venue":null,"work_id":"60101045-5e85-4ce0-9a71-bfa062d43b39","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.223688Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:2164a34461763b3aac6502c94081019e0ab004f1516e5bb6fa24faa6eb2bd797","observation_id":"3c09e933-e46d-4822-bb77-c8a69a614e8c","resolution":{"observed_at":"2026-08-12T13:53:35.503755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.353071Z","title":"Efficient infer- ence in fully connected crfs with gaussian edge potentials","venue":null,"work_id":"9f5b37cb-f411-469c-8725-d0c15734d4a2","year":2011},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.228363Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:dbb5f986b6fe468acbbf84a07aadad2ea308a536cbf49880177c8f57e01edb3f","observation_id":"f277c252-8644-46ae-903d-4dcefa7a4774","resolution":{"observed_at":"2026-08-12T13:53:35.449911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:35.147011Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":"532a2ff7-71d8-4795-bde6-ce4536b36601","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.232981Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:f918f072c337df609dff855a76ab9390300d7164b41ad0bf187b0fb436bf184f","observation_id":"dc6e9316-0db8-46c5-9b96-4ecbdc0d28b7","resolution":{"observed_at":"2026-08-12T13:53:35.235150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04883","last_updated":"2024-08-09T06:17:00Z","snapshot_observed_at":"2026-08-16T13:27:32.168213Z","submitted_at":"2024-08-09T06:17:00Z","title":"ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04883","snapshot_observed_at":"2026-08-12T13:53:33.237441Z","title":"Proxyclip: Proxy 9 attention improves clip for open-vocabulary segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.237441Z"},"links":{"cited_paper":"/paper/2408.04883","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:01be67cf661d929888947603452dfb1ba8e9bde3d15eb967d50d9ea12973b964","observation_id":"2be1f5cc-aa44-4f78-8645-ace1b37d7181","resolution":{"observed_at":"2026-08-12T13:53:33.237441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.242396Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.242396Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:6bb998da71985a22e68517bfb18ade7d156ea50056b6b5b66ef06157fc36e026","observation_id":"ab0901a4-81c4-4ba2-9f83-76a579a32092","resolution":{"observed_at":"2026-08-12T13:53:33.242396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.247066Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.247066Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:37ce44fce3d425bab15b3da676d7b4ad8a257e89ab931494b9359e5c8e8a6741","observation_id":"23839c05-77b6-4ef0-bb42-87eacf6e4b2f","resolution":{"observed_at":"2026-08-12T13:53:33.247066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05653","last_updated":"2024-09-16T09:10:00Z","snapshot_observed_at":"2026-08-14T16:26:33.345356Z","submitted_at":"2023-04-12T07:16:55Z","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05653","snapshot_observed_at":"2026-08-12T13:53:33.251700Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.251700Z"},"links":{"cited_paper":"/paper/2304.05653","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:d3beb988c9e0969bfc09cef26bbeebba944871664b79bb7288e44aa95fc1e3d3","observation_id":"052452b5-df35-4041-887e-eb0f2d1f471c","resolution":{"observed_at":"2026-08-12T13:53:33.251700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.256226Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.256226Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:ddaf68c19b93bcc0b0737efe4e8e8da7aeb720d1a9470e4ca7dd4b0d4bb68d27","observation_id":"99d91e53-7b94-45bf-ab0a-1f3a77f3cb69","resolution":{"observed_at":"2026-08-12T13:53:33.256226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.893091Z","title":"Segclip: Patch aggregation with learn- able centers for open-vocabulary semantic segmentation","venue":null,"work_id":"f71ba469-8e37-4c2e-9042-e3d26115dd65","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.261076Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:353df40be752e0f75d29caa947ce5f7c766bbf0e4176fed9734a27eca772c18a","observation_id":"9dc0fa3e-36b6-492c-b91d-952f29390bb3","resolution":{"observed_at":"2026-08-12T13:53:34.976103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.266020Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.266020Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:d9563fdb3fdd35c673df7232fd3e6c6fde6555e8429cb3ad80cc169173dfb61e","observation_id":"a080340c-8dfb-4982-916d-f4c1bb5675d5","resolution":{"observed_at":"2026-08-12T13:53:33.266020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.271239Z","title":"The role of context for object detection and se- mantic segmentation in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.271239Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:13db43ac652d1c5ac6e0efe181495422b700f2db4acb1beca4ed39d9d1549149","observation_id":"07a32e02-d329-4720-bf45-1be978ca6b42","resolution":{"observed_at":"2026-08-12T13:53:33.271239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T13:53:33.276041Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.276041Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:95020dba268c191ad036ebb485dcbb129a48d2203ed131f354d50b3c7f5f3f67","observation_id":"c78933b3-c3bd-4d27-9c5b-a2b6b168bd99","resolution":{"observed_at":"2026-08-12T13:53:33.276041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.795689Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"5fee8f39-f895-4fd4-8f04-e7095feb4e20","year":2021},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.280808Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:fd0b85ca7cd1c14b6ba2ceff9cf4e0d78178baed1818e4d8a2e4b2d54a3964b2","observation_id":"2ee3dd2a-8a54-48d9-92b7-9b8123489458","resolution":{"observed_at":"2026-08-12T13:53:34.851135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.606081Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"962b2fab-c473-4a25-9a50-609af7fb1c50","year":2020},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.285175Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:2187f950417c5f39a18364355aa23407967e70ed3cf137257c7370b03814a790","observation_id":"d61ff42f-ccf5-4c68-9b8c-c3c114d007eb","resolution":{"observed_at":"2026-08-12T13:53:34.703300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.557532Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"c149d57d-d77d-4b08-9378-79c3f4ce4439","year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.289597Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:f0b63586da9532d8f489eb0b187e55c751172254d1a4f09f6aef74ccc5f633f1","observation_id":"0a9cb8d4-7eba-4a1b-86c3-5e25ecd96a1c","resolution":{"observed_at":"2026-08-12T13:53:34.562702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10307","last_updated":"2023-01-31T01:57:52Z","snapshot_observed_at":"2026-08-13T12:54:43.020597Z","submitted_at":"2023-01-31T01:57:52Z","title":"ViewCo: Discovering Text-Supervised Segmentation Masks via Multi-View Semantic Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10307","snapshot_observed_at":"2026-08-12T13:53:33.294063Z","title":"Viewco: Discovering text-supervised segmentation masks via multi-view semantic consistency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.294063Z"},"links":{"cited_paper":"/paper/2302.10307","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:fd5f4c67520240c2206cac4e0e38dea63d44253a7258a84c642aff03f15da892","observation_id":"4940a514-f9f0-47a2-933e-1f529ca59c0d","resolution":{"observed_at":"2026-08-12T13:53:33.294063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.542573Z","title":"Ex- plore the potential of clip for training-free open vocabulary semantic segmentation","venue":null,"work_id":"cf265f08-eec2-4e6e-90d9-51923557496f","year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.319556Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:d82fa3ac5cb3096b4e08f3026e484404d49ade98b779f646cfa3a21c4acecf15","observation_id":"1fe42a55-416f-4c26-b78c-4bd0eca49955","resolution":{"observed_at":"2026-08-12T13:53:34.547330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.528060Z","title":"Reco: Re- trieve and co-segment for zero-shot transfer","venue":null,"work_id":"52faeebe-e143-4393-8f65-8ea8f8eafb28","year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.354188Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:46277f9827eecfce247dc5041dfe576bee31d717684ac0a2cd833cc4c9b710b2","observation_id":"b25e8ae9-8542-4ee1-b4a2-370b2ea732c9","resolution":{"observed_at":"2026-08-12T13:53:34.533047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.512040Z","title":"Clip as rnn: Segment countless visual concepts without training endeavor","venue":null,"work_id":"31e9c06f-2f11-4c13-bd7c-a7140db2312a","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.404055Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:d30b5191cbe166f6759417e360353ac9d443b87eba4a1168b798c44c4163b827","observation_id":"3ed885df-0962-4438-9671-6fc7714cc06f","resolution":{"observed_at":"2026-08-12T13:53:34.517041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04287","last_updated":"2022-10-09T15:40:13Z","snapshot_observed_at":"2026-08-13T14:09:41.742797Z","submitted_at":"2022-10-09T15:40:13Z","title":"Learning to Decompose Visual Features with Latent Textual Prompts","version":1},"cited_work":{"arxiv_id":"2210.04287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04287","snapshot_observed_at":"2026-08-12T13:53:33.839427Z","title":"Learning to Decompose Visual Features with Latent Textual Prompts","venue":"cs.CV","work_id":"3500fbca-0264-4537-b7d3-4c1ad226ee23","year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.444207Z"},"links":{"cited_paper":"/paper/2210.04287","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:3ab7da4c066ca48268947d422a6c68387709278fb69abbd80278b9a7bfcd441d","observation_id":"bde8b7f7-9db7-424d-adab-d4f7a237a95d","resolution":{"observed_at":"2026-08-12T13:53:33.862640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.497076Z","title":"Sclip: Rethinking self-attention for dense vision-language inference","venue":null,"work_id":"ade4f654-0a31-4efb-8968-cd0fc0390503","year":2025},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.524250Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:7def91e646febc40952b88a9fc93f403faddafe30e4e91a95302a328fc7c2c29","observation_id":"220c7c8f-da1e-47f2-8467-dfd54cb65217","resolution":{"observed_at":"2026-08-12T13:53:34.502054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.436250Z","title":"Medklip: Medical knowledge enhanced language-image pre-training for x-ray diagnosis","venue":null,"work_id":"f12363c3-46ac-4fa3-a9ef-a82c7761943f","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.529413Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:dd99833d2cbc5115a2d66c02f0e1486058cec35f110b06263052d70535a192db","observation_id":"6bde215f-8dd1-4f6f-90a9-d397ab646c45","resolution":{"observed_at":"2026-08-12T13:53:34.461061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.348624Z","title":"Rewrite caption semantics: Bridging se- mantic gaps for language-supervised semantic segmentation","venue":null,"work_id":"7e130926-e041-4981-9e38-8c1083c36b10","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.534204Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:ad1a9f348e28102478d1a26dab075f3516c10a3f52838c52c358d7b6bc8484d5","observation_id":"15686629-73c2-46e6-8c92-3aebaa9b02bd","resolution":{"observed_at":"2026-08-12T13:53:34.391322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-12T13:53:33.538321Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.538321Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:56e2c3c02c0d9c7cf01fe7aa69d95ae0072ba5163fbc8b515c993ab8ff440057","observation_id":"577d6387-f93b-470b-b003-397677aea621","resolution":{"observed_at":"2026-08-12T13:53:33.538321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.263972Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"b60fe55f-b74a-47f3-9a53-28e71998bb47","year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.542913Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:229b39dd93bf0734ab263fc129d6a1635ba4692ca5302ff531ec5e3ef57c4ff0","observation_id":"ee7fde15-8078-4e60-a3d6-3542e81401fa","resolution":{"observed_at":"2026-08-12T13:53:34.298390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.174009Z","title":"Learning open-vocabulary semantic segmentation models from natural language supervision","venue":null,"work_id":"d5110bc6-e3bd-4d75-a560-831df6a76004","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.547629Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:bba0d8b4a25ec8a0354b76f3006c2ffdf74af74b05bbb973581ff89ee951d573","observation_id":"033d3e8f-faff-4b8b-8e78-1df6548ae8f3","resolution":{"observed_at":"2026-08-12T13:53:34.230098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.158216Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"370b2084-679e-4bf9-93af-ce3e4f78d5cf","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.552385Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:fcaf0e468967f98775666b6c39dc532d8de040d78e7a9111579309b474cb938d","observation_id":"dfb67b0f-d00c-425c-b1bf-513888743bcd","resolution":{"observed_at":"2026-08-12T13:53:34.162876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.143625Z","title":"Unified contrastive learning in image-text-label space","venue":null,"work_id":"8e513664-177d-4bf8-b79e-555fc095b319","year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.557229Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:b8855ffae369001aca20536950ea33f0195daa9c16e73139da6fa7ceac073fb1","observation_id":"2ae95653-c54e-4ad2-b70c-6256400a508f","resolution":{"observed_at":"2026-08-12T13:53:34.148172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14294","last_updated":"2024-05-23T08:13:52Z","snapshot_observed_at":"2026-08-16T13:50:19.745976Z","submitted_at":"2024-05-23T08:13:52Z","title":"Tuning-free Universally-Supervised Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2405.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14294","snapshot_observed_at":"2026-08-12T13:53:33.738297Z","title":"Tuning-free Universally-Supervised Semantic Segmentation","venue":"cs.CV","work_id":"c5e632df-8593-4a10-af49-0283bddfcdeb","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.561686Z"},"links":{"cited_paper":"/paper/2405.14294","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:d91f69650b5937b237f5ec93be3cb31d633e9a37150ade1b43430dae5790ab09","observation_id":"5bcb9ca7-fc93-449f-96aa-e5003c30bcec","resolution":{"observed_at":"2026-08-12T13:53:33.773603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-13T15:16:57.345726Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-12T13:53:33.566440Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.566440Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:a79bacaa354ca73e2720297df2efb46e787e5e6d445048f38d5e6b96e34855d6","observation_id":"3964313e-b3b3-41aa-a326-138ad3d039dd","resolution":{"observed_at":"2026-08-12T13:53:33.566440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-12T13:53:33.571272Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.571272Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:5bd76dc5ff7874f340eb0812df25478d56586ca4c9e69f591df734bae70df054","observation_id":"3d48020e-1367-4386-8a20-804609d647b4","resolution":{"observed_at":"2026-08-12T13:53:33.571272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-12T13:53:33.575798Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.575798Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:fa0ea253f85392bd9f8af53ce80b10ef552bb11410578a8c3313737cead35dd7","observation_id":"effb5a11-af05-47e4-95f2-dfb9f63b7af0","resolution":{"observed_at":"2026-08-12T13:53:33.575798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.128724Z","title":"Uncovering prototypical knowledge for weakly open- vocabulary semantic segmentation","venue":null,"work_id":"0d1a3853-9ba2-40fe-ae0f-3a363fd5368e","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.580214Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:ddc3f0cbc45c85836a1947e4b94e858f193f4444dbbab58937a1e5ca3ce94d72","observation_id":"0c08ad36-e9e0-4cb8-bd6f-3ba52b74a209","resolution":{"observed_at":"2026-08-12T13:53:34.133288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.112969Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"34902e18-c96f-4f67-8879-7e82dd87ac0a","year":2019},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.584897Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:7388d80189992506b3cb9e16b3292a1b7dcf7a3681350361e8bf35ebb1f9fcb7","observation_id":"074d1995-6a2f-406a-80fd-9932ce131e50","resolution":{"observed_at":"2026-08-12T13:53:34.117946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:33.589293Z","title":"Extract free dense labels from clip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.589293Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:f8ea9635c700992db6cf9c0f22602c169beae5213f5e93618d9d6612ae1ef0e9","observation_id":"76a4c42b-17b4-408e-a6ce-2c1a25984d72","resolution":{"observed_at":"2026-08-12T13:53:33.589293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12957","last_updated":"2024-11-27T09:54:05Z","snapshot_observed_at":"2026-08-16T13:24:22.934921Z","submitted_at":"2024-08-23T10:07:59Z","title":"Image Segmentation in Foundation Model Era: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12957","snapshot_observed_at":"2026-08-12T13:53:33.593862Z","title":"Image seg- mentation in foundation model era: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.593862Z"},"links":{"cited_paper":"/paper/2408.12957","citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:20e37e27aeb851dc42c60b02e2bb50fd52fd5a0ceb8ca319352a43117f608887","observation_id":"cd9440bd-40a5-4666-becc-c6a063c32c23","resolution":{"observed_at":"2026-08-12T13:53:33.593862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.086625Z","title":"Zegclip: Towards adapting clip for zero-shot se- mantic segmentation","venue":null,"work_id":"454486ed-f28f-43bb-9805-3d281f048170","year":2023},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.598810Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:6f453d73bf950da3618cd22c010dd07bf6447fbe4f0c4324e650c9582b3af127","observation_id":"1ce81bfe-7811-4a4c-9db3-99703333e1cf","resolution":{"observed_at":"2026-08-12T13:53:34.092536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.071935Z","title":"Segment everything everywhere all at once","venue":null,"work_id":"1bebcbe5-5a36-4748-89f3-79a98f5b23e7","year":2024},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.603563Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:9309363ccdfd554c8c6cc596e023a8b571c4bfc2831ae69bfbc3f767b748d7e9","observation_id":"355102fb-2c94-4bb2-9db8-6887d5fa32f5","resolution":{"observed_at":"2026-08-12T13:53:34.076309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:53:34.057252Z","title":"For example, in the COCO Ob- ject dataset (see Fig","venue":null,"work_id":"f2971a99-6267-46fb-9844-4aa165375601","year":null},"citing_paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T13:53:33.608671Z"},"links":{"citing_paper":"/paper/2411.15851"},"observation_digest":"sha256:864a0c3bb60c39b83e127f4eb214675532de66c878b7125fcbcc2b56275e67b3","observation_id":"5238c073-aadf-411b-b77b-57a069dc7835","resolution":{"observed_at":"2026-08-12T13:53:34.061494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15851","last_updated":"2026-06-02T16:19:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T12:48:42.491877Z","submitted_at":"2024-11-24T14:14:14Z","title":"ResCLIP: Residual Attention for Training-free Dense Vision-language Inference"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2411.15851."}