{"as_of":"2026-08-11T08:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a1b10b11eb1b0454bf02dd70b9b052004efd804627bae927f43fc5d038423d5","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:50.080336Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:20:34.568987Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T02:21:16.444115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":"2506.21233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21233","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reme: A data-centric framework for training-free open-vocabulary segmentation","venue":null,"work_id":"6b71c9c7-bde1-4ca6-bd74-de0493a29342","year":2025},"citing_paper":{"arxiv_id":"2605.09090","last_updated":"2026-05-09T17:54:31Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T17:54:31Z","title":"Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T02:20:34.568987Z"},"links":{"cited_paper":"/paper/2506.21233","citing_paper":"/paper/2605.09090"},"observation_digest":"sha256:7b52f1fbff6045f6e3c4acadffaaf016a38c385a1d03df4b05ca0b3afe9274b4","observation_id":"3514aca8-2c36-42e1-b4ba-e32671ab8a27","resolution":{"observed_at":"2026-05-12T02:21:16.446524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21233/citation-record","integrity":"/paper/2506.21233/integrity","json":"/paper/2506.21233/citation-record.json","paper":"/paper/2506.21233"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:36:41.066792Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.066792Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:447751ac096bf5dbd147d1f548f49a3f4217395b39ee9769632028c6e7384439","observation_id":"cf7ffdbe-619a-4043-8f38-01740027583d","resolution":{"observed_at":"2026-08-06T22:36:41.066792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.205604Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.205604Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:51f96b9e739f2d83b61de6352a8b7a2642b28e002856eaf649df076673d9cf05","observation_id":"cd914686-f234-451d-9949-7d09c783182c","resolution":{"observed_at":"2026-08-06T22:36:41.205604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T22:36:41.378991Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.378991Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ac6e0b4d299e5747fe44618ab55ab9f5134c1b246ffaf3e978904dabe476fcf5","observation_id":"74c5eecd-f12d-4c99-98b5-ff0aba3e3442","resolution":{"observed_at":"2026-08-06T22:36:41.378991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:36:41.542927Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.542927Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:7050d419bdc2c7866c84ab86c295b9d3a35d8d4d7f30dc6af2397eaf60640982","observation_id":"0baa2d50-c5a6-41f9-952a-5795148417ec","resolution":{"observed_at":"2026-08-06T22:36:41.542927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.772590Z","title":"Fossil: Free open-vocabulary semantic seg- mentation through synthetic references retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.772590Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:019ae8ba6c6da704218ceffbe98fdfc6b33a73f8f00fc084cd95054431241374","observation_id":"46710b7c-4fe9-49d9-82b9-dba06738be3b","resolution":{"observed_at":"2026-08-06T22:36:41.772590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.884696Z","title":"Training-free open- vocabulary segmentation with offline diffusion-augmented prototype generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.884696Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:b2b8531ee85428d42ecb8f93237bd21d56ea91015c74c1988b63a32acb02e329","observation_id":"333a0029-aa3a-4a3a-88b9-80e6799c5484","resolution":{"observed_at":"2026-08-06T22:36:41.884696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.039022Z","title":"Grounding everything: Emerging localiza- tion properties in vision-language transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.039022Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:3cc1ca01f2c511edc7765b4da786bf6eeca14eca92329dfc1be24921caff8fbb","observation_id":"d76d690d-d53b-4205-a2e2-7e76aedd0ed8","resolution":{"observed_at":"2026-08-06T22:36:42.039022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.213969Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.213969Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:583761793be3567f23d056aa368adf21872c8942ff346fa022293d13d094acc1","observation_id":"9a8c96ff-c8a7-4241-b597-68eba597dd03","resolution":{"observed_at":"2026-08-06T22:36:42.213969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05095","last_updated":"2023-05-08T23:47:07Z","snapshot_observed_at":"2026-08-10T00:59:32.074037Z","submitted_at":"2023-05-08T23:47:07Z","title":"Less is More: Removing Text-regions Improves CLIP Training Efficiency and Robustness","version":1},"cited_work":{"arxiv_id":"2305.05095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.05095","snapshot_observed_at":"2026-08-06T22:36:50.760616Z","title":"Less is More: Removing Text-regions Improves CLIP Training Efficiency and Robustness","venue":"cs.CV","work_id":"24b55893-7a0d-4deb-b0c5-29d814aee752","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.353046Z"},"links":{"cited_paper":"/paper/2305.05095","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:12ec11f0331a48b6583ead715c7fa6b6750eb9aa6c0412e494a940d4cb5ad5a0","observation_id":"94387481-f722-4ff7-b6d5-4a4d5bacff81","resolution":{"observed_at":"2026-08-06T22:36:50.840513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.467394Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.467394Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:91f502ccb38a3cbd57fed5e5c2471c03ed274b1cf890e765060a298d369f7057","observation_id":"ca4bd275-f430-4cc3-976a-6f1df19623e8","resolution":{"observed_at":"2026-08-06T22:36:42.467394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.530193Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.530193Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:757bd5a046a0c5b8c09d68ab7a825fa1a995ede0548e23983bd7050599f6efbe","observation_id":"11b8a85c-faab-4680-9636-0f94aa33aa3f","resolution":{"observed_at":"2026-08-06T22:36:42.530193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.592388Z","title":"Exploring open-vocabulary semantic segmentation from clip vision encoder distillation only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.592388Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:5ad9a155e195d8672718e19bf25cad8d8e855a94ecfb1384b3a7fde8e1abe37b","observation_id":"67565dd0-a3ce-4640-8fa7-5b9562b3ecc1","resolution":{"observed_at":"2026-08-06T22:36:42.592388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:01.137571Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":"a77b9ed6-b523-437e-a354-17c2f4cd9444","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.654833Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:509178bb5e02cc3727fdcfd14d65655c6c78488bfbe68a8714004bf60d4eddda","observation_id":"adb1df3d-4eeb-44cc-af5b-64b414e4d944","resolution":{"observed_at":"2026-08-06T22:37:01.189272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.720357Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.720357Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:6cd27e171e8155dd236b048a20415f257a24122c217015cec694473da6a20223","observation_id":"f7b5927d-492a-4cb0-93ea-2e1a17daf067","resolution":{"observed_at":"2026-08-06T22:36:42.720357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03234","last_updated":"2025-06-23T17:41:29Z","snapshot_observed_at":"2026-08-09T02:09:37.861869Z","submitted_at":"2024-05-06T07:44:07Z","title":"A Reliable Framework for Human-in-the-Loop Anomaly Detection in Time Series","version":4},"cited_work":{"arxiv_id":"2405.03234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.03234","snapshot_observed_at":"2026-08-06T22:36:50.544438Z","title":"A Reliable Framework for Human-in-the-Loop Anomaly Detection in Time Series","venue":"cs.HC","work_id":"b0819419-1452-48e0-ba0a-cf657445c788","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.807218Z"},"links":{"cited_paper":"/paper/2405.03234","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1f4ce91ff9389b3a370930d21bec24b978c33c1f40846e01623ed921d41e572c","observation_id":"36ef914b-a060-49d1-a8ec-59918348b329","resolution":{"observed_at":"2026-08-06T22:36:50.628452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.993049Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":"0876c6a6-578f-4ebb-82e0-0079a5fd31c5","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.894928Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:28588ff916498f15bcb2662d7b26fd57b960e8747bf43b2cf7fa77e579e12e85","observation_id":"2cd16033-0233-4c96-a8bf-3ba19040934a","resolution":{"observed_at":"2026-08-06T22:37:01.060369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.984185Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.984185Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c4d9a14d1815d6cd5f378fff4482814174d7309d7a6e20a3eb6d711f0ad381f9","observation_id":"6c908253-b44e-4cbb-ab13-92d2447b06f6","resolution":{"observed_at":"2026-08-06T22:36:42.984185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.877110Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":"c6bcb99b-9455-4f67-9eeb-b7b31f3f6c7f","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.072377Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:42e44817a38b8db503a45c9bca08d2018373c8b86654d45222e2ad90bda05083","observation_id":"3892d368-a669-48c5-8cf8-0a505b637656","resolution":{"observed_at":"2026-08-06T22:37:00.928416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.164983Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.164983Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a7e80f9c3654ee3c5dcaeebf17255f89ba1734892d06f18d39e46d4ef72c4d31","observation_id":"311b996a-43aa-43ef-a8a4-b2df7c035b97","resolution":{"observed_at":"2026-08-06T22:36:43.164983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.747932Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"1f39288d-8c88-4774-918f-5a277052d41b","year":2004},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.252714Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:556d734decd2240c854423a5793c283330a14aa6ff190c4c50af1ecc8c56dd86","observation_id":"954082e9-66ad-49e9-b105-1853337e8dfb","resolution":{"observed_at":"2026-08-06T22:37:00.809896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.594593Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"8572247f-61bc-4929-942a-1a7b21adceec","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.328155Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:9fe37a51d8f62510179715fad67e0e0de00da7aafd8d7540a104ea204397efc4","observation_id":"d803ab9f-f081-4f38-9ce5-14389720d6f7","resolution":{"observed_at":"2026-08-06T22:37:00.656979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.445376Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"06f6e806-2573-4985-bbd8-e46b38cbafbf","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.405581Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:51707767cea3feb979bf9149299c6b5b516717bdd44fc567f1be4eca560bead1","observation_id":"4ed156c9-1ccd-4c66-85a5-d6259b2ed1a4","resolution":{"observed_at":"2026-08-06T22:37:00.515245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.310506Z","title":"kNN-CLIP: Retrieval enables training-free segmentation on continually expanding large vocabularies","venue":null,"work_id":"3cd49384-1755-48f5-b5a7-9ff521690d47","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.488587Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:025da1ce9f4a9dd7d182ac8bbb2464d894701cfb27a2786fd840a4ffb0ca86d9","observation_id":"b4d3db01-e840-4138-8b42-31e5b166fbfd","resolution":{"observed_at":"2026-08-06T22:37:00.375826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.178729Z","title":"Robustifying token attention for vision transformers","venue":null,"work_id":"eb3be745-f5d8-4b6d-b17c-74f51df6a7f7","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.577378Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:05affbee2545cd783902f01d97e0d623685530088f10839343b643f1e741e863","observation_id":"52935343-e4da-4be0-84d9-3be0fb9dea9c","resolution":{"observed_at":"2026-08-06T22:37:00.241465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08181","last_updated":"2024-09-16T20:11:48Z","snapshot_observed_at":"2026-08-06T11:06:50.565282Z","submitted_at":"2024-04-12T01:08:04Z","title":"Pay Attention to Your Neighbours: Training-Free Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08181","snapshot_observed_at":"2026-08-06T22:36:43.675722Z","title":"Pay attention to your neighbours: Training-free open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.675722Z"},"links":{"cited_paper":"/paper/2404.08181","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f0bb5b17f27091eb51ee27bbc241981914c1487df8c724c6832c99773ab87638","observation_id":"eb7229ce-55a5-423c-acd2-5a7a34c4a8ca","resolution":{"observed_at":"2026-08-06T22:36:43.675722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.732948Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.732948Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1b947c1c3514801894701719a4fa324dff9e067daa2e388f540a1533fc760365","observation_id":"9a0960c0-ee4f-45ec-9e1f-9e051843e8e3","resolution":{"observed_at":"2026-08-06T22:36:43.732948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.997065Z","title":"Diffusion models for open-vocabulary segmen- tation","venue":null,"work_id":"4a687074-0255-4705-802c-8044b33b0867","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.846052Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:880666b1d9decc6e13ed372a7b629cfda24b158dd47abe143ead319e0deb3bd8","observation_id":"8a30cfe1-fe1a-4f29-a0aa-658120423536","resolution":{"observed_at":"2026-08-06T22:37:00.075626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.847284Z","title":"Segment any- thing","venue":null,"work_id":"428d23ab-6c1e-4bb7-935f-4c95a22e75f1","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.914741Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:43e013972fbb2d4c9a547e756824c57bc14332b9303bcfada38403aba397d360","observation_id":"f8a112ce-fa41-4054-8fa9-ca0fdae66fbe","resolution":{"observed_at":"2026-08-06T22:36:59.927219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.723092Z","title":"Efficient inference in fully connected crfs with gaussian edge potentials","venue":null,"work_id":"cb5df445-6b7e-4a9e-90d3-30424d629ee9","year":2011},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.018955Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f39b09277ea90744b4370a5699a2ddbfb41bca78137a3f77d57b2e86ed966958","observation_id":"3b4bf006-a2cb-4476-9dc6-33e3c00841fa","resolution":{"observed_at":"2026-08-06T22:36:59.783055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.571036Z","title":"LISA: Reasoning segmentation via large language model","venue":null,"work_id":"028851ee-75d9-4b7c-a956-bb27591d8bb3","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.138088Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:d280b1c0efe3b504f2b3f3a092baba04ff2c5ffc802614cff9c2a770e7e8b0e9","observation_id":"81b4d717-c583-40c0-92f1-222e9f679150","resolution":{"observed_at":"2026-08-06T22:36:59.634942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.402675Z","title":"Veclip: Improving clip training via visual-enriched captions","venue":null,"work_id":"30ff4ba6-1f88-43c4-a2a1-53d0eee1dcc2","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.250058Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1db74de3ff77c5f593f92010af1a60d01a804f665c450dc4edffb7db33e83f53","observation_id":"dfe96d18-2965-425a-adf8-a6fc94efafe6","resolution":{"observed_at":"2026-08-06T22:36:59.488442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.222856Z","title":"Proxyclip: Proxy at- tention improves clip for open-vocabulary segmentation","venue":null,"work_id":"b01747ba-f5b0-4c9a-aee0-a063892d77cc","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.346562Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:46182523219b3c1a95c5972e5d84204d5c108a341f3ee41612fa4486323a2842","observation_id":"4c8af45d-efa0-401f-93b7-9205e54e89c1","resolution":{"observed_at":"2026-08-06T22:36:59.303421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07547","last_updated":"2024-09-03T03:20:54Z","snapshot_observed_at":"2026-08-10T01:18:55.752093Z","submitted_at":"2023-04-15T12:52:23Z","title":"TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"2304.07547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.07547","snapshot_observed_at":"2026-08-06T22:36:50.324873Z","title":"TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation","venue":"cs.CV","work_id":"f281c577-263f-4d20-898c-4e7a2a3c344b","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.403622Z"},"links":{"cited_paper":"/paper/2304.07547","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ea5a2d424ec0eef4c409339e0f3d9b638c9e5f56a0b71a3d662c7c7f84c9f58e","observation_id":"331b762f-f057-49cd-a03f-10158e0fe608","resolution":{"observed_at":"2026-08-06T22:36:50.395037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.049679Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"460272b2-c05b-48e8-922d-b4d3b488a2f4","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.480509Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:2fe8be49c51d07ccb028e17661705da700e3ad189f58ea8e0557cc172ada1764","observation_id":"180ecf60-04bc-4158-8db5-28f171710624","resolution":{"observed_at":"2026-08-06T22:36:59.128591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05653","last_updated":"2024-09-16T09:10:00Z","snapshot_observed_at":"2026-08-10T13:07:09.026586Z","submitted_at":"2023-04-12T07:16:55Z","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05653","snapshot_observed_at":"2026-08-06T22:36:44.502984Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.502984Z"},"links":{"cited_paper":"/paper/2304.05653","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:630e4c5a2729d7d9cd8eb1731902d0507b4200535eb0caa79f7d873bcae487d3","observation_id":"8beec294-3051-4213-8b55-992b160f942d","resolution":{"observed_at":"2026-08-06T22:36:44.502984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.896504Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"90f29e24-40aa-4e22-bc97-676eecd2d228","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.507435Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c4037b145a8f588d77fcc6a1e41d73e9846bd10d093f2c485c102060e522fd22","observation_id":"16dbde27-7b52-4aa6-9434-a11135ffa506","resolution":{"observed_at":"2026-08-06T22:36:58.953216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.725751Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"3054b17c-ba56-46e2-960d-02f71eb5d8fc","year":2014},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.585617Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:15c1728530ec7b4637e32ecbbbc5754be1fadd759fab339bc920850beb4e22a7","observation_id":"3a351e8b-0260-4233-8d10-03e5542bf1ab","resolution":{"observed_at":"2026-08-06T22:36:58.792576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.590340Z","title":"Visual instruction tuning","venue":null,"work_id":"a564689d-02fe-4081-af4b-b9065d8b176c","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.721539Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:45a5fae345891074e635d0b7c6c56e1dfbd9dc8f749ce90c4304c9fae994ee01","observation_id":"fba273c8-4571-4c9f-ba49-e2c19b85bc7f","resolution":{"observed_at":"2026-08-06T22:36:58.656534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.453649Z","title":"Segclip: Patch aggregation with learnable centers for open-vocabulary semantic segmentation","venue":null,"work_id":"ec085799-4fbb-42fd-bf2b-f0f2d574ebe5","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.901957Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:d068a42c59c4a3367058461c893fa0f9b4bb0eae5eed5aaa383dc5c0d12cbdb6","observation_id":"5125b102-0d7b-419c-8686-4989c1d9110f","resolution":{"observed_at":"2026-08-06T22:36:58.521702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.275847Z","title":"Emergent open-vocabulary semantic segmenta- tion from off-the-shelf vision-language models","venue":null,"work_id":"0bef801b-c961-4c46-9f70-dff6e04e5756","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.083381Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:28d3f8fcc71e951432f4e20b0d73f3785be837bf61c4890282dedaa77ac11a13","observation_id":"3b06323d-273a-437f-9e1a-03618052a566","resolution":{"observed_at":"2026-08-06T22:36:58.342445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:45.286587Z","title":"Sieve: Multimodal dataset pruning using image captioning models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.286587Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ffb4e0273b7cdc78719f5f34305fc5f9cbd2e07abd8dea77867fe9ff02148e63","observation_id":"6002662a-966c-4168-9b96-2978718d2b6e","resolution":{"observed_at":"2026-08-06T22:36:45.286587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.055450Z","title":"Towards interactive 3d surgical scene reconstruction: An incremental training and monitoring framework","venue":null,"work_id":"1e2f3ff7-ca82-4e9c-aee8-ec40d5c36441","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.463478Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ebb5ed46942eca48869c42f4be3d3537298165cc145d5abf91c8e4809d05a604","observation_id":"c9af95e9-08f0-48e3-9e2e-054a974cf749","resolution":{"observed_at":"2026-08-06T22:36:58.156005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.855457Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"8304d5f0-27df-47c8-b2dd-954391c2e270","year":2014},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.669187Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:4cbd60ecabe70b9e827dc586aff0ef9750a022ab087d52fee7846cb8d05d22d6","observation_id":"8a6d29d4-e7ac-489b-9ecb-07effd638e79","resolution":{"observed_at":"2026-08-06T22:36:57.944191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:45.814609Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.814609Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:99523a597d45a5b6380a8166035d984e998062dd5a2ba5d4a344c4cf0c411e18","observation_id":"7bd015a8-43b4-4111-8c61-7c5e69ec2db0","resolution":{"observed_at":"2026-08-06T22:36:45.814609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.636758Z","title":"Dataset diffusion: Diffusion-based synthetic data generation for pixel-level semantic segmentation","venue":null,"work_id":"b937c48d-77aa-4e4c-b845-2b4214870b03","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.894499Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a6cb8236e5d9883f3848f03492fd0d98cfff9406636cea8038a4eacd1d4a0470","observation_id":"1244d5a0-8689-405c-8415-f8912b86acd7","resolution":{"observed_at":"2026-08-06T22:36:57.735661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.436390Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":"dd8d6383-eb69-406b-a645-f73ffa52bc5e","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.934377Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f71fab56e75ab3822ed5b3570cdc2e19fab9b20519c7195122d829a948ab791e","observation_id":"66d335a9-8cfd-46e8-94e4-e5ba3e893868","resolution":{"observed_at":"2026-08-06T22:36:57.525846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:45.975908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.975908Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:5237a0b43bab58085fd35403587d06ba47774611740cba3a4f3cdc0dd745e732","observation_id":"9e61ecd3-404d-4af5-83fe-7fb003037fd8","resolution":{"observed_at":"2026-08-06T22:36:45.975908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T22:36:46.053309Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.053309Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:6ec00b71e6861825692e8d2ebdf0a4c1e0a05b81d21ee4cd1f90c16319af7ac8","observation_id":"93041323-ebb8-40c9-bbec-e1bfeb8885e8","resolution":{"observed_at":"2026-08-06T22:36:46.053309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.181438Z","title":"and et al","venue":null,"work_id":"59153a29-31c7-42e7-b18a-6340c82a30fa","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.167118Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:999e5df072512abea0979f312777972546fd30736940fe04a1dabbefbede9739","observation_id":"abd72d5f-9ef4-41b9-a29a-cad84a9053a0","resolution":{"observed_at":"2026-08-06T22:36:57.281898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.980873Z","title":"Filtering, distil- lation, and hard negatives for vision-language pre-training","venue":null,"work_id":"e9022aa5-02ca-48cf-86b9-55b7b9f4cf15","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.264276Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:e21c28a40ac5e02fb58c8cccbe2d089057edf9d2c851bbad2b55d88681c08a10","observation_id":"603d34ca-b464-4b79-affb-fcec8c418b06","resolution":{"observed_at":"2026-08-06T22:36:57.070655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.359825Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.359825Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:48bdf08028eca28dbd946d2743178555e5e06c7f7c529c7c027edcadd8e44140","observation_id":"c5de6fb1-fd74-4917-a404-c71029f69adb","resolution":{"observed_at":"2026-08-06T22:36:46.359825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T22:36:46.497678Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.497678Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:8a4127d4219ba6121237b38cd955a01a6e3ee5de9507ef728aaf761fb35524e4","observation_id":"54d4afd6-97ee-4556-b348-9bb92f1b3abe","resolution":{"observed_at":"2026-08-06T22:36:46.497678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.800746Z","title":"Zero- guidance segmentation using zero segment labels","venue":null,"work_id":"2528773a-0908-4bb4-a49e-435e21fd39fb","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.587155Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:26f845946c056add8635523c344dfcb6825618c5dd7c7de6fbb55f04898afb61","observation_id":"bcdc1e21-0cc8-4230-8e0d-5325b9b5e63a","resolution":{"observed_at":"2026-08-06T22:36:56.869198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.686677Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.686677Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:843662d66fe84e9afa25830e4086114633c0a8a876b418ef6e5d0b3a6fb75e8e","observation_id":"37ebec69-623b-43d2-8dd3-50d2be1383ee","resolution":{"observed_at":"2026-08-06T22:36:46.686677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T22:36:46.806895Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.806895Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f9951fc4227f939ce6fc8c0519044ab07b6f4049a799df942c807b9845185210","observation_id":"e32bfd97-c36c-496f-ad7a-5c05f34c0968","resolution":{"observed_at":"2026-08-06T22:36:46.806895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.577667Z","title":"LAION-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"b51c1245-8e04-462f-933b-4955485a6656","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.923658Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:2fe5c696e51f1c0f220580758090e4c0c4b13bfbd2d4dca0b1ac9f249e8404a2","observation_id":"700574c9-37fb-49ba-8225-ed76d2ca434e","resolution":{"observed_at":"2026-08-06T22:36:56.707483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08268","last_updated":"2024-07-11T08:12:16Z","snapshot_observed_at":"2026-08-03T11:41:23.844997Z","submitted_at":"2024-07-11T08:12:16Z","title":"Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08268","snapshot_observed_at":"2026-08-06T22:36:47.017637Z","title":"Ex- plore the potential of clip for training-free open vocabulary semantic segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.017637Z"},"links":{"cited_paper":"/paper/2407.08268","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:827c31ce63d9a621cbd48728a16028d76449bcd4935d1116984659592cd5a68b","observation_id":"1d84a963-fb5e-4ca1-9e78-8e53df002a54","resolution":{"observed_at":"2026-08-06T22:36:47.017637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.389093Z","title":"Reco: Re- trieve and co-segment for zero-shot transfer","venue":null,"work_id":"8c55b9cf-a6cc-4f57-bb8a-6ff56a722b6c","year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.128137Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:10504f3bcfd4f552e5c6c12ed8af391caaaef4b1c17bf06a1ec1fc74a060cc49","observation_id":"c4f2a0fe-8c59-4474-ba13-cc2f43d14b0d","resolution":{"observed_at":"2026-08-06T22:36:56.491432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.200666Z","title":"Is synthetic data all we need? benchmarking the robustness of models trained with synthetic images","venue":null,"work_id":"60c0d94f-f1a6-41c1-994d-b24e57a85736","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.268929Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:8eedd2671b1c9ce427355f131889bde9ab8b8a195ebd964ba3d52961e31e238d","observation_id":"e0a010d1-d229-44bd-8efa-cee0425f0b95","resolution":{"observed_at":"2026-08-06T22:36:56.304317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.931540Z","title":"Clip as rnn: Segment countless visual concepts without training endeavor","venue":null,"work_id":"ad4d661d-2c78-48ab-992c-38533ade1633","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.348154Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:33e371cbf18c02a4f0fe2717eea7d65a255565fe9e58d214efddfe626eaa500a","observation_id":"83d77fd3-a0b2-479b-8ae2-36eb0da908ac","resolution":{"observed_at":"2026-08-06T22:36:56.055550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.455196Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.455196Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:0df520806b95093b94e67c5e5aa6b9e811e9a02ec1e18bd4b2b8e8baf5c664a2","observation_id":"02be3e0b-e9bd-4d43-8b88-6728f84301b6","resolution":{"observed_at":"2026-08-06T22:36:47.455196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.664094Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":"e2a62460-21aa-425d-88fe-ffa48ec4ac18","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.584694Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:8d197fe90c413f9daab07db325538211b993bf664e657ff45f9c1abe0cd39a8f","observation_id":"5f87a123-372f-44e3-9c41-ef8a0c82ad77","resolution":{"observed_at":"2026-08-06T22:36:55.766792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.450790Z","title":"Sam-clip: Merging vision foundation models to- wards semantic and spatial understanding","venue":null,"work_id":"250c9651-541e-4af1-a84c-284534d6c877","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.680065Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c293a94b022ca0afda511d197c39960c05a051a736a0f36183dd9d5449e370d8","observation_id":"41427905-8526-4e77-8d91-442d53537a6f","resolution":{"observed_at":"2026-08-06T22:36:55.549572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02773","last_updated":"2024-01-22T07:18:55Z","snapshot_observed_at":"2026-08-07T23:37:35.393306Z","submitted_at":"2023-09-06T06:31:08Z","title":"Diffusion Model is Secretly a Training-free Open Vocabulary Semantic Segmenter","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02773","snapshot_observed_at":"2026-08-06T22:36:47.810899Z","title":"Diffusion model is secretly a training-free open vocabulary semantic segmenter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.810899Z"},"links":{"cited_paper":"/paper/2309.02773","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:d256762749a37d823877bbcfa6de3313135610a12e63e05603e591c1140c4462","observation_id":"309c8087-76f6-409b-b9a7-1eeabbd38cb1","resolution":{"observed_at":"2026-08-06T22:36:47.810899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.238032Z","title":"Use: Universal segment embeddings for open-vocabulary image segmentation","venue":null,"work_id":"eb7a84f2-626b-489b-8fc7-65db9705bade","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.971184Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:51f54d2ebe4eefb4fcef19df9b3d87c4309c9164072a2674c28e31297dae8226","observation_id":"f5ff4a74-34cd-4f60-822d-7ff79976c443","resolution":{"observed_at":"2026-08-06T22:36:55.340583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.040096Z","title":"Image-to-image matching via foundation models: A new perspective for open-vocabulary semantic segmentation","venue":null,"work_id":"367645e0-e05b-4be5-b405-5c6839992e65","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.097496Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:8dd1001887c2eb4d207d7a5a06ba055381911d6fa14a85bfc754b785690cc8a8","observation_id":"a4876ccb-0095-4a07-9b26-ce67a5934714","resolution":{"observed_at":"2026-08-06T22:36:55.129780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.879247Z","title":"Probabilistic pixel-adaptive refinement networks","venue":null,"work_id":"41c91342-fb05-4805-80c0-dddf12e24b1e","year":2020},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.256102Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a56091a7a96e0a2105be8f7c7870a2046aba2e8245d1522e4b5881f22f439f12","observation_id":"7c51c9f8-092b-4b3f-8468-bb066e5cb98f","resolution":{"observed_at":"2026-08-06T22:36:54.927224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.775528Z","title":"Image-text co- decomposition for text-supervised semantic segmentation","venue":null,"work_id":"0547094e-1a88-4a3c-a789-9c0d3ec763b8","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.365938Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:db2c8efe41541171f1a96a683478a068f1374aa8b8b9e42345fedb18a2766035","observation_id":"8eed80cd-4bf3-467a-b25c-edc5a6ed56c9","resolution":{"observed_at":"2026-08-06T22:36:54.827136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.573633Z","title":"Clip-diy: Clip dense infer- ence yields open-vocabulary semantic segmentation for-free","venue":null,"work_id":"871f13cc-8ace-4296-b526-0aea9a0d2a16","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.434137Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:13b7e822c54589c809fd16492f98d72573c460f9f7d4405a82eb416b4ab4f791","observation_id":"a08aac2d-72b3-4835-91a3-5794fd848797","resolution":{"observed_at":"2026-08-06T22:36:54.664824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.298652Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"588a7e60-5a5d-4bd6-a989-7a7488a15286","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.528678Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:dbe281e72356d3b2bef91d6589cd1a9402385ac11948f640c6a3a6d0fbab2a9e","observation_id":"b55d44bf-32a9-4afd-8a9c-0882d73331d5","resolution":{"observed_at":"2026-08-06T22:36:54.458882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.034669Z","title":"Rewrite caption semantics: Bridging seman- tic gaps for language-supervised semantic segmentation.Ad- vances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"93f6b965-b518-4354-ad13-d8f6250b8f09","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.616081Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:b12d716bd32994b269157f050c029f241b4b37e27df1504c23929937e682df0c","observation_id":"ab6c9639-e480-4eba-acce-1449f601e5fc","resolution":{"observed_at":"2026-08-06T22:36:54.145551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.843978Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"e7f12fbf-cfde-40e6-8701-6b0b71e11cc9","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.705840Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c7ae24e70ae03cb91aec407d6dd86d5eda396dc6406920792c221695293a11af","observation_id":"4c496ad9-1609-4cde-9375-aa13bb9887fc","resolution":{"observed_at":"2026-08-06T22:36:53.906607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.674156Z","title":"Learning open-vocabulary semantic segmentation models from natural language supervision","venue":null,"work_id":"a48b0a0a-e1f3-4d48-a36a-d2ddf94fa7c5","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.798359Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:85b6bf4f611277e8f34ea51946d7a4674a22dc6311bf097fa14b0c1063446185","observation_id":"66b577f4-10ea-46e7-b8aa-7ebf025f3ec4","resolution":{"observed_at":"2026-08-06T22:36:53.753127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.499217Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"dd4863ea-b8db-412a-aa2a-cc8f72f3b881","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.888577Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:7dec3e34e8577cc4938f19f06c7af94fc9edaf72f7a65ed418c47c9919d3b5f2","observation_id":"fc8ff5d2-783f-4225-87bb-08d2cd59cd79","resolution":{"observed_at":"2026-08-06T22:36:53.573724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.302954Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"edf7b696-0241-41c5-96be-940c14ebb484","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.982197Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:e06cac1f64baebdefeb4cc3bd25802e1431de74e0f0f6bb1b8a411cf89cb073e","observation_id":"be625883-898b-4e83-af6d-619f375df21b","resolution":{"observed_at":"2026-08-06T22:36:53.373398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.116060Z","title":"V AC-CNN: A visual analytics system for compar- ative studies of deep convolutional neural networks","venue":null,"work_id":"9e9da378-38ad-4b2a-8ecc-d421ccd8160e","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.041654Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c5c63595e609808e69e08b34ff0f08e9b6dbb1c859325e3f3feb289ebb58a0b1","observation_id":"ea1d4c6b-1f80-4025-be9e-86883b3755c0","resolution":{"observed_at":"2026-08-06T22:36:53.213445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.923211Z","title":"Suny: A visual interpretation framework for convolutional neural networks from a necessary and suf- ficient perspective","venue":null,"work_id":"33fc0467-0a89-41fb-b3a5-37bd48e748dd","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.112634Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:da8814d01b9df0b26bb656057a90a05171a1c0a87fa5f80b30d87f35f77d22dc","observation_id":"1ec1d09f-238b-4f3f-a1b0-cbdf222634b8","resolution":{"observed_at":"2026-08-06T22:36:53.030841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.713792Z","title":"SLIM: Spuriousness mitigation with minimal human annotations","venue":null,"work_id":"da4544ff-9f61-4047-bf68-72b8f876d97d","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.188623Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:d9e35c661cb88122a7427604afd8924323f66a3c4e903ee551a657301ee82481","observation_id":"181d2d2a-36bf-4b86-81b6-42412eec4de8","resolution":{"observed_at":"2026-08-06T22:36:52.810813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.492539Z","title":"AttributionScanner: A visual analytics system for model validation with metadata-free slice finding","venue":null,"work_id":"a2c1d079-2c56-4825-bdef-a241213e0725","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.284813Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:0b35634901b7f3ee7f84b4223272534a5eee3f357d766502d52316b0b5259ea9","observation_id":"83e490e4-ce6c-4795-8c24-9696f3cb06e4","resolution":{"observed_at":"2026-08-06T22:36:52.601357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.214035Z","title":"VISTA: A visual analytics framework to enhance foundation model-generated data labels","venue":null,"work_id":"3d344a4a-acab-4d61-b104-504fdb15783a","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.373969Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:5b5b8f5c8fe0d27c9f6ace083b474219b4a4f2a192b5780b090ddcd10faa6710","observation_id":"9e3cefe5-8395-4cb9-ae90-f0df2e3b1b36","resolution":{"observed_at":"2026-08-06T22:36:52.339810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.041159Z","title":"Vislix: An xai framework for val- idating vision models with slice discovery and analysis","venue":null,"work_id":"3014e12b-c866-4fcc-8c39-ed89bedf087e","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.475679Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:4b1c0ff2e01da7ba4ea57f4a304c3ba2b7f6f36daaf0be889760c081f4692dd1","observation_id":"3c3e2c41-bf7c-44ba-beb5-881c22edc89f","resolution":{"observed_at":"2026-08-06T22:36:52.130422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.822840Z","title":"A simple framework for text- supervised semantic segmentation","venue":null,"work_id":"adb16458-3936-4290-9415-c2af90c26433","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.564221Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:2c3349bba4680954158f59bb9cb2c7e88beaef3a86d07ead9dec340ed2d34456","observation_id":"d5d65c32-dd3d-42a1-86a3-778889d3e525","resolution":{"observed_at":"2026-08-06T22:36:51.956664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10086","last_updated":"2025-08-01T08:25:34Z","snapshot_observed_at":"2026-07-06T19:50:52.652955Z","submitted_at":"2024-11-15T10:14:55Z","title":"CorrCLIP: Reconstructing Patch Correlations in CLIP for Open-Vocabulary Semantic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10086","snapshot_observed_at":"2026-08-06T22:36:49.685565Z","title":"Corrclip: Recon- structing correlations in clip with off-the-shelf foundation models for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.685565Z"},"links":{"cited_paper":"/paper/2411.10086","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:91410487d1cea25951af1d4f225ca83ddc686f4d17726e27454baaf848c29e89","observation_id":"5cba2281-be1c-4c55-9237-96172f817b4a","resolution":{"observed_at":"2026-08-06T22:36:49.685565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.648089Z","title":"Tip- adapter: Training-free adaption of clip for few-shot classi- fication","venue":null,"work_id":"b122c40f-ec3b-4bab-9fcb-99fd00bd0167","year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.753856Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ef750b1ec73a94f5e73a588958e32901b64c94b5b687388fc3d16e7bdc2d57fa","observation_id":"4fab9d7d-1604-42b9-98f8-480652ec23e8","resolution":{"observed_at":"2026-08-06T22:36:51.720728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.404221Z","title":"Labelvizier: Interactive validation and relabeling for technical text annotations","venue":null,"work_id":"431e9d68-7d97-45d1-b176-a1a8748d5b2d","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.837476Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:819e0fda81f84d7e2e1f5f1cb544303b49dd7cbe07c7b7877f8a2e9d38b77dc6","observation_id":"6500ca74-6770-42a8-b284-04cce307a393","resolution":{"observed_at":"2026-08-06T22:36:51.537913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.170118Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"37d81345-352c-41bf-828f-965ebf0de453","year":2019},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.933174Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:945f6c552228a8588c2d93ffca157440c097328327085df9baea91c34da278f6","observation_id":"cb7908d7-b580-4ca3-8f1a-43ecba8a208a","resolution":{"observed_at":"2026-08-06T22:36:51.293736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:50.999735Z","title":"Extract free dense labels from clip","venue":null,"work_id":"7eb603ea-4863-488b-9f8f-8da3924b34cf","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.990789Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c4f10dfe8ca08657acf5b695f54bd2a210746124086bd8875aca429cfa965c89","observation_id":"3d7417e8-12e5-42aa-8179-965fb5ba9ca4","resolution":{"observed_at":"2026-08-06T22:36:51.084290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06594","last_updated":"2023-03-12T07:22:08Z","snapshot_observed_at":"2026-08-10T09:51:58.628373Z","submitted_at":"2023-03-12T07:22:08Z","title":"ChatGPT Asks, BLIP-2 Answers: Automatic Questioning Towards Enriched Visual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06594","snapshot_observed_at":"2026-08-06T22:36:50.080336Z","title":"The room has a cozy atmosphere","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:50.080336Z"},"links":{"cited_paper":"/paper/2303.06594","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f58c6ad419d2093ba166c6db316eb8920cdac59560919da8d10dada860d46109","observation_id":"5afc66ba-1db5-4322-8cac-109c8ec26260","resolution":{"observed_at":"2026-08-06T22:36:50.080336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:37:05.005748Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":55},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2506.21233."}