{"as_of":"2026-08-10T13:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31fb773bec80da48a7f4946c17b4340f0a5bc557527988c1ee6150f7bdeff4a3","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:00.551518Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16974/citation-record","integrity":"/paper/2505.16974/integrity","json":"/paper/2505.16974/citation-record.json","paper":"/paper/2505.16974"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:54:55.240935Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.240935Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:057d43eb3bf75cf072239f3fcf27d7f9140fdef31d7c8d054247f0e1bda285ee","observation_id":"df149757-9719-42f6-bd58-513ab091fd15","resolution":{"observed_at":"2026-08-07T14:54:55.240935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.984124Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"d442647b-8d2e-4504-b703-49dfa952c0be","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.363794Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:6e12a2b80169c397c089b2e1f38fa5a5cb44383d39b8fb30e907de060fa4a2b5","observation_id":"4578038d-0ddb-43cf-9d97-397ef8b17960","resolution":{"observed_at":"2026-08-07T14:55:07.079856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.820105Z","title":"Zero-shot semantic segmentation","venue":null,"work_id":"e6710209-fb1e-49be-a4e9-92ce33b60cfb","year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.471678Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:a7302527ba32bbc2f91e3f7b6b0afcbb583c5c8fe71dba07ec35b05d3345a7de","observation_id":"c2019963-a214-4127-b28d-8ac89486bb4b","resolution":{"observed_at":"2026-08-07T14:55:06.889923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.626333Z","title":"Universeg: Universal medical image segmentation","venue":null,"work_id":"85272797-4762-4148-b3ce-35717f66dc34","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.632824Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:e7df9788d7e3dad7acb27d96471d8be71f77d5421a2fe46272225c739fba8766","observation_id":"40020426-045a-4894-9068-7e192cc80a6b","resolution":{"observed_at":"2026-08-07T14:55:06.752714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.480013Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"f8cf83ff-21e6-44eb-8233-20918b31eb13","year":2018},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.725912Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:7284b89e2630eb1d81bc27fa0d8faf9a2f425bd674036ecf8810772d8d9356f8","observation_id":"49588e13-dea1-4ec5-ad0d-8333c24c4045","resolution":{"observed_at":"2026-08-07T14:55:06.536458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11324","last_updated":"2023-07-15T11:04:26Z","snapshot_observed_at":"2026-08-09T03:41:13.121428Z","submitted_at":"2023-03-20T17:58:48Z","title":"Open-vocabulary Panoptic Segmentation with Embedding Modulation","version":2},"cited_work":{"arxiv_id":"2303.11324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.11324","snapshot_observed_at":"2026-08-07T14:55:00.828696Z","title":"Open-vocabulary Panoptic Segmentation with Embedding Modulation","venue":"cs.CV","work_id":"66f5ecee-16b5-4fe7-999e-12cc3cc1ecb1","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.892210Z"},"links":{"cited_paper":"/paper/2303.11324","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:00fef1d97d2e9902259bdd8143b431f2dd0a18f55783ebba70db44b110c06279","observation_id":"c43c090b-7aa8-44f6-92ac-1a41cc932c59","resolution":{"observed_at":"2026-08-07T14:55:00.904928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.297915Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":"5cb9a2f0-5fca-47a8-a76f-3d340b76a8e5","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.030234Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:5e127c5e26dfa5701053111de82ebbcfba65ec1f3ac6936f96c1903f8166578d","observation_id":"b198457e-bddd-4661-9983-dad10af30503","resolution":{"observed_at":"2026-08-07T14:55:06.385908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:56.160013Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.160013Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:44dda2072dcb94c1023edce2f92353767c31408ecb81ff32cc57721dc8c578dc","observation_id":"0777d304-fb0f-4b12-97de-423a7a0ee9e0","resolution":{"observed_at":"2026-08-07T14:54:56.160013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T14:54:56.327756Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.327756Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:e9b25b9870768fdf9de59354cd431a038bd31186f8a57a486446fce08104146b","observation_id":"9cc0c596-ff2e-4e0c-995a-acd6b46f4722","resolution":{"observed_at":"2026-08-07T14:54:56.327756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.031265Z","title":"Decoupling zero-shot semantic segmentation","venue":null,"work_id":"39576bbf-693f-43e8-83b4-663ee116375b","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.447706Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:2fee623652199036061c7b260723524dcd11e0005ccd492fef1d3e50cbaa0404","observation_id":"aacaaa08-2934-415c-b5d3-e424452e28a6","resolution":{"observed_at":"2026-08-07T14:55:06.166465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08984","last_updated":"2023-06-08T06:35:33Z","snapshot_observed_at":"2026-07-06T13:43:13.386359Z","submitted_at":"2022-08-18T17:55:37Z","title":"Open-Vocabulary Universal Image Segmentation with MaskCLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08984","snapshot_observed_at":"2026-08-07T14:54:56.581313Z","title":"Open-vocabulary panoptic segmentation with maskclip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.581313Z"},"links":{"cited_paper":"/paper/2208.08984","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:56493a5d96889d29473b9c401fa17089d925ca4dd3ba1512355d51510fcc6f2a","observation_id":"83d48697-11f7-4868-a57c-3cf4d82be658","resolution":{"observed_at":"2026-08-07T14:54:56.581313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.796655Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"f76be5b3-44be-48fc-8e3f-97e81783f811","year":2010},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.708615Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:b84d18200eb2b3054a080fbe86499efa68584d72deb70ad32972eadd608d03ee","observation_id":"9cc51b88-a13b-40c0-a803-a88b04d905cb","resolution":{"observed_at":"2026-08-07T14:55:05.917178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.643106Z","title":"Scaling open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"84e83383-0ee1-40f7-9786-1ef2a157e62a","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.830080Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:3c1ee917b55c13873bca0e7796d3d707cac0e71acb37bf66a60b93a940676e55","observation_id":"5bd78bbe-6f87-441c-aa74-09563c718b7e","resolution":{"observed_at":"2026-08-07T14:55:05.707881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.402704Z","title":"Zero-shot semantic segmentation with decoupled one-pass network","venue":null,"work_id":"68cd0a3c-deef-4850-9602-394e88714b01","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.932257Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:aba79f72a2ebb1e72d087af526a379fd174064d97a3030b19d278791f9805d25","observation_id":"164f693e-1b65-4fc7-b736-8e0dadaeb057","resolution":{"observed_at":"2026-08-07T14:55:05.548234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.123687Z","title":"Global knowledge calibration for fast open-vocabulary segmentation","venue":null,"work_id":"7c2ee154-df85-48ef-a417-3addffffb610","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.039423Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c1fbc8987f2f50667f6f78d93877adf5c570a468124a4f99a7b11b01633a4dbc","observation_id":"d139baad-6cbd-4e96-87c4-e70358865c18","resolution":{"observed_at":"2026-08-07T14:55:05.221150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.870189Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"ea9ad3a2-c89d-4726-94b5-5d7e98955270","year":2021},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.163043Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:8e31d3e639b97cf5b2f4c4df8b889c8399df217071bac748de530dbdd82ffd67","observation_id":"7e81d9c2-8bca-4c7f-84d3-e4114901a61a","resolution":{"observed_at":"2026-08-07T14:55:04.972743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.674808Z","title":"Learning mask-aware clip representations for zero-shot segmentation","venue":null,"work_id":"f42aab2e-db28-4d53-937b-3f1d4bd14090","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.307185Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:466936fb721803845377eadbe9e658f4fd238388cd6ab8e469ca5465a4997535","observation_id":"f5f74da9-0825-4969-988a-a1e57ad87eed","resolution":{"observed_at":"2026-08-07T14:55:04.750944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.548776Z","title":"Collaborative vision-text representation optimizing for open-vocabulary segmentation","venue":null,"work_id":"12df4b1e-01dd-4fe0-9d60-ee0fabff7616","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.419543Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:99f74dd4d065458a27df0aa8d32b6c6edd5955c58235d1e418a46dd16406daf4","observation_id":"27036efb-9f51-4bc9-afa4-098bdee7fa1a","resolution":{"observed_at":"2026-08-07T14:55:04.621215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.425554Z","title":"Fineclip: Self-distilled region-based clip for better fine-grained understanding","venue":null,"work_id":"43b3fff5-76d5-4e79-b7a3-64f51c4e053b","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.531488Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4c9fc528e0b72d627123b32fe9ce2448c30d0666e2342e325c1d8f553b738d9f","observation_id":"574db350-6d7f-4060-8ecf-1d6ff4801ad9","resolution":{"observed_at":"2026-08-07T14:55:04.482616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.258994Z","title":"Language-driven semantic segmentation","venue":null,"work_id":"10125177-fa5a-4f8e-b6a8-3aa9648a125c","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.647856Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:962b321196ef97380bf543ce0af4b0c14e5c06e1b9273f47545d5da6e848be21","observation_id":"8320a18e-e446-40ac-95b9-c2e7059435f7","resolution":{"observed_at":"2026-08-07T14:55:04.388296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T14:54:57.749830Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.749830Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:8c62395e08d1e0b914a0ffa1b15a0d695aad11400b5772bde1bcc66ce2513900","observation_id":"b4383c59-9070-4d5a-ad65-30260036bff8","resolution":{"observed_at":"2026-08-07T14:54:57.749830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:57.910363Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.910363Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4d3b54ba5a1680363c29ee4bc5a55df0a5104cd8448d6167656eb8eb11243947","observation_id":"6dc1f31a-8330-4627-89cf-e9498b80aeee","resolution":{"observed_at":"2026-08-07T14:54:57.910363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.058849Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.058849Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:630286710d488837d36959e37c5ca6c45728506b20146e3eaa750bf719b6cb96","observation_id":"6e3c758c-288f-4ebd-aff3-ecf00a8b8acf","resolution":{"observed_at":"2026-08-07T14:54:58.058849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.183536Z","title":"Remoteclip: A vision language foundation model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.183536Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:0e4106dadbde1670247a77fb0bbbcbb9b51c058bf03709307b75aff45123f039","observation_id":"a7ad0235-1ac3-4b39-ba25-af92070b4925","resolution":{"observed_at":"2026-08-07T14:54:58.183536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.265405Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.265405Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:326cf74187b3306e49a11323adb3e04d9efa9199b9641f95822283558b83f236","observation_id":"612b4647-fc5a-4c37-ae34-c2c78ff30e6d","resolution":{"observed_at":"2026-08-07T14:54:58.265405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.052253Z","title":"Open-vocabulary segmentation with semantic-assisted calibration","venue":null,"work_id":"7262cb71-d8f8-41c8-9bc6-58fdd72f0736","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.325734Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:9134c2b2a444b0871f8a9d788c358a664c2d9f11e2a7bc83cd74ebd992d8e880","observation_id":"3e3b7e24-d71e-4fa2-9d5c-c84289256291","resolution":{"observed_at":"2026-08-07T14:55:04.111055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.395860Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.395860Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4d33b4208434cdf06c2764ca4d5fc0d5ff2a4e8c0f4730de52b2859643b6e5d7","observation_id":"828f60e5-2be0-455d-b510-ef587b841767","resolution":{"observed_at":"2026-08-07T14:54:58.395860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.926911Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"2fc563f9-6c6b-4a70-bfea-100f2466b38b","year":2014},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.464432Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:63e3dbe688e41e47f2d8dcb1a4286241c4b48f13ddf22a5ab0d2e824c4b1f33f","observation_id":"49bfb041-e989-46cd-9089-36ccbf3c9196","resolution":{"observed_at":"2026-08-07T14:55:04.002636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.780192Z","title":"Open vocabulary semantic segmentation with patch aligned contrastive learning","venue":null,"work_id":"93a1bd66-31ec-44f8-8600-efc71c16eb87","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.528576Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:b6272668747ee1b1c4e0630fbfc01f57e0c918b9eca5d1818fcc85d73514122c","observation_id":"0fd97115-b573-4bf3-b7eb-eb594cca3a09","resolution":{"observed_at":"2026-08-07T14:55:03.819317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.520542Z","title":"Multi-modal fusion transformer for end-to-end autonomous driving","venue":null,"work_id":"f6d1cd82-a0b5-412b-a288-1f2e7425a277","year":2021},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.607678Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:fafbb299119f7bae1379870c27cca03fd5f505b428089415f0beb4b7363186ed","observation_id":"07b727f7-4407-4391-87fe-a8bfe5b40612","resolution":{"observed_at":"2026-08-07T14:55:03.640330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17225","last_updated":"2023-03-30T08:42:49Z","snapshot_observed_at":"2026-07-06T15:10:01.106455Z","submitted_at":"2023-03-30T08:42:49Z","title":"FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17225","snapshot_observed_at":"2026-08-07T14:54:58.663806Z","title":"Freeseg: Unified, universal and open-vocabulary image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.663806Z"},"links":{"cited_paper":"/paper/2303.17225","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4362f056c1050ff03a2c177ac95a125e4732292ed41b3f5ef16c34814e619517","observation_id":"65821ae5-7d69-417f-b360-c715d3232fee","resolution":{"observed_at":"2026-08-07T14:54:58.663806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.342611Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"cc2ad7fb-8a90-4770-9526-9a81f79edc34","year":2021},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.739918Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:fead2671d7af9c649e5894d954b9939b0c4b739b24e5281da689150752b0e805","observation_id":"40fd47e4-5ccb-4d95-8057-d06f4e269c23","resolution":{"observed_at":"2026-08-07T14:55:03.433810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.191576Z","title":"Making monolingual sentence embeddings multilingual using knowledge distillation","venue":null,"work_id":"ea46b1eb-905e-4afa-b94b-b846073a2de7","year":2020},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.824637Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:2de7b4ebdcad499e4271fec1fec357ee3e0bb10a8c605c56e80aa86f4411e913","observation_id":"58b812b2-610e-4deb-9b50-9716536baee4","resolution":{"observed_at":"2026-08-07T14:55:03.276249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:54:58.916036Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.916036Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:dc45c28729f5a73899c28d099849907e448e11255c9e07363b2856cd46cf3076","observation_id":"980ea46c-73a8-4e5a-8a0a-02ee1dcdcd9d","resolution":{"observed_at":"2026-08-07T14:54:58.916036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00764","last_updated":"2023-12-21T18:28:31Z","snapshot_observed_at":"2026-08-09T20:51:16.992385Z","submitted_at":"2023-07-03T06:02:15Z","title":"Hierarchical Open-vocabulary Universal Image Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00764","snapshot_observed_at":"2026-08-07T14:54:59.006598Z","title":"Hierarchical open-vocabulary universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.006598Z"},"links":{"cited_paper":"/paper/2307.00764","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:15caf077789be6b92bb81797603502a6aed5ceab6a4a1de615c81ba0ec1404ab","observation_id":"88db6878-8b79-429d-91bb-cd8e387a1eed","resolution":{"observed_at":"2026-08-07T14:54:59.006598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.999412Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sensing","venue":null,"work_id":"03043109-6068-41c6-a7d3-4b3a15310f21","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.128753Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:6509a3371e45aa9855ddfc562d90e7fd063d4f13f26b50fa284e62258c926dc9","observation_id":"d0328e41-79fb-439d-bfa9-29ee22989ef7","resolution":{"observed_at":"2026-08-07T14:55:03.090513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.833616Z","title":null,"venue":null,"work_id":"8b7edefa-e56b-4af2-8b40-660c51adef5d","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.217814Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:6b0a0ede9ad05c44d27e354ae864115351545c9e2e4a04ea46989d72e91d7fe4","observation_id":"d05a8e1a-f177-4d60-9cec-c94438c6bcee","resolution":{"observed_at":"2026-08-07T14:55:02.915036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:59.291116Z","title":"Towards open vocabulary learning: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(7):5092–5113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.291116Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c72b351185a71e1613792d9e6f34e6fa29c4dcde62c6bc841750975195de374e","observation_id":"724773e4-fce9-46a7-ad91-2321f1791518","resolution":{"observed_at":"2026-08-07T14:54:59.291116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.631519Z","title":"Semantic projection network for zero-and few-label semantic segmentation","venue":null,"work_id":"4af998c1-581d-4a89-8320-1f67bb458ac6","year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.370838Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:b1143c9a282886b7cf20d67895922566e6d7ea8bfc25f4714b5826405a0a73ea","observation_id":"aaa4a721-8054-4507-a337-1d5eaba0f8da","resolution":{"observed_at":"2026-08-07T14:55:02.723235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.386824Z","title":"Sed: A simple encoder-decoder for open-vocabulary semantic segmentation","venue":null,"work_id":"3fa45c7d-7c5b-4836-a715-671ea3f98003","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.427761Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:8c2aa30bb1944cfee3420f7650602defe8d75699bb56391cbe0a125d0a48cecd","observation_id":"5c91a28c-d88e-495f-b5df-05e93952e17b","resolution":{"observed_at":"2026-08-07T14:55:02.473823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05071","last_updated":"2025-05-21T06:18:41Z","snapshot_observed_at":"2026-08-09T03:39:57.040395Z","submitted_at":"2025-05-08T09:06:53Z","title":"FG-CLIP: Fine-Grained Visual and Textual Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05071","snapshot_observed_at":"2026-08-07T14:54:59.478902Z","title":"Fg-clip: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.478902Z"},"links":{"cited_paper":"/paper/2505.05071","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:d5b98b6db5a8e340a06742adf5756cbbfb4d60676b13f306799a043ad3aa76c9","observation_id":"aa57dabe-d4a1-4abf-9dbc-0aa92135ffcd","resolution":{"observed_at":"2026-08-07T14:54:59.478902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.202322Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"ac03335d-b337-4733-9a50-339bd119e356","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.483387Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:d01c914b4089be7a89dfe104e93e90e456596ac9fa800a561523f13e185b4b07","observation_id":"c3f26acd-faf6-4078-bc6c-5d03ddd068f7","resolution":{"observed_at":"2026-08-07T14:55:02.312747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.015522Z","title":"Open- vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"f9e1f953-5ebe-4781-89a6-a7cef56f65ad","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.487505Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:bdc30edb1e0c617c4f2c7cc3c6bd17b6c9cccdcf0216764a1b4ed1b5a36316d2","observation_id":"3bb9c853-c64c-4a00-8b97-13231b6c07a4","resolution":{"observed_at":"2026-08-07T14:55:02.077359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.812016Z","title":"Side adapter network for open- vocabulary semantic segmentation","venue":null,"work_id":"74ab0aaf-2ceb-45fb-a1bb-0d35297b1f27","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.513964Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:0104265fd8859f77a83b1a3e25185d69b7c786a2c09996cf1ea80f9871ba8f6d","observation_id":"2f433679-d701-49d4-a2de-51dfafef1f24","resolution":{"observed_at":"2026-08-07T14:55:01.904214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.646857Z","title":"A simple baseline for open-vocabulary semantic segmentation with pre-trained vision-language model","venue":null,"work_id":"8784ab53-847d-4b4d-a969-014e55f60193","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.662103Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:a964b13581a47ccd68a354493993073240243b8e66a940a36818b3b548e01f46","observation_id":"7b46e5e6-873c-453c-ba2c-2b4741ec673e","resolution":{"observed_at":"2026-08-07T14:55:01.697431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:54:59.779546Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.779546Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c6a8fc5392ef73f71c4b71a9d879832ebc94f8de006b252eeb36fe0b1c3c7810","observation_id":"4ff54c76-ce13-40da-86d2-51777c03cf60","resolution":{"observed_at":"2026-08-07T14:54:59.779546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:59.859535Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.859535Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4223fe4c402ad2207f1fc28adc35d59e330918a8502c03232bcdc22a44eef2d3","observation_id":"ebb9b491-ccbe-4ff3-853c-9da6848c6fd7","resolution":{"observed_at":"2026-08-07T14:54:59.859535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02487","last_updated":"2023-11-14T19:10:49Z","snapshot_observed_at":"2026-08-04T01:52:38.789872Z","submitted_at":"2023-08-04T17:59:01Z","title":"Convolutions Die Hard: Open-Vocabulary Segmentation with Single Frozen Convolutional CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02487","snapshot_observed_at":"2026-08-07T14:54:59.953787Z","title":"Convolutions die hard: Open- vocabulary segmentation with single frozen convolutional clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.953787Z"},"links":{"cited_paper":"/paper/2308.02487","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c4829641211e233da7ffe167859bf92207f41c5819d39550ca1755e909574641","observation_id":"b30d5edf-523b-4beb-99bc-3da5699f1760","resolution":{"observed_at":"2026-08-07T14:54:59.953787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.490562Z","title":null,"venue":null,"work_id":"e9def4a3-b822-4a13-8b3d-47cec7164136","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.053025Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:104c82cda03d3c76cfe91a7d853e7e58c4289012674bbcd9006575747577493e","observation_id":"953fa962-b130-421d-9353-a104c2b3654a","resolution":{"observed_at":"2026-08-07T14:55:01.547819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.331159Z","title":"Open vocabulary scene parsing","venue":null,"work_id":"5baa35ac-0196-4443-a7c4-7c55e9613c23","year":2002},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.211996Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:f77212292695dd2cb9d39a443bb05a25473ac7bb36ee464c09d9926090f651e3","observation_id":"56f356e3-2342-4a39-b49e-c1289f74e590","resolution":{"observed_at":"2026-08-07T14:55:01.417148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.163858Z","title":"A foundation model for joint segmentation, detection and recognition of biomedical objects across nine modalities","venue":null,"work_id":"a9cf00c2-2fdd-4171-ac42-310668549f61","year":2025},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.310535Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:e5ca62d97ab1fdb5edaa0c9bc7b3b3adb8d0abe034c5b8db75e2f020f9b585a7","observation_id":"77bd9a7c-9559-4bf6-bba7-f28c2265ac16","resolution":{"observed_at":"2026-08-07T14:55:01.236717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:00.412108Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.412108Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:cea43988f39d4eb5a4d2348e6bbac0eb5b210e35a84b0ff8aa955c6fc3ded23b","observation_id":"815b547b-6a51-4578-85c1-b63601e02c2c","resolution":{"observed_at":"2026-08-07T14:55:00.412108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:00.991433Z","title":"Extract free dense labels from clip","venue":null,"work_id":"29f4df1e-74b4-42de-bb41-4c0c8061c015","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.551518Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:16b37616daefb35b87278df16d5898b2ee5ec917ff4c4294fd0b944efb111076","observation_id":"c2b565aa-38f2-4291-94d4-e5c6c474e51e","resolution":{"observed_at":"2026-08-07T14:55:01.051537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.16974."}