{"as_of":"2026-08-21T17:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45dd484876f9b15881211752970e483ee07b3569f80d0761cfd3ff52cb2a5279","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:13:03.252276Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:35.817428Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T05:53:04.501994Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02867","snapshot_observed_at":"2026-08-07T00:34:35.817428Z","title":"Resanything: Attribute prompting for arbitrary referring segmen- tation.arXiv preprint arXiv:2505.02867, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-15T03:29:11.892997Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.817428Z"},"links":{"cited_paper":"/paper/2505.02867","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7c1f01098d31cf3858bacefcede675853e6b534a783c2ff689649822dcf1193e","observation_id":"02ca7b66-8a4a-412c-a107-88844dd75ccc","resolution":{"observed_at":"2026-08-07T00:34:35.817428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"cited_work":{"arxiv_id":"2505.02867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02867","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resanything: Attribute prompting for arbitrary referring segmentation","venue":null,"work_id":"02843c95-3aba-4c3a-916e-1ee577fbe96e","year":2025},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-08-15T02:04:16.167034Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2505.02867","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:926c3d00b031a067b4b83c6e59b12a5c812d0616374b4cab43c5b6eb69951e24","observation_id":"1cef8875-6633-4341-81de-8bee780dfef1","resolution":{"observed_at":"2026-05-20T05:53:04.503579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02867/citation-record","integrity":"/paper/2505.02867/integrity","json":"/paper/2505.02867/citation-record.json","paper":"/paper/2505.02867"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.880302Z","title":"https://www.anthropic.com/news/ claude-3-5-sonnet/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.880302Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:775f2de29311bfd334899c23072ac32d9535b35af5210d56cc8ad32fa572f962","observation_id":"5faed085-23e9-453c-b605-7e492aeabd50","resolution":{"observed_at":"2026-08-16T04:13:02.880302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.885326Z","title":"https://blog.google/technology/ai/ google-gemini-ai/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.885326Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:9615cf769bf063fb19a4be8a435d289c4795c43684f8b869bb087b250a9701ae","observation_id":"3a5ad367-8009-4931-a43d-a3e69ff8a335","resolution":{"observed_at":"2026-08-16T04:13:02.885326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.889547Z","title":"https://openai.com/index/hello-gpt- 4o/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.889547Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:3f008c78f1eb11eb6bafcac5dc2c0eb1f50057eb70eed3c07f43542c8d69073d","observation_id":"cb5ca8f2-8dd3-4a94-bb43-4073cc415c29","resolution":{"observed_at":"2026-08-16T04:13:02.889547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-16T04:13:02.894731Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.894731Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:499ebbd9e35ab03e037a59caa13262a2a1280f3e1750318785aa9dff8f830601","observation_id":"366aef2b-7959-4959-856e-7fc21963923d","resolution":{"observed_at":"2026-08-16T04:13:02.894731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.900011Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.900011Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:32f32ddc25d1806d2924eea665bb41428f970513d82832ba1c1071fc0b6695bc","observation_id":"fe5cd3f3-7596-4112-9387-43f56b236733","resolution":{"observed_at":"2026-08-16T04:13:02.900011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-16T04:13:02.904796Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.904796Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:e517fde55f1b31ccee5a7588e67b40c7a965127ee58f64a053ed273f3f6a94fd","observation_id":"8be2e3ac-4f7e-4e45-b7ce-4d638d3fe9b5","resolution":{"observed_at":"2026-08-16T04:13:02.904796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T04:13:02.909344Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.909344Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:0d3f993445036987d94b52199b47145397502b5074195a6e4e1168b9a2b453b1","observation_id":"3b6ba853-7024-40ba-81e2-12b768b6b6c2","resolution":{"observed_at":"2026-08-16T04:13:02.909344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.915247Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.915247Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:a3c220728ef109e7172b2b424f9a227addfb1cdd84f0b5bbd5a4ff65a0f0101e","observation_id":"fd4e7132-6a82-464c-a398-5ee011ed3ef9","resolution":{"observed_at":"2026-08-16T04:13:02.915247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-16T04:13:02.919724Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.919724Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b0dd2a362fb206e7bcb80f2a95139c867ba7e989fea562ec87567e02de70b5a9","observation_id":"6b4b4e62-19ab-4876-80e7-4edfbc44441e","resolution":{"observed_at":"2026-08-16T04:13:02.919724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-16T04:13:02.925632Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.925632Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:332a5fd143236a93904995c0308da598e02dcbc3a31ec43a29d7fbf4c74150ff","observation_id":"b6cb7f59-cb17-43af-91c3-388b42d2affd","resolution":{"observed_at":"2026-08-16T04:13:02.925632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.929984Z","title":"Sam4mllm: Enhance multi- modal large language model for referring expression seg- mentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.929984Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:e4fdd621594a9ade23cb9e6d1eefe53d5b6e78b74f505b5dcf99d2367f613ccc","observation_id":"7fad7dea-a49d-45d0-9c08-f67a2ead09db","resolution":{"observed_at":"2026-08-16T04:13:02.929984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.934336Z","title":"Mask grounding for referring image seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.934336Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b35fdeb1c16f68224ce50e83557a69f3e1bd7855696220f6a336fd1f716fd204","observation_id":"6f310c33-96e8-49df-88a5-054b3c8be8d4","resolution":{"observed_at":"2026-08-16T04:13:02.934336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.164514Z","title":"Abo: Dataset and benchmarks for real-world 3d object understand- ing","venue":null,"work_id":"1953e4c8-2951-4ce6-8e3a-0ac785788a8c","year":2022},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.939863Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:fd122dfd9743f3f3788467d4b9d956f96fe50463846421add042108217d3e854","observation_id":"2ac8ffc8-f427-40bd-add6-b5b0501f93cb","resolution":{"observed_at":"2026-08-16T04:13:04.168985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.152592Z","title":"Simvg: A simple framework for visual grounding with decoupled multi-modal fusion","venue":null,"work_id":"db857dd9-1846-4fe6-8a18-d2c2e1cecdd6","year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.943584Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:cb0e9c5de5609a6505bd1d1b21245505d1c1ca68a3780cdaa0c1405c61bac516","observation_id":"68574412-7f87-4269-ac4f-cc73c38ea098","resolution":{"observed_at":"2026-08-16T04:13:04.156606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-16T04:13:02.947762Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.947762Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:847108f81d2e6aa9ac1e45b08a043e2a3c7c63ba998e03c348ed91fe6ee044a0","observation_id":"b7eafe87-069a-418e-b6a3-24993b8470ae","resolution":{"observed_at":"2026-08-16T04:13:02.947762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-16T04:13:02.951582Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.951582Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:acfc871f7f37c4437504169465193dde87712e51eff1fe63f1ae6ab06a91d475","observation_id":"a5a6b715-4bf8-4d0b-a584-4d16bf4a92e9","resolution":{"observed_at":"2026-08-16T04:13:02.951582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:13:02.955795Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.955795Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b9aad45877899dc2ffe0ea49fa8d35e71a36c280cea344feebe2ef4e8389f7f0","observation_id":"5d329c4e-8499-47ec-bf2e-af32e7ea8f72","resolution":{"observed_at":"2026-08-16T04:13:02.955795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:02.960071Z","title":"Vision-language transformer and query generation for refer- ring segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.960071Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:801cfe8d8308b38729963ed75ac0278af38052e3ec42963d7f8bb3c4cedfcb75","observation_id":"8a7c4cb9-8d2b-4592-b1fa-269dd7a64ef8","resolution":{"observed_at":"2026-08-16T04:13:02.960071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.133082Z","title":"Measuring nominal scale agreement among many raters","venue":null,"work_id":"5d3c4023-f15a-4572-9aaf-cfaa606df3c9","year":1971},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.964042Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:a1a677a0d8aec0c278de6c10e537a2d962075884b70f0f5d5437ad1f7c137ba0","observation_id":"f73e4735-08f1-4b21-b582-fc5228e05b95","resolution":{"observed_at":"2026-08-16T04:13:04.137133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-16T04:13:02.967603Z","title":"Llama-adapter v2: Parameter-efficient vi- sual instruction model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.967603Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:137ee20bcdebd752895c508115e4a4c330909ee4e3d97e0a595c941f47fbfed4","observation_id":"69adad77-9cab-4945-8ddb-83f404653f9f","resolution":{"observed_at":"2026-08-16T04:13:02.967603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.121250Z","title":"Seg- mentation from natural language expressions","venue":null,"work_id":"8795ac73-c2a5-43eb-bf75-b34d878716fd","year":2016},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.971263Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:d12718953782194747c0fbdf9e5ac41c7623b4c2ef88948c0fdc6008a6b1fb2b","observation_id":"606f8a24-fef6-4c74-8bd3-8f9370d5c51a","resolution":{"observed_at":"2026-08-16T04:13:04.124885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.109625Z","title":"Beyond one-to-one: Re- thinking the referring image segmentation","venue":null,"work_id":"4cda0d0b-8e40-4776-b803-f8cba3c3ba7e","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.975316Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:4fa97fa7bec8a139790b2294c9b347dc3b5b7c996990a34239e61ad8ce1d56b4","observation_id":"24d96f4b-461c-4506-a8b7-5d191837ee35","resolution":{"observed_at":"2026-08-16T04:13:04.113750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-18T18:36:22.241993Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-16T04:13:02.979935Z","title":"Diffusion models for zero-shot open-vocabulary segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.979935Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:d3a2273b8c77bbd7bd68c7ff46167ccb1ddd150f685ab1977563ea6407f830ff","observation_id":"20e08552-0b6c-4a83-8292-7219ead0d25d","resolution":{"observed_at":"2026-08-16T04:13:02.979935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.097837Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"e0efee43-cac1-426f-a076-eda56fe59a02","year":2014},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.984073Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:c84fc5171ed8edc55a305448c5be40d81b5da7ad7cc5e2824f5e9dceb2a615cf","observation_id":"aa9344ca-2954-46b6-a532-e0feb93937d3","resolution":{"observed_at":"2026-08-16T04:13:04.101816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.086317Z","title":"Segment any- thing","venue":null,"work_id":"14b2a4b8-b939-42d0-b31d-85305874baa7","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.988127Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:56d379ff4c0a67a568e9b1fc6fae03c6542420beedb29fe315a0774e98fc2234","observation_id":"4eb7146e-47aa-4106-8acc-66604cc74af2","resolution":{"observed_at":"2026-08-16T04:13:04.090329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.073604Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"54964deb-4c72-4542-9628-e33d4929ec31","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.992131Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b503a0916d9540218762c4efc5a9d7012e2cfeb0d924d7152d978c60c982ca1d","observation_id":"7e86f6ab-ee85-4674-87ac-345d52ef84dc","resolution":{"observed_at":"2026-08-16T04:13:04.078755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09855","last_updated":"2025-02-17T05:35:12Z","snapshot_observed_at":"2026-08-16T13:09:54.369885Z","submitted_at":"2024-10-13T14:28:16Z","title":"Text4Seg: Reimagining Image Segmentation as Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09855","snapshot_observed_at":"2026-08-16T04:13:02.995802Z","title":"Text4seg: Reimagining image segmentation as text genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:02.995802Z"},"links":{"cited_paper":"/paper/2410.09855","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:7c0b961173306ed4cae4ed357378cdbe65eb1d7777fa0fcc796592bd41c115f5","observation_id":"45e648c8-db85-4e00-afb9-fc9027b4afed","resolution":{"observed_at":"2026-08-16T04:13:02.995802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-16T15:25:23.093007Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-16T04:13:03.000205Z","title":"Mimic- it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.000205Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:0ed2876746f8e906680ae5b388a86d7a2930c9c7f101e9dfa06183e49ed7cc8c","observation_id":"f7a76263-635e-4c67-a090-4b60b30872a9","resolution":{"observed_at":"2026-08-16T04:13:03.000205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-16T04:13:03.004653Z","title":"Otter: a multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.004653Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:366bdfac147aac1a3611602e4c1cab32a541ea60192be9d02f38d2656c2df6fa","observation_id":"a3bf505c-457b-471f-a604-230498348e5e","resolution":{"observed_at":"2026-08-16T04:13:03.004653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.008467Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.008467Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:057452b7dbf261e1f55b680a09abd2a33b7f3e6e3bee2ff5b0dc95e5454aa636","observation_id":"bbecb0d9-9a4d-412c-92df-3ede19aad836","resolution":{"observed_at":"2026-08-16T04:13:03.008467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.012140Z","title":"Referring transformer: A one-step approach to multi-task visual grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.012140Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:5f2f01e056a9ee5a8b296cb87afadbe971188ba81a1f5a23dc05eb718cf26623","observation_id":"3b309d98-b8e0-4016-ac6c-48c558773070","resolution":{"observed_at":"2026-08-16T04:13:03.012140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.048226Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":"56170eaa-4011-4d2d-a4ee-ad254d201f3f","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.016217Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:a755bc1378ed6f04cf1d02dd2718540e01f9dab0981e1e2d9c1eb364db2f5702","observation_id":"d9de2ce5-8d14-4f9d-9e71-57c73a05c6a0","resolution":{"observed_at":"2026-08-16T04:13:04.052142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.020389Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.020389Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:718a08558ea4f85d1559f2ef48b6a481ed87f64b815ff3507eb6d476c30c8a31","observation_id":"e75aff2a-3135-44b8-adc2-d8bef5fa75cc","resolution":{"observed_at":"2026-08-16T04:13:03.020389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.024496Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.024496Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:e7b78c1b19a9a46cb1fb36e91ff0f3a17a58ddae08a9d14201ffc43349313553","observation_id":"1ed93e33-bd3f-4ecc-b5e7-1db8d46f1ca8","resolution":{"observed_at":"2026-08-16T04:13:03.024496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.028272Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.028272Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:c84368313e532227212aa722a6383b9fdfc58df5067b42c5b761bb5b45dcdc57","observation_id":"da1e902c-df58-4910-9d5e-ff8f4f998441","resolution":{"observed_at":"2026-08-16T04:13:03.028272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.017134Z","title":"Poly- former: Referring image segmentation as sequential poly- gon generation","venue":null,"work_id":"54634fd0-315b-4f4a-9b8a-81ff6b3e6bd0","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.031841Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:f448787f0b6f2629f43a2e415ea4fa68b97b3340954da1b3bcae8975332c3ab5","observation_id":"6604a861-49dd-483d-a225-d621f0983b42","resolution":{"observed_at":"2026-08-16T04:13:04.021113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T04:13:03.036518Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.036518Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:891abb528492e78df7951191ec98a17ff6b3da0c7e352b77befce31bb997316d","observation_id":"6e59718f-5cb3-4106-ad30-7b45af33ba25","resolution":{"observed_at":"2026-08-16T04:13:03.036518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:04.004565Z","title":"Refersam: Unleashing segment anything model for referring image segmentation","venue":null,"work_id":"d6719629-645a-48f2-9643-f37c129f511b","year":2025},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.040539Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:7295ba18af0f4034960545e09f9e5f47480877b23ff44ceaf96296401df315aa","observation_id":"56814694-4310-4ecf-9830-5db2e5acd342","resolution":{"observed_at":"2026-08-16T04:13:04.008584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.991360Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"264e842e-ed68-4ca2-b846-086470f94f58","year":2016},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.044342Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:2103b995b248a9b428038b33ebf842501191cbbf330981bfb63b404c1a5a229b","observation_id":"a65154b5-3b96-46cc-acbc-0602e5d55a24","resolution":{"observed_at":"2026-08-16T04:13:03.995881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.978817Z","title":"Safari: Adaptive s equence tr a ns f ormer for we a kly su- pervised r eferring expression segmentat i on","venue":null,"work_id":"d86d5bec-4981-4ea3-ac90-a3ea2cb3d403","year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.048844Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:630a55c8929c2ced210b3e6937b7c0a59378693e3a08552890c2d9a8c2ffc671","observation_id":"6ba07208-ba41-49f8-8341-d5cb4ba4431b","resolution":{"observed_at":"2026-08-16T04:13:03.983658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.053288Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.053288Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:3f0dc586b1e292a65b64c95e92e3ef445797db828b554ee20dea0ba39bc4c4d5","observation_id":"50be4751-e291-4bd1-a335-d274bbdaf4d7","resolution":{"observed_at":"2026-08-16T04:13:03.053288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-16T04:13:03.057631Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.057631Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b1e91792af64d671d5ad89fc6840538b5a6a0aa1d0a9ec5a4c1e36eb479d2954","observation_id":"02421131-3e95-4c93-88a4-b5aab587c347","resolution":{"observed_at":"2026-08-16T04:13:03.057631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.960173Z","title":"Jack of all tasks master of many: Designing general-purpose coarse-to-fine vision- language model","venue":null,"work_id":"76d73065-4a51-4bbf-bd16-3a2988b84fc5","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.062566Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:34fadf82e37e55200daf792d58629a3c155c72e7966299e019ab78153683333c","observation_id":"a77ef161-d392-45ee-aa16-524c4d72f7a3","resolution":{"observed_at":"2026-08-16T04:13:03.964219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.066618Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.066618Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:368297cb5adafcf809f060d66698c5ac313b746697c430e8d2be8809d5ef5e35","observation_id":"b3fcbfa2-ed7d-45cd-9777-2963582322c0","resolution":{"observed_at":"2026-08-16T04:13:03.066618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.940046Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"b3552455-3aa3-43c8-90d9-209d5f08a7a8","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.070742Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:8b68930a2e5395ce4906d10b9b98a2870b86b02be0807347807ffd228caf4f1b","observation_id":"e1c68f1d-368e-4d50-99f8-e8004ea72134","resolution":{"observed_at":"2026-08-16T04:13:03.943982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-16T04:13:03.074749Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.074749Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:89d60f0970bc9523b5f65ed7d8aa09a1d061ccd90ea49a98b04c90a590e91199","observation_id":"aa6bcad0-8fb1-4761-9c87-6547ea5760b6","resolution":{"observed_at":"2026-08-16T04:13:03.074749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-16T04:13:03.078616Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.078616Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:82f959faeff9e234f2e5bf72e55dd1b238401c40dd55d678f6a94ebc8580b187","observation_id":"d35674f0-70fe-4d3a-a590-cd003acb6a62","resolution":{"observed_at":"2026-08-16T04:13:03.078616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.928779Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"8e97cb59-af90-4d89-8485-d288149d8fce","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.082601Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:beaa15f32163ecf305982c59ca3dc9651286b61613ba0ce70abe28cb4897cbf1","observation_id":"25e66a2e-f2d7-4f32-956f-1de3a72f4865","resolution":{"observed_at":"2026-08-16T04:13:03.932626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-16T04:13:03.086201Z","title":"A systematic sur- vey of prompt engineering in large language models: Tech- niques and applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.086201Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:8b28901092aa38c1261d9d64b3c88b1ad65120f69de138959592c47cfa82a412","observation_id":"57d2beed-0be9-4eaa-b0d6-c9debd1578b6","resolution":{"observed_at":"2026-08-16T04:13:03.086201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.916463Z","title":"Key-word-aware network for referring expression image seg- mentation","venue":null,"work_id":"a310f6f7-bd30-4789-934d-595fe87c297a","year":2018},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.091509Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:e5e84b2933da11629145ac0dd2d1ff5f7736a42651f12c4b0b7b529057c3c54f","observation_id":"3044e421-792a-4e5a-9cf8-e5de167c36df","resolution":{"observed_at":"2026-08-16T04:13:03.921141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.095661Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.095661Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:fa3527c5d625a45999aee2634213f47175b44b2abef91648038aa6b9201ddec6","observation_id":"4fac091e-15d6-4cc9-8e16-04b0dd65a0bb","resolution":{"observed_at":"2026-08-16T04:13:03.095661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.897767Z","title":"Clip as rnn: Segment countless visual concepts without training endeavor","venue":null,"work_id":"2250b9c4-bd23-448a-b2e5-c50f19dc1cfd","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.099813Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b8cee63934d00bd563bccbb805d6c73cf2f9da77ffa4df502a4ef81a4b2be5cd","observation_id":"715bf89d-3d90-42e8-a143-a1ce2406dbd2","resolution":{"observed_at":"2026-08-16T04:13:03.902340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.886402Z","title":"Vrp-sam: Sam with visual reference prompt","venue":null,"work_id":"ab2c781e-b5f3-41a4-b282-5a16d49dd553","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.105238Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:e0d7d4ed6fc13e24aee7120dbadba0e780f81aed6beb22085f082acfde6255d4","observation_id":"ecc25ac1-87e6-40e3-b567-7500b249dc93","resolution":{"observed_at":"2026-08-16T04:13:03.890299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18049","last_updated":"2023-10-27T10:52:50Z","snapshot_observed_at":"2026-08-16T14:48:19.526154Z","submitted_at":"2023-10-27T10:52:50Z","title":"Text Augmented Spatial-aware Zero-shot Referring Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18049","snapshot_observed_at":"2026-08-16T04:13:03.110101Z","title":"Text augmented spatial-aware zero-shot referring image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.110101Z"},"links":{"cited_paper":"/paper/2310.18049","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:d2a877c02e62e986b5986bc30ccb82698402a8b214d4e66d5092fef9d7642407","observation_id":"d36b1291-f51e-4dd3-b547-ceed6c69a4cf","resolution":{"observed_at":"2026-08-16T04:13:03.110101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.114840Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.114840Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:658f41d7484228df5defcfdbcd15b0f817d881880ade60aa6dcf8928a35d30c8","observation_id":"5c67b9ca-af74-4375-a038-2010504ad702","resolution":{"observed_at":"2026-08-16T04:13:03.114840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.868642Z","title":"Unveiling parts beyond objects: Towards finer-granularity referring expres- sion segmentation","venue":null,"work_id":"de657758-61bd-405a-a08f-17b7b4b9521a","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.119176Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:2398799247c12f084a05f13b4c0e51c583975883ae7ddc5b6b9b6ece82005bab","observation_id":"cba33339-946a-4507-96eb-97db097724f5","resolution":{"observed_at":"2026-08-16T04:13:03.872647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.856685Z","title":"Cris: Clip- driven referring image segmentation","venue":null,"work_id":"c9ebf825-b381-480b-9904-1d89c5874b95","year":2022},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.123459Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:5e5ce486ab16fe96eb24a6147091c3db153ad5430fe1ed00d35a20ff7f7a5ed9","observation_id":"91378316-c9a2-45c7-8b69-3271a6db9596","resolution":{"observed_at":"2026-08-16T04:13:03.861045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.127510Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.127510Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:1b8059f75b84773687409b97a198f19e71be619076973617b2f9ba972f8b204d","observation_id":"f86d8a10-e64d-43ea-9a95-5df21d662a86","resolution":{"observed_at":"2026-08-16T04:13:03.127510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.06429","last_updated":"2023-03-22T12:01:42Z","snapshot_observed_at":"2026-08-17T00:28:46.148222Z","submitted_at":"2023-01-16T13:38:22Z","title":"Linguistic Query-Guided Mask Generation for Referring Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.06429","snapshot_observed_at":"2026-08-16T04:13:03.131350Z","title":"Linguistic query-guided mask generation for refer- ring image segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.131350Z"},"links":{"cited_paper":"/paper/2301.06429","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:999fd79c63d7ac99fe61eb3d0fed359c7070deb354c80c0551730815a50ed5d7","observation_id":"bd10d382-138d-4919-893b-e044be659c0f","resolution":{"observed_at":"2026-08-16T04:13:03.131350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.837469Z","title":"Segment every reference object in spatial and temporal spaces","venue":null,"work_id":"ae840437-7bdd-419a-89a0-78014417ea2c","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.135782Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:4a1ebed6944a43a47c0a824e40b4ca666caddf7a50196fc3686d8e280d37ff59","observation_id":"fad851ff-cb10-4144-8c51-b225a25893b2","resolution":{"observed_at":"2026-08-16T04:13:03.841506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.824922Z","title":"Towards robust referring image seg- mentation","venue":null,"work_id":"c1aa6490-dc70-486c-86d3-73827af9923c","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.139573Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:4e359b265a5c90bdb4c84f6349296ef0a1a202647cacc2da0caf661388e075e5","observation_id":"77967c65-cf69-41e8-95bc-3d9183b37a6f","resolution":{"observed_at":"2026-08-16T04:13:03.829233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-20T05:08:08.234059Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-16T04:13:03.143880Z","title":"Visual prompting in multi- modal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.143880Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:f416471eaf1caa269cbaf43a76941a7c3fb7875cdf48ec0fe482def1c66ca0f9","observation_id":"d6493031-f15e-4d6b-89bd-07a727d51fa0","resolution":{"observed_at":"2026-08-16T04:13:03.143880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.812791Z","title":"See say and segment: Teaching lmms to over- come false premises","venue":null,"work_id":"54a8e698-6ca0-4963-a033-e064faa590d0","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.148082Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:36acf0530c5141271936822346b8b6a86d934e9506f4e7126e4fd8acd8f6a648","observation_id":"3c1bf1d5-da0f-4b8b-9df5-e991bf7de7c8","resolution":{"observed_at":"2026-08-16T04:13:03.816988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.799827Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"963a68ea-1bfb-42c1-8ee8-da453bdd5505","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.152119Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:2f99b206fd0a93dcf02d1b694d24b640d18afee19cc8e26d05f50ca7acb792a7","observation_id":"ab1f7b10-2f8a-4031-b017-3f7e2411c76a","resolution":{"observed_at":"2026-08-16T04:13:03.804896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.156263Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.156263Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:2d6535ce065a58ae9d62c9d1589845f002639c967b80d04de2f8b25897bd1edb","observation_id":"d5f64165-acb1-4df4-8254-85dd4418081e","resolution":{"observed_at":"2026-08-16T04:13:03.156263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.780097Z","title":"Oneref: Unified one-tower expression grounding and segmentation with mask referring modeling","venue":null,"work_id":"75d3d24c-b616-43a5-be71-3a586a6f5afe","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.160726Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:34b292d2e951e4278a5fa66d4055d043bf139b1aacb1c646c364a78740473bc3","observation_id":"60e76e86-71e4-498f-8dde-c78c9ce9f2bc","resolution":{"observed_at":"2026-08-16T04:13:03.784479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.766646Z","title":"Pixel- aligned language model","venue":null,"work_id":"cb434d49-c73b-4695-bb75-56c2758f0470","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.165184Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:d3bccd27f521881858f5ad36eb2b859d66b92aca5f69960f457789927df98a81","observation_id":"74e8e888-a60b-4c96-9e34-dd3d10610035","resolution":{"observed_at":"2026-08-16T04:13:03.771500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-19T05:29:03.467497Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-16T04:13:03.169164Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.169164Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:69c959058562b8bfad0caa084fb4564e2ee747c5b83e466c09f27cc3d423cd8f","observation_id":"4207f9a5-e042-4533-96ab-33b5cfcdf685","resolution":{"observed_at":"2026-08-16T04:13:03.169164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-16T04:13:03.173773Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.173773Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:c58a0ecc7b80d967e6e5c05d6c67f35f6e621aa7f67fced6c495a3665be8d5bc","observation_id":"5679b391-b1db-414d-9fff-81c42a81a35a","resolution":{"observed_at":"2026-08-16T04:13:03.173773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.754852Z","title":"Fine-grained visual prompting","venue":null,"work_id":"8591c8b7-266e-4db3-9b13-c374411083b3","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.177984Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:70ebbfbf62e3ed1ce7ee14e926d23cf83f2b1127fbf71d93656fe820d623dbad","observation_id":"c4e4af64-c3c5-477c-b052-b5a8a5eb4f7a","resolution":{"observed_at":"2026-08-16T04:13:03.758923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.742877Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"78b4fd53-7fd6-465c-b488-399acd9944f7","year":2022},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.181774Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b82b42d203465ed1b604dcd3e94649c95154ffb17ef8c92a4b8c818b7359079c","observation_id":"c305604a-2622-40a1-94da-d1989da4e372","resolution":{"observed_at":"2026-08-16T04:13:03.746995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-16T04:13:03.185714Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.185714Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:8a483a7d588d1b162b12bf6e48a08fde569b55d7748ba04f81067c3124d0e248","observation_id":"ad41f841-414c-4c45-adad-456c8d368513","resolution":{"observed_at":"2026-08-16T04:13:03.185714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.731043Z","title":"Cross-modal self-attention network for referring image seg- mentation","venue":null,"work_id":"7c788f5d-b329-40f2-b81a-5b9f3cff406d","year":2019},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.189717Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:43ea393a94b9e3a3fdbeb0073b0b0f1ac71508491cff50d0a324f19d67192e2f","observation_id":"42096203-7060-42af-b387-8927122711c2","resolution":{"observed_at":"2026-08-16T04:13:03.734976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.193843Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.193843Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:42677054d45b23dd4921ec10521353ddea4514f1d4f16e60507c287f2d53f9b4","observation_id":"8d043a65-a67e-48ab-b8ab-9f2abbc7bd17","resolution":{"observed_at":"2026-08-16T04:13:03.193843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-16T04:13:03.198129Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.198129Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:4dc3b1350e563313cf5a24b1a0c0bc87657488281e1737342974fe291c6f83b8","observation_id":"86aa3aaf-c892-49bc-a211-8675829167be","resolution":{"observed_at":"2026-08-16T04:13:03.198129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.202525Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.202525Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:b8dbf26c598c47c619f1083009dc4b12d90d51ca7d0ea70edf44922585e93e23","observation_id":"692d08b5-dfe6-4d9d-803f-bb470521d135","resolution":{"observed_at":"2026-08-16T04:13:03.202525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.702085Z","title":"Zero- shot referring image segmentation with global-local context features","venue":null,"work_id":"c3cc34d6-584b-4929-a3b6-7fb4db2815fd","year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.207223Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:d8e9532c759ee1d6518b2067aa5547728569b266e513280be5198eebe8f5c52f","observation_id":"abfb590d-90b0-455a-b5eb-7c123a2f58e4","resolution":{"observed_at":"2026-08-16T04:13:03.706951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.688171Z","title":"Osprey: Pixel un- derstanding with visual instruction tuning","venue":null,"work_id":"f8b54b3a-5dcc-48cf-aa3f-4e0b8e148a61","year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.210999Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:9c40c19f59d51727d8878031b43bd42f434540b629d625e458ebc25833829358","observation_id":"7b8834b4-7f3f-474c-be28-d2ff5a69b208","resolution":{"observed_at":"2026-08-16T04:13:03.692554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04498","last_updated":"2023-12-18T12:15:26Z","snapshot_observed_at":"2026-08-16T14:45:03.803175Z","submitted_at":"2023-11-08T07:15:05Z","title":"NExT-Chat: An LMM for Chat, Detection and Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04498","snapshot_observed_at":"2026-08-16T04:13:03.214992Z","title":"Next-chat: An lmm for chat, detection and segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.214992Z"},"links":{"cited_paper":"/paper/2311.04498","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:92ed2342327d58d62b27bb5dac915d67aba8a621220b5447c2255cd0d3e9713a","observation_id":"3b2259c0-761a-4117-b270-ae80d1b8b9c7","resolution":{"observed_at":"2026-08-16T04:13:03.214992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-19T05:13:34.535041Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-16T04:13:03.219515Z","title":"Gpt4roi: Instruction tuning large language model on region- of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.219515Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:98b881f1289af92ef251c86e5c7ce4da185ef48c554352a4a87712f85be8a71c","observation_id":"50c3f1da-23ba-4f44-a4cb-600a4fa440b9","resolution":{"observed_at":"2026-08-16T04:13:03.219515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-17T08:49:26.984989Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-16T04:13:03.224984Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.224984Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:9c5372e834c2d155a03e990273eaf1e6365b9d07cd22770a7d64ee9dd4c34bab","observation_id":"d7ab5fd4-a47b-44dc-9b09-88ef87b95205","resolution":{"observed_at":"2026-08-16T04:13:03.224984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-16T04:13:03.230614Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.230614Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:258546f4e9a2325965c543aee43da8be826711b2eee4c5ebe918dc63fab2b9f9","observation_id":"b1c3bbed-f522-4f09-a95f-6f74449b07b3","resolution":{"observed_at":"2026-08-16T04:13:03.230614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.673330Z","title":"Coupalign: Coupling word-pixel with sentence- mask alignments for referring image segmentation","venue":null,"work_id":"72f188d6-02b4-4b74-893e-da69b87217c5","year":2022},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.235065Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:a4ea30a3ddb9a61174444eb99927a1cf333a285d0208ea21dc553b602682333d","observation_id":"6b251c4d-7561-46f8-aac9-8e0aa5477555","resolution":{"observed_at":"2026-08-16T04:13:03.679491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-19T15:15:13.657700Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-16T04:13:03.239018Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.239018Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:c2084db2807d84c59cb185cba85ad534c9808614a24b5afb4a52f269184c4bb7","observation_id":"4f76de8f-389e-4041-9817-7a538aa97af0","resolution":{"observed_at":"2026-08-16T04:13:03.239018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-19T20:26:10.685439Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-16T04:13:03.243448Z","title":"Tinyllava: A frame- work of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.243448Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:babb864d9c8ff8ebc57c125c7a1c1905ceffdb8c46f483d2215571ff8ce4c36e","observation_id":"923d3ab4-dfa2-4524-8598-be59a180219a","resolution":{"observed_at":"2026-08-16T04:13:03.243448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:13:03.248137Z","title":"Extract free dense labels from clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.248137Z"},"links":{"citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:85d8057f910169c263787bd289a57f290bc306d981f536d5d66527a02590877d","observation_id":"52919938-b11b-4772-bcd4-223b77cbd5c2","resolution":{"observed_at":"2026-08-16T04:13:03.248137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T04:13:03.252276Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.252276Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:6b51f8576347aac8684b3580f0adbf6b0f2fd22aebdabffd692c2e235912e54c","observation_id":"87011d76-ac01-4ccf-ac33-3afa1b85356b","resolution":{"observed_at":"2026-08-16T04:13:03.252276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T17:09:28.763067Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 2 inbound Pith citation observations for arXiv:2505.02867."}