{"as_of":"2026-08-08T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34f45d281a12f9b621ded6cd6143b77ba35db61555281384821eae5d542a78b7","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:25:03.219873Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16213/citation-record","integrity":"/paper/2507.16213/integrity","json":"/paper/2507.16213/citation-record.json","paper":"/paper/2507.16213"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T15:25:02.937567Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.937567Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:1f162bafa04c1bacc8ac171f3822503970b9f00c434e57c69705e750692fd496","observation_id":"661f57e2-4e32-438c-b154-cecc90c08493","resolution":{"observed_at":"2026-08-06T15:25:02.937567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.941989Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.941989Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:e99ef3dd6ae5cba4f9ae57b1b5914e08d4e5b4924a25f1f06d6f07038c431ebf","observation_id":"a6ac2b05-fc2e-46be-ae01-43ad91b33401","resolution":{"observed_at":"2026-08-06T15:25:02.941989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.944924Z","title":"See-through-text grouping for referring image segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.944924Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:b47ee67957f092f4039955b8a3a954a7e62e00a68f5fb781de1fd2e60fbe2854","observation_id":"31b4a95e-7c6f-425c-b80d-b069b98b2a3c","resolution":{"observed_at":"2026-08-06T15:25:02.944924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.948306Z","title":"Hybrid task cascade for instance seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.948306Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:6ccdddb740ed877152c4b40d6716821b4a9b212f69bc91fdb53b421cda4b4a97","observation_id":"47df1633-dd0f-4905-95a1-a9e790ebee79","resolution":{"observed_at":"2026-08-06T15:25:02.948306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T15:25:02.951332Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.951332Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:181a31a2c574a18f648e449461d0fe9a4d4303e961419e4572a2e0f33776db6e","observation_id":"7f727e24-feac-491c-87f6-c04008f95c50","resolution":{"observed_at":"2026-08-06T15:25:02.951332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.954769Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.954769Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:f198fca9a1ee1a03922cb06b6c290e7fc6ab97078261276b9373bd650bb8ec96","observation_id":"63d09218-62d6-4d70-9ae5-a041c6419513","resolution":{"observed_at":"2026-08-06T15:25:02.954769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.957777Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.957777Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:2bb1da3146494a9131a40c969eac93b60b860f94516c196ab65bea19324a97eb","observation_id":"bd29b6f5-3711-4d88-99ad-f6bbd9fa9895","resolution":{"observed_at":"2026-08-06T15:25:02.957777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.960867Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.960867Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d196b48f203e3063db60d09ff4d573f1f355855d4897a9a512bae55380b77e03","observation_id":"ab19eb58-68c8-41ff-8140-995f6a9f6a23","resolution":{"observed_at":"2026-08-06T15:25:02.960867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.963638Z","title":"Phraseclick: toward achieving flexible interactive segmenta- tion by phrase and click","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.963638Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:95135458fa0dfad7c81d88363f084f587987671d17734447b16e5fec00a700e9","observation_id":"898316a0-dea6-4eea-9633-15ea60828160","resolution":{"observed_at":"2026-08-06T15:25:02.963638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.966434Z","title":"Vision-language transformer and query generation for refer- ring segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.966434Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:a7d79d321ef74fb1444bcc20ae49e7a93bfbfac629bcc1637f040c5d34a9397f","observation_id":"b1f8d708-1c0e-4e9b-9ad4-979bbb24ecc8","resolution":{"observed_at":"2026-08-06T15:25:02.966434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.969366Z","title":"Open- vocabulary universal image segmentation with maskclip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.969366Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:dc18916d7afb3bc5c08ae58738bbad974359046620beb901d9fa65e74758e1de","observation_id":"83ff79e8-4352-442e-be00-2935499567f7","resolution":{"observed_at":"2026-08-06T15:25:02.969366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:02.972553Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.972553Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:8237de444141fd707f76d83b7562a07ab024e3aa38c0f9bbbb7c085549f86737","observation_id":"1c7f3ab4-afa8-4929-a9b5-0f808f00106e","resolution":{"observed_at":"2026-08-06T15:25:02.972553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.877274Z","title":"Scott, and Weilin Huang","venue":null,"work_id":"6be8b34d-39aa-41f7-b948-cbca4772434e","year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.975450Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:247633b97356f866a03cae32d2903484d14a747b3a34ece6aa1e41a35ba5e3ac","observation_id":"7bcd79f2-9a5a-4a80-97f0-ca091d410fc5","resolution":{"observed_at":"2026-08-06T15:25:03.879861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.870101Z","title":"Prompt- det: Towards open-vocabulary detection using uncurated im- ages","venue":null,"work_id":"b8952769-8543-4c70-9f83-15db025102ea","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.978290Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:fe6197b7f08f4a908a20bed0fafee48d51526b37ea04f5bafca02b4710f188f5","observation_id":"663cab1d-8cc8-4886-9358-6fe0e6212210","resolution":{"observed_at":"2026-08-06T15:25:03.872634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.862695Z","title":"Instagen: Enhancing object detection by training on syn- thetic dataset","venue":null,"work_id":"8a5b271e-f72f-4444-8630-bae0f915ce92","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.981188Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d47211cddb534c45eb7369a34826598e542997ce96e0eb4e0615080fcbb84cf3","observation_id":"44550596-7f95-4528-9499-cfb82c36b281","resolution":{"observed_at":"2026-08-06T15:25:03.865238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.854850Z","title":"Video-r1: Reinforcing video reasoning in mllms, 2025","venue":null,"work_id":"6fddde1f-15e0-497c-83f8-026d212c6f70","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.983811Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:5f59d44ebd2da48cbabbdc2055a620a08656bac4bbef4f6f8247dce59f4b36de","observation_id":"d86fcecc-3ec4-41d0-83dd-71f50e25360e","resolution":{"observed_at":"2026-08-06T15:25:03.857596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.846741Z","title":"Frozen-detr: Enhancing detr with image understanding from frozen foundation models","venue":null,"work_id":"18a1ab9c-c4a0-4cf4-827f-53e2ff7ba1e7","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.987069Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:f8af06728a21113a2f80171dac49cf0d98ad3362b115bed25d9f90da51ad9b93","observation_id":"76ea7b3a-3f72-4747-b11b-86cc895129d4","resolution":{"observed_at":"2026-08-06T15:25:03.849441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.838993Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"7113da50-1f70-46b3-968c-9dea394ce598","year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.989754Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:0afc852aa6b77b555844b60db8ae00ac841c17dc567ebc8bc8acfe8be3d4a82b","observation_id":"4a16c1d6-ff58-4e98-9d1d-9379d7b4e173","resolution":{"observed_at":"2026-08-06T15:25:03.841674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.831033Z","title":"Dataseg: Taming a universal multi-dataset multi-task segmentation model.Ad- vances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"3f17cf23-21f9-4284-8051-6027480542ad","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.992355Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:948eac67242834887a46d9a70f4d0fde698029a24c4dd1ad47924d36b684c161","observation_id":"99d82295-8421-4552-897d-37e54cda6251","resolution":{"observed_at":"2026-08-06T15:25:03.833711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T15:25:02.996158Z","title":"Textbooks are all you need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.996158Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d629049fcf85ecfb2e4aea11f83755d55dbea4b42703fef08ea0312e54b87912","observation_id":"6d5f152c-c330-4b77-a032-e1b528425c83","resolution":{"observed_at":"2026-08-06T15:25:02.996158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.822469Z","title":"Llava-uhd: An lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":"5be17f33-7180-4936-ab49-d2ae44e23fb2","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:02.999268Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:82665bf9182f628015ad0068b28be12556288361620b8099cac1ca4f2f116292","observation_id":"7a0f9581-8649-42bc-a3c2-150d50c2c733","resolution":{"observed_at":"2026-08-06T15:25:03.825303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.814662Z","title":"Open-vocabulary semantic segmentation with decou- pled one-pass network","venue":null,"work_id":"b14a3632-6fef-49e1-937b-c19c7070885a","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.002244Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:8ce60fb9053ecb823c562180a554898d4b305188eeb793b811eb61c3fd4371b8","observation_id":"d7750ed9-fcd1-4a89-b2fe-202c81e2919c","resolution":{"observed_at":"2026-08-06T15:25:03.817355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.005059Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.005059Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:38b3e1965d46b932bebedf53b0e39ff8ae569690516c877eb02f71c2ac4c0f0a","observation_id":"4b126936-388e-4bcb-9fb3-ce6583a596a5","resolution":{"observed_at":"2026-08-06T15:25:03.005059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.801990Z","title":"Bi-directional relationship inferring net- work for referring image segmentation","venue":null,"work_id":"6866f7ea-9781-41ca-bf39-27ec5c82bacb","year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.007733Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:571e041a07bddbe45d979be9dfa9f57f9fc5558935ecfada70bba8cf485d2588","observation_id":"532f1273-a3a6-4c33-8345-f58a67eb9341","resolution":{"observed_at":"2026-08-06T15:25:03.804540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.794471Z","title":"Densely connected parameter- efficient tuning for referring image segmentation, 2025","venue":null,"work_id":"e700ec07-6c9f-4a95-b074-dbdecd15a47d","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.010900Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:09bd2279f0256b0b5ab5475e8c0cbe1b6b6d226bb6617b6b3a37390c23f2b28c","observation_id":"f170f6c4-87ad-442b-9138-18c255b56c3c","resolution":{"observed_at":"2026-08-06T15:25:03.797166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.786826Z","title":"Referring im- age segmentation via cross-modal progressive comprehen- sion","venue":null,"work_id":"baa7d6ca-1c78-468e-b2fc-41d571b6b516","year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.013622Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:c2085582966c755bb350bade0e26647b37d87c19fca7ca9f8a030227e1524f76","observation_id":"8937b392-bcdb-4806-998f-86ff53dc2c35","resolution":{"observed_at":"2026-08-06T15:25:03.789460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.779321Z","title":"Linguistic structure guided context modeling for referring image segmentation","venue":null,"work_id":"94dfd477-8106-48b1-8588-ea0f02ffd4e8","year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.016386Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d5afececc209c3522f2f32f70e0b72aaa68cfc8f3540049e04686eb1659355b2","observation_id":"4af64b3f-61c2-4889-81eb-fa0ee31fc2fe","resolution":{"observed_at":"2026-08-06T15:25:03.781953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.770983Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":"b8b7fcf5-8ee4-4790-ac03-97b2cf5624cc","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.020091Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:73388dcc3bcc06722d5aaac740edf9d001222983d86ec309bbf833f6adee8ee0","observation_id":"742758de-c6f1-475c-9ffa-76cb73bafa49","resolution":{"observed_at":"2026-08-06T15:25:03.774039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.762262Z","title":"Mdetr- modulated detection for end-to-end multi-modal understand- ing","venue":null,"work_id":"c0453157-9cb8-4c5d-aff0-1b4e2f9246bf","year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.022727Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:cb09889784c37863fa01dadad9837aabcfba4f6ac9f11d6be5b552d13b9b91a0","observation_id":"31ef1670-998f-420a-ba23-576d05d84415","resolution":{"observed_at":"2026-08-06T15:25:03.765376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.753946Z","title":"A spoken language dataset of descrip- tions for speech-based grounded language learning","venue":null,"work_id":"1d07593d-58dd-472e-a451-db667a278214","year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.025578Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:170bdd48ee1cc22f616509891a829a73d4339829e8b56afcb173adb72dd5e518","observation_id":"d53df0f2-aa30-40d1-9b56-9037c47276d8","resolution":{"observed_at":"2026-08-06T15:25:03.756673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.746246Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":"34146370-2551-4624-bd5c-0115538ed862","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.028433Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:31900902e5ea4c02a4bb4da050f83cbfac0b363e3b77c6d685b84b807500a02e","observation_id":"0b4fbcd1-5e82-4d56-8527-7aebafa74693","resolution":{"observed_at":"2026-08-06T15:25:03.748921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T15:25:03.031233Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.031233Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:ae3715c4a5e926cea0f1a9fe05d10395b4c956d4501388f3b7d3e71b0d3f2036","observation_id":"8230abef-3c1f-45fa-a6dd-28c842cf370b","resolution":{"observed_at":"2026-08-06T15:25:03.031233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.738229Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"8ae8f618-d4e0-469d-8cd0-f798ddc7dfe5","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.034435Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:401bd880d45cfde5b091d1706861c052ec18c3e3d6edfccabb4194e6da25ac28","observation_id":"b3c4cae8-f981-4ecc-96ce-7fb7dd9ae564","resolution":{"observed_at":"2026-08-06T15:25:03.740982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.730364Z","title":"Discobox: Weakly supervised instance segmentation and semantic correspondence from box super- vision","venue":null,"work_id":"afd68989-c987-449e-8f59-ef19af57e4d2","year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.037235Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:5062cb202b71862a6ec678829cf701091880b696fc9b3dacb9fa8a31dad7c026","observation_id":"0c07afee-1d4f-4160-ae0d-529ef1a26bd5","resolution":{"observed_at":"2026-08-06T15:25:03.733055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03992","last_updated":"2023-01-10T18:59:00Z","snapshot_observed_at":"2026-08-03T22:36:54.658770Z","submitted_at":"2023-01-10T18:59:00Z","title":"Vision Transformers Are Good Mask Auto-Labelers","version":1},"cited_work":{"arxiv_id":"2301.03992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.03992","snapshot_observed_at":"2026-08-06T15:25:03.310281Z","title":"Vision Transformers Are Good Mask Auto-Labelers","venue":"cs.CV","work_id":"435ca19e-23f2-46b9-bd57-85385d7b2d1e","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.040147Z"},"links":{"cited_paper":"/paper/2301.03992","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:3dbe3e1772b9c57d4ea13cbcdc8b9108715ef73ea05841f6f3322f318c208bf5","observation_id":"63fea573-a68e-4e5b-8d5d-f9b7e661d10f","resolution":{"observed_at":"2026-08-06T15:25:03.315861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.722294Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"e9be5dd1-5403-42f2-bf40-470f7da7694e","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.044358Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:c2e6fc53c3f174202d35d9a0181acc80880ccc7fb3338aa4305b16b00e245297","observation_id":"b97777ef-b346-48bf-9c22-83ad347d63df","resolution":{"observed_at":"2026-08-06T15:25:03.725166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.047346Z","title":"Distilling detr with visual-linguistic knowledge for open-vocabulary object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.047346Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:5f37e45fae4c9cfa5258b8b192e93b33fa1f293916368ffe46d49e3b54c9f34a","observation_id":"c765920b-5ec7-4141-bf16-ba1e6b80c835","resolution":{"observed_at":"2026-08-06T15:25:03.047346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.709041Z","title":"Grounded language-image pre-training","venue":null,"work_id":"1202c1ec-7b93-46a3-87e8-72140afcfec4","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.051037Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:de9e9cffd9fbababcd98c2e23c3f0a210a9d7a0b01cdee5e0e3081eac75d6ed6","observation_id":"5f13d64f-ef6b-4553-9b6b-3ee39ac0a1b7","resolution":{"observed_at":"2026-08-06T15:25:03.711995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.701110Z","title":"Box-supervised instance seg- mentation with level set evolution","venue":null,"work_id":"de0c4aa6-a66b-424d-81c0-a6601df80654","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.053794Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:38b2b315a6cde73652ed0d439c2644c61644a70a8ca9c2dd95e7e75169091e0a","observation_id":"ee04b3ad-bf10-4c3d-9327-b6faafbf605d","resolution":{"observed_at":"2026-08-06T15:25:03.703807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.692676Z","title":"Fully convolutional networks for panoptic segmentation with point-based supervision","venue":null,"work_id":"68933650-08f1-4d1c-acd4-f044f2b7a435","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.056437Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:47ef53408e43ca41ff40381591646b5917d89cec78c63a2327e4e13ceb26cfab","observation_id":"8aed0da2-f026-4012-b0c5-292b7ad09795","resolution":{"observed_at":"2026-08-06T15:25:03.695829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.685060Z","title":"A real-time cross-modality correlation fil- tering method for referring expression comprehension","venue":null,"work_id":"51614bd3-8b75-4c75-bd76-bcd10a86283e","year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.059281Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:fad9ecddc05263a42e736c82c997411e02d99157a1f0408ad586a4793e14702e","observation_id":"00a7a282-fc22-4e44-a7d1-25e6ddf1e20e","resolution":{"observed_at":"2026-08-06T15:25:03.687610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.677540Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"6e9dcd85-d65f-41e9-980e-04282c64ba65","year":2014},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.061929Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:7c862adbb4428ae2eb80524887c3158165143f704a4f9a5a34df7c2b127c39e6","observation_id":"4a1657f9-3b3c-4191-a321-b25b7226597a","resolution":{"observed_at":"2026-08-06T15:25:03.680245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.669556Z","title":"Gres: Gener- alized referring expression segmentation","venue":null,"work_id":"fd84dc44-a9f4-464a-b2fa-36d32a23b644","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.064565Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:16d5966bfa7ef1582a271acecb106c46d765ba91cf6fa72373378fc8032889d6","observation_id":"2651bf09-4a8b-45ec-9acb-82ad86de3712","resolution":{"observed_at":"2026-08-06T15:25:03.672328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.661131Z","title":"Visual instruction tuning","venue":null,"work_id":"404cb66d-838a-49f5-98ec-32ee1193059f","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.067583Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:656daf75f48b63f027f5bc75a7b13dd06f97d29a2c22506002a5348cf9effe43","observation_id":"516d1c06-fccd-472e-9311-c0d9b60eae89","resolution":{"observed_at":"2026-08-06T15:25:03.663833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.652841Z","title":"Poly- former: Referring image segmentation as sequential poly- gon generation","venue":null,"work_id":"8bdfac49-26d4-40ea-9aff-ca6d905dc1f2","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.070394Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:32bca29dd11e62ad4de814dfb86e297e94b43094ead2d7bb85a757bc04ff600e","observation_id":"396ea93a-94bd-43c9-bcfe-5e7eadd99cda","resolution":{"observed_at":"2026-08-06T15:25:03.655401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.644312Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"274d22c4-8a87-4c86-84e9-9d3ac2782a1d","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.073090Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:7a88ff77fddf69cd04079c63c50df373b34b2dc6d3dc566684039f472c22967d","observation_id":"0b59ecd3-f4d4-4402-b6b1-8d487fe0098b","resolution":{"observed_at":"2026-08-06T15:25:03.647545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.635763Z","title":"Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding","venue":null,"work_id":"d057efaf-3348-4587-840c-d0487f587c1b","year":2019},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.075993Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:82e9f7074147fb0a0a753190882c0572e7ab5dc378fdef0915672a7879bac28f","observation_id":"4bc258ef-85e1-45bc-9f4e-ec3f03888c67","resolution":{"observed_at":"2026-08-06T15:25:03.638476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.627813Z","title":"Learn- ing cross-modal context graph for visual grounding","venue":null,"work_id":"f84d5827-25f0-41d6-afe9-ec2abd477adf","year":2020},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.078779Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:f85bc9845b1c192c4180fc4e68b2ecd15f3bdc3e0c5e686168a3f776e1017812","observation_id":"b5080384-84b0-44e6-b417-7c5cd23d5ae8","resolution":{"observed_at":"2026-08-06T15:25:03.630597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.081686Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.081686Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d6a09a18502d3c067d481d46ae139af9e50dbd18bc4d5b69108fd5e1052b7e8a","observation_id":"11f99a97-e9db-4615-9b27-6c0bb48cc3bd","resolution":{"observed_at":"2026-08-06T15:25:03.081686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.614505Z","title":"Visual- rft: Visual reinforcement fine-tuning, 2025","venue":null,"work_id":"aed6bdbe-da2c-4fa0-9eee-3098878289fa","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.084391Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:81dac8e3890ac982c5d3de959f9b5ca8b9dc601d006ea9190708f3400b6b4d52","observation_id":"90d19aa5-8690-4e28-99a6-18f1f3dec4e4","resolution":{"observed_at":"2026-08-06T15:25:03.617590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T15:25:03.086999Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.086999Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:b0c52e8dbb6731a6dd698a2075517be6d52605df2c04946e4a807e0bb407991e","observation_id":"e9b21f22-e97f-48cb-9b98-250a81250791","resolution":{"observed_at":"2026-08-06T15:25:03.086999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.606395Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"c5bd234e-11c8-4275-a05d-344e040155e0","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.090622Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:adab46f51120c25dac1e020cae5fd6155944122bfd8176b3dbae1ab02fd2b086","observation_id":"adf0279d-f848-4aa0-bb46-befbf3392261","resolution":{"observed_at":"2026-08-06T15:25:03.609171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.597851Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"caa25a42-846d-45fe-a800-3139d4c7c489","year":2014},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.093349Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:4c4ac847402e8b650e7b43b7f6ac6e7755316d06ee40399d799ea03b4ebd6eaa","observation_id":"01d20d78-7508-4559-a76f-22cb2c4321b9","resolution":{"observed_at":"2026-08-06T15:25:03.600915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.589526Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":"7563954e-b4ea-4565-9769-22a02a375017","year":2016},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.099243Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:0b097305ac570391851b66bdba423c9c1bef89a458111f3e8a3fe679ea124867","observation_id":"50d46028-436f-4fc3-a959-83ce2362efd2","resolution":{"observed_at":"2026-08-06T15:25:03.592309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.580678Z","title":"Vision-aware text features in referring image segmentation: From object understanding to context understanding, 2024","venue":null,"work_id":"1d37428c-18b0-4f1f-b5bf-e38d5453e4d1","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.101957Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:cc447ca40ebe4f8d565dd2f01e9c05151bf36e5498b8b0aa50fffc89abf532c1","observation_id":"c58cdb6b-764e-4a4f-bce1-383a37d9f6e5","resolution":{"observed_at":"2026-08-06T15:25:03.584054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03356","last_updated":"2024-06-02T00:33:53Z","snapshot_observed_at":"2026-08-08T00:57:25.976213Z","submitted_at":"2023-11-06T18:59:57Z","title":"GLaMM: Pixel Grounding Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03356","snapshot_observed_at":"2026-08-06T15:25:03.104795Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.104795Z"},"links":{"cited_paper":"/paper/2311.03356","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:420237d16df05a83ca30321f5ec5b72b9e78ada5f3df50a62591815b0967d306","observation_id":"15adb626-08b6-4fb3-8aef-df41b9d5c851","resolution":{"observed_at":"2026-08-06T15:25:03.104795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02228","last_updated":"2024-07-18T07:18:36Z","snapshot_observed_at":"2026-07-06T16:56:49.877351Z","submitted_at":"2023-12-04T03:05:59Z","title":"PixelLM: Pixel Reasoning with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02228","snapshot_observed_at":"2026-08-06T15:25:03.107930Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.107930Z"},"links":{"cited_paper":"/paper/2312.02228","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:f2320c27363e3b7a816f2e572ceedb57477ca39975bece088dc39a64d30af234","observation_id":"5cf9db23-a1b3-4486-9bd3-6d6313aaeca9","resolution":{"observed_at":"2026-08-06T15:25:03.107930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.571486Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"10076a67-e709-473e-8304-70f59a57bba7","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.110890Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d739ef659b606944d02a4de27af215eadc46ccb3b6949063e02de850ae94cac4","observation_id":"cc0390e1-8c0b-464c-999f-62c436354f77","resolution":{"observed_at":"2026-08-06T15:25:03.574542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.562104Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":"be80bac5-06f4-48e7-9a4b-b00bd5a4428c","year":2016},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.114638Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:b95c13cf629da138ab9e2327019b87f4ae917a2e9522def597d864ea4e96551a","observation_id":"13f2513a-d917-4376-bb03-c9e5c923fe19","resolution":{"observed_at":"2026-08-06T15:25:03.565223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.553180Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"bf09c6f2-7b41-4a5a-865d-e515dbc463e4","year":2019},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.117431Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:80ceb08c06bc2273af01ca4e80913855cecf2511e7e4af7947fcb0d2a8713828","observation_id":"d5a2c00e-8dde-4ada-bc17-2b65970cbd35","resolution":{"observed_at":"2026-08-06T15:25:03.556025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.120304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.120304Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:150309e04ff24f355416675a00447e3794ea141700e5c7992ecc0731408c2f35","observation_id":"b2d08439-a2d8-4034-97ca-e4c024525b74","resolution":{"observed_at":"2026-08-06T15:25:03.120304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.539233Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"1d9f95fe-32fb-4572-9bc1-86eed01cf692","year":2018},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.123158Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:163fcc1a28eb3b4b81982672b809670a7301be096535f9493b566c9171694e12","observation_id":"ef191971-6719-4529-8669-d85a212a1bb2","resolution":{"observed_at":"2026-08-06T15:25:03.541868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.530639Z","title":"Boxinst: High-performance instance segmentation with box annotations","venue":null,"work_id":"dfe8e265-1ebb-485e-8195-f70b479acaa0","year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.125882Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:75e011ea05b789a0627ffaefab0f8061820488facc519fba68a8799f28ec88c5","observation_id":"cff9cb04-e1f7-441d-ad2e-147517293b21","resolution":{"observed_at":"2026-08-06T15:25:03.533787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.128732Z","title":"Max-deeplab: End-to-end panoptic segmentation with mask transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.128732Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:b243fbc2cbe64ebd2aa5232fb6b4f05ee83cce6efa17c5b313ec353e48f2e0b5","observation_id":"34336494-a6a6-4418-ab58-be450b0b032f","resolution":{"observed_at":"2026-08-06T15:25:03.128732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07844","last_updated":"2024-07-22T03:26:21Z","snapshot_observed_at":"2026-08-05T18:50:42.664160Z","submitted_at":"2024-07-10T17:05:49Z","title":"OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07844","snapshot_observed_at":"2026-08-06T15:25:03.131454Z","title":"Ov-dino: Unified open-vocabulary de- tection with language-aware selective fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.131454Z"},"links":{"cited_paper":"/paper/2407.07844","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:5957c703980d4ac8f7dda5c954fe15c17d5d4b0f0b10e0fe86dea368ea8ce257","observation_id":"98f4faab-7e40-497d-b19a-127eb7ff4cb4","resolution":{"observed_at":"2026-08-06T15:25:03.131454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.515194Z","title":"Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks","venue":null,"work_id":"87f2b15e-0fd7-41e5-b037-78ef565b5830","year":1960},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.134522Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:df902b708dc4ed907c6b94d7d6d673ff3068523ee82dcd1edcafccab6aee25ad","observation_id":"bb6d06a3-b170-4103-bd28-90dcb74f6005","resolution":{"observed_at":"2026-08-06T15:25:03.518088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T15:25:03.137410Z","title":"Time-R1: Post- Training Large Vision Language Model for Temporal Video Grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.137410Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:cebdb8cdc9e0ef1db4bad79d4ef7d87f10148aae17497a451081a84003fcee5d","observation_id":"cb440322-a61d-4a06-8915-060afcbbc754","resolution":{"observed_at":"2026-08-06T15:25:03.137410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.506762Z","title":"Cris: Clip- driven referring image segmentation","venue":null,"work_id":"58070f2c-7f46-4478-b1d7-e8e0d22ad3c5","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.140488Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:0464aab74c4ce4f323a1f2abba550a7cadb46fb55796e0db3e59969b81d8f061","observation_id":"afadd51a-cd52-44c8-b374-d943f9aeb7d6","resolution":{"observed_at":"2026-08-06T15:25:03.509852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-02T23:06:41.458983Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-06T15:25:03.143395Z","title":"Lasagna: Language-based segmentation assistant for complex queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.143395Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:e586ef64c9be86a6ab1408450049d00bb32926b5f0770dd199bd031d35cdd705","observation_id":"25011881-7661-4cc4-ad98-2e6e512407ab","resolution":{"observed_at":"2026-08-06T15:25:03.143395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.498253Z","title":"Hyperseg: Hybrid segmentation assistant with fine-grained visual perceiver","venue":null,"work_id":"7bcb6d2b-4a7c-415c-acd9-739e53ff93c8","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.146653Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:1478d7dbe16e28ade6512948342242540e5f1cd6120039f31e994f74a4aec56e","observation_id":"6c1f6087-bed1-425b-84d5-aa0f2c9c261e","resolution":{"observed_at":"2026-08-06T15:25:03.501288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.149351Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.149351Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:6e6c7484ba5b0f40b4cb099a026365a3df5e215d47f49a1b71b1dd033e3d35ed","observation_id":"02f804a7-f5e7-4b3a-ace8-42250d64c4e5","resolution":{"observed_at":"2026-08-06T15:25:03.149351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.485090Z","title":"Aligning bag of regions for open- vocabulary object detection","venue":null,"work_id":"ad450622-9a0c-4613-b64a-fe60ac974523","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.152081Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:cdef727f59d8e1a34e6be46e0e5e1c0881efa988e306a25016625f793aa6db67","observation_id":"6db5f32d-b051-46b5-9ea5-90634e417c42","resolution":{"observed_at":"2026-08-06T15:25:03.487596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10103","last_updated":"2024-03-21T09:20:49Z","snapshot_observed_at":"2026-08-07T20:30:29.390484Z","submitted_at":"2023-12-15T02:54:31Z","title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10103","snapshot_observed_at":"2026-08-06T15:25:03.155595Z","title":"Gsva: Generalized segmen- tation via multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.155595Z"},"links":{"cited_paper":"/paper/2312.10103","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:a994da3c2b645426827b78d51c502ad76b6a830a309262f03f73dc04fdb3bce1","observation_id":"2c52f9d3-d099-4c71-a893-df38831c04ce","resolution":{"observed_at":"2026-08-06T15:25:03.155595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.477480Z","title":"Upsnet: A unified panoptic segmentation network","venue":null,"work_id":"d823ce2d-3b37-49b4-8bea-4b169cd09ce5","year":2019},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.158835Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:d6e563e8c04f6dc77ddca533647547c0eac32480c55c140d48a54116dbe23ae5","observation_id":"724b5fbe-581d-4ebf-9e0c-5a5490c7dcda","resolution":{"observed_at":"2026-08-06T15:25:03.480035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.469266Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"703806e7-82dd-4081-8df5-2dde00fef8c7","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.162083Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:5ec59186ec4fc55f0e3318b33e7a8379b6331ed161e001d54283f3c262c0687f","observation_id":"ba103859-1933-47a2-b932-916dd704c33b","resolution":{"observed_at":"2026-08-06T15:25:03.472575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.461315Z","title":"Dynamic graph at- tention for referring expression comprehension","venue":null,"work_id":"eb646d2f-c3ee-4398-8675-0256c9b6d3df","year":2019},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.165628Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:dc6469a8bf2606f67c590d3cfd395bea8b9e07fa4598873d6cdf2ef36168f296","observation_id":"ef29d085-269c-400e-9da7-81aeaa72966c","resolution":{"observed_at":"2026-08-06T15:25:03.464252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.453013Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross- modal formalization, 2025","venue":null,"work_id":"49a61a21-a5b4-4760-a57a-11d8295e0b14","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.170854Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:9e7cb19bd680fc79ae0775417897f8f3878d0d6e064ce0648a6d3a31acefff3b","observation_id":"0fa72d14-b0f8-446d-8546-d554b1f3a4a6","resolution":{"observed_at":"2026-08-06T15:25:03.456045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.444296Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"431a1272-2d30-4159-937f-4aeaa3c05ce3","year":2022},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.175849Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:4a1a784527c5b2d639ac55273e222fe8ba9c3f050411cb7c0e89e48d7c701310","observation_id":"c0a577bb-61fe-4fe8-ae83-69622b4af0f6","resolution":{"observed_at":"2026-08-06T15:25:03.447077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.435975Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"2443c72c-cf2c-45b8-bb0b-57f93f91b7f1","year":2016},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.181626Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:049507896f426ba0f6528d1bc81eb9d0a2bf95243c175c9aae94307241f483a8","observation_id":"4c3979b2-5e45-45c8-9d4d-5aeb617b094f","resolution":{"observed_at":"2026-08-06T15:25:03.438827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.428191Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"99524795-0e63-427f-a5fa-6024d5de59a1","year":2016},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.186291Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:9abd4278c236532433d37eeec0b780f4ac6474aa6a2061c2ad3b7a9a464677f9","observation_id":"b3d0bdee-5d38-4dca-beba-9523bd29be32","resolution":{"observed_at":"2026-08-06T15:25:03.430991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.419719Z","title":"v-clr: View-consistent learning for open-world instance seg- mentation","venue":null,"work_id":"715b5a8b-ab00-4e7f-979f-1f2c10a8371b","year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.192454Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:c69c2b493f447296af1371b6a0b4b2b810837ec3861a20f3e8d98cfd7ec43ca1","observation_id":"55de4384-c3c4-4386-a750-18a9859a40bb","resolution":{"observed_at":"2026-08-06T15:25:03.422698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.412233Z","title":null,"venue":null,"work_id":"95f2170e-5aeb-410d-b557-37a34b68fbc4","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.200344Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:82bb3992c82f5b34b4ce4c7f1deb7c38f92c6f42aae4e01e70b26c0542b964a9","observation_id":"025244fb-29af-46ee-accf-28ea3e981ce6","resolution":{"observed_at":"2026-08-06T15:25:03.414643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.203135Z","title":"Grounding referring expressions in images by variational context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.203135Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:be70f0429cfda61b15adbd93f21c45c611211e2e6f718589cbc2dcb0f8d4afdb","observation_id":"18bcd259-4f19-4ff8-b318-985f7371594f","resolution":{"observed_at":"2026-08-06T15:25:03.203135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.398607Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":"caf93a52-62f9-4f8f-b3c9-eab98b59698e","year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.205535Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:c14e06158743d4b8f783d8bcc7a80bd5f17fdc6730b94ab8a2329b534ee1e3ff","observation_id":"765e2d08-ab87-4cbf-bb9c-cbe49607ab6e","resolution":{"observed_at":"2026-08-06T15:25:03.401452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.389623Z","title":"R1-vl: Learning to reason with multimodal large language models via step- wise group relative policy optimization, 2025","venue":null,"work_id":"4c8b9a98-d31b-4a22-ac97-b9c66f602901","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.207897Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:1338ab96d27a0187926b6b24724700f7f3ba63bc63cd4ee16e507d3087facb57","observation_id":"a3953e7e-616e-4d20-b302-4430a72a2996","resolution":{"observed_at":"2026-08-06T15:25:03.392598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-06T15:25:03.210189Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.210189Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:21bc2fc3750b01815dc50ab8f417174087b0c0062c0927bf7567c578efbf6188","observation_id":"b42c9963-2ac2-42be-af19-2bc9d7ac31f2","resolution":{"observed_at":"2026-08-06T15:25:03.210189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.381715Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"02a15bff-9a47-4bdc-91dc-8a436905e140","year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.212699Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:291dfeb095127c69d68c1b48bb9eae814a9b0ceef8886b1a01cd9e6a076b2a7c","observation_id":"1d326492-bdc2-4deb-9447-6726ca52a6e7","resolution":{"observed_at":"2026-08-06T15:25:03.384291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.372757Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"e918093c-4fef-4ab5-9d21-5e5d834e4706","year":2019},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.215135Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:c3015c3a43f18fc432d20a1f26f6308a2ffdaca8c70737a489d7dec97976ecf3","observation_id":"c5aaccc8-7ae1-40fb-a4bf-45c33e0a6902","resolution":{"observed_at":"2026-08-06T15:25:03.376001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.364846Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":"1655e5af-7681-4db9-9cd6-1f9d654692e5","year":null},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.217526Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:2f25faa8c7317ef369f652de11246a7e7f943fd6e3aed84cc9e9117cc160e731","observation_id":"27c1b8fe-6856-40f3-812b-6a0db2ab204d","resolution":{"observed_at":"2026-08-06T15:25:03.367658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:25:03.356937Z","title":"Segment everything everywhere all at once","venue":null,"work_id":"143e8e49-c404-4773-a3fe-12de422e6743","year":2024},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.219873Z"},"links":{"citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:9ff7ffae6127cd9a9970ab4d20ec64007b0995ff74c19c86b65b1cf9e8511a7b","observation_id":"ee94fd56-822c-4f04-8f19-475ccc1c2842","resolution":{"observed_at":"2026-08-06T15:25:03.359490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:12:59.857398Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":59},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2507.16213."}