{"as_of":"2026-08-15T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:076c89072a5ec61f714be5986a0cd3dd304d518d08aa32861585bfb4ef8edc74","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:25:03.038918Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T01:50:54.242508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.109470Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"cited_work":{"arxiv_id":"2507.06272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06272","snapshot_observed_at":"2026-07-04T15:09:55.109470Z","title":null,"venue":null,"work_id":"ee7b6d44-a5c1-4d63-8a50-311289f97eb3","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-13T03:40:06.714401Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2507.06272","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:036736c578f809e54237dcfbf4513936e84ed642ad1b9f369eda06fc2c109753","observation_id":"fa7ad16a-b5f6-4ed2-bd67-b6d1ce5d30c6","resolution":{"observed_at":"2026-07-04T15:09:55.111055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06272/citation-record","integrity":"/paper/2507.06272/integrity","json":"/paper/2507.06272/citation-record.json","paper":"/paper/2507.06272"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.560688Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.560688Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b221b704c4164f6d29f37c62d6f801c9f18afeda93b4f89f544c92047e66490e","observation_id":"07667d61-3b90-4a50-90bc-9f7a8a79023a","resolution":{"observed_at":"2026-08-06T19:25:02.560688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:25:02.566717Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.566717Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:e3aa509d25edd371afce05c2b86bc91195d4f8e462bcd34a6aca961dd2f3fc76","observation_id":"c1f30626-190d-43bc-819e-4e08e8f582bc","resolution":{"observed_at":"2026-08-06T19:25:02.566717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.467020Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":"10ec1974-c9f0-4b59-8cd0-8776334b6d2b","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.573028Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:0e94c17d696f30ec5d9cd1cbe0cdbeffab8f13bddb4a004c5cfc48b017246085","observation_id":"d23a0cfd-ddfe-4b24-8f4c-4404ada3607a","resolution":{"observed_at":"2026-08-06T19:25:04.472428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T19:25:02.578412Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.578412Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7f438b36e0acaee3b6e54329e1136ace401c5c5b99c234097c70d1a018189462","observation_id":"123fb9d3-7959-44c2-9874-ddae3b8b1325","resolution":{"observed_at":"2026-08-06T19:25:02.578412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T19:25:02.585377Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.585377Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c6aa635ed8121a65e99fcd012f36f56c68d5ab40b24898520ed97d0c7d4f833f","observation_id":"c3620d91-5c04-46bf-893c-40517ccf4caa","resolution":{"observed_at":"2026-08-06T19:25:02.585377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-14T22:34:31.512670Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-06T19:25:02.592591Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.592591Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b1bca518bf95ecb63c47116e6c5b0d4e18e03e5a151b0e5f9818f7432fd9f255","observation_id":"946f5be3-94c9-4f85-bc6b-7c95eeeabba7","resolution":{"observed_at":"2026-08-06T19:25:02.592591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.447802Z","title":"Sam4mllm: Enhance multi- modal large language model for referring expression seg- mentation","venue":null,"work_id":"79f9f96b-be1c-4ac3-954c-878b78399af4","year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.600401Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3654b6baaed598cb95f863c16061cf1573b3c940a42123aceac7370845295868","observation_id":"d81d9a75-d6a1-44b0-939c-e8ea40a342be","resolution":{"observed_at":"2026-08-06T19:25:04.454166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:25:02.612441Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.612441Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ce81e75f71b2ad871a7d84a65b1c1e169b35b53e4d8936ce3c47ff25eb5be61d","observation_id":"b0dd2dbc-8952-4815-99c9-5af96197e5de","resolution":{"observed_at":"2026-08-06T19:25:02.612441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T19:25:02.620079Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.620079Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7ce94bb3a7615df75b165ad9a83d32b77d39c15a5c61b417510b2d4316248e52","observation_id":"c8a9d86c-06d2-405c-bf13-9c82085b0b48","resolution":{"observed_at":"2026-08-06T19:25:02.620079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.426100Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"4e543383-9caf-4a41-8c23-c502fda07714","year":2017},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.626331Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7094c98b7086e026fb6104096ba85041c242190189f806a1aff2e612a0340353","observation_id":"15eff456-804c-4064-8188-8081a0d0bf2d","resolution":{"observed_at":"2026-08-06T19:25:04.433594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.632584Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.632584Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c946eef58866393247248854a8b5eeceb60c92247b08bb5d423ccfef6f03a748","observation_id":"1c9bccd3-d49d-4815-ac94-3b5dbda9a750","resolution":{"observed_at":"2026-08-06T19:25:02.632584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.397157Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"89432e6a-45b6-433c-8253-8ccfffa94f7b","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.639805Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:8afedd72488d22ae78de22d2783c366ee8b6f6e9a78782e8be2e11c538312ead","observation_id":"d81508aa-362c-4002-8d5a-19dc7109a3c5","resolution":{"observed_at":"2026-08-06T19:25:04.402511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.379242Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"9ab6c7ff-a3d2-4079-aa53-2ce88b0ac6d0","year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.645404Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:e7c361539ab33cee85b9a7288e593b58ac6aabae480a4e4dcec7f7bbfc8e8d15","observation_id":"7d658121-544e-4f2b-8fa0-5497626ca68c","resolution":{"observed_at":"2026-08-06T19:25:04.385021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T19:25:02.650218Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.650218Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3b197bdd4262bfc94922f6699128445fd66271d9e5751ef6209e1b57f393e16c","observation_id":"2fd3d24c-5388-4590-a076-c05969ca92b0","resolution":{"observed_at":"2026-08-06T19:25:02.650218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.359006Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"4196ad0c-2e2e-46b4-bce5-5c1ad364e932","year":2019},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.655642Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7992d4b6aac7bfd30c5d876ca3bd07df4c92df2619f996eef3ab628353569b1d","observation_id":"92808272-303a-4110-968f-bc3d929e9205","resolution":{"observed_at":"2026-08-06T19:25:04.367323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.660377Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.660377Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:078ccacd43f425822d34e23e27eafc3d7bf829731eb5ae4d8810b74373d52886","observation_id":"5d63ed73-3ef4-4c6e-8065-d8fcd8893485","resolution":{"observed_at":"2026-08-06T19:25:02.660377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.666783Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.666783Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:bc5210fd78d8635efe58ef8888ff9b407f1a8578364f931515e8237de50053ee","observation_id":"be61820e-baf0-4138-88c9-9fe5c3de2be3","resolution":{"observed_at":"2026-08-06T19:25:02.666783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.679727Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.679727Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:d55fc8de1a96e1e5e6d58c1023801003cfcfa9c8b893bc8c9596a40d696da022","observation_id":"5f422613-5648-437a-a5b1-21c108970889","resolution":{"observed_at":"2026-08-06T19:25:02.679727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.290330Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"34e613d7-5ee4-42ac-9c8c-1ac37bcc3755","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.686421Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:945a33a6c164af75af04c929a4fc9c7a20d13ffa240e224f06bb3b9b77b8f1b5","observation_id":"f9151211-5ed7-40c3-a995-6a6ec82e37ca","resolution":{"observed_at":"2026-08-06T19:25:04.296163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09855","last_updated":"2025-02-17T05:35:12Z","snapshot_observed_at":"2026-08-13T17:45:29.422202Z","submitted_at":"2024-10-13T14:28:16Z","title":"Text4Seg: Reimagining Image Segmentation as Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09855","snapshot_observed_at":"2026-08-06T19:25:02.692538Z","title":"Text4seg: Reimagining image segmentation as text genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.692538Z"},"links":{"cited_paper":"/paper/2410.09855","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:2b419bd583f8a70ebfe0f405a3eadeb4124eab6ecb4cdbae884fd3f6a9cf9c78","observation_id":"9912157e-0ba8-4078-98f6-3d9d0e1c2f97","resolution":{"observed_at":"2026-08-06T19:25:02.692538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.699518Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.699518Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:11c689ddb38857f90e18466c8fd7fa83f85318d9a834a4c14459e98e68f97042","observation_id":"438b3181-0746-4800-8651-c1a3abe12590","resolution":{"observed_at":"2026-08-06T19:25:02.699518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10229","last_updated":"2024-10-01T05:56:05Z","snapshot_observed_at":"2026-08-14T13:14:57.575776Z","submitted_at":"2024-01-18T18:59:34Z","title":"OMG-Seg: Is One Model Good Enough For All Segmentation?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10229","snapshot_observed_at":"2026-08-06T19:25:02.706354Z","title":"Omg-seg: Is one model good enough for all segmentation? arXiv preprint arXiv:2401.10229, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.706354Z"},"links":{"cited_paper":"/paper/2401.10229","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:4fea8709fa276293be90645b154b7af8cd3bb78fbfc3f5ef26cb15baafeaefe9","observation_id":"e96330e5-cbf0-4c07-b9e9-957de476c346","resolution":{"observed_at":"2026-08-06T19:25:02.706354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.261276Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"7b50e124-516d-4bc4-9270-43fd4680a4a1","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.713875Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3a7dd3942e943d792c2a1efb063806f867373c11f955f1a2e088cc2634880ae2","observation_id":"6c3b72e5-80cd-47c4-ade6-52e4b22c0a6a","resolution":{"observed_at":"2026-08-06T19:25:04.267371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T19:25:02.719308Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.719308Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7b7086267f4b4ab6dff3c4669812e7ea97cf34ab08497c893dafe84ec8f63ea2","observation_id":"c1effccf-7352-46f9-ac3a-7c10cf449f54","resolution":{"observed_at":"2026-08-06T19:25:02.719308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.243027Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"da97e100-b820-4584-903c-fe8250ebf4e3","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.725997Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:47b424d0c48eb29758f6b892c90e97e335c596a5dc8e77c8b1d97db93966fac3","observation_id":"776f9d73-49bf-4390-8d13-8be844bf18ac","resolution":{"observed_at":"2026-08-06T19:25:04.248510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.226624Z","title":"Gres: Gener- alized referring expression segmentation","venue":null,"work_id":"b0daaca4-eca9-40d1-88b7-275ce846c503","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.731847Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:e8354dea6d5f1c1d49575f8a088ae10259c56d8aa850205ad5e3c413a09054ee","observation_id":"66c9b9c1-9e14-4c63-98cd-3117bb196e78","resolution":{"observed_at":"2026-08-06T19:25:04.231802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.209123Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":"c6107a99-8a00-4184-8025-6e8eced13393","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.737729Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:0b897c75cc00e6eaef9abcc8071a8d9aa43f9bfe3161643c415c407dc4bc572b","observation_id":"1309b116-be41-4492-8150-93af04f8a6ef","resolution":{"observed_at":"2026-08-06T19:25:04.214525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.192793Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"4f0a215d-c48b-432e-9f35-2efb1e602a38","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.743293Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:0cecf5545c8fd2a9ff5b16edfe06294ecb82876d24d9fb8cb8b94919cd4de9a2","observation_id":"25cbb403-d745-40c7-9d46-33681c38d58f","resolution":{"observed_at":"2026-08-06T19:25:04.197835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.175653Z","title":"Visual instruction tuning","venue":null,"work_id":"80ff04de-667a-4831-81d0-2dffc5c33269","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.750364Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:1372559b3f3360fc9af9be3eb4013889894c4993ca79bac44e57fb340eeb768e","observation_id":"3a6f45e1-600a-4186-b0b4-b66d8c1959aa","resolution":{"observed_at":"2026-08-06T19:25:04.181474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-08-13T05:29:05.048863Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-06T19:25:02.756176Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.756176Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f81faaad5fc941349f239cb9195a324c21eff727fbcb8ee4205509a13e32c060","observation_id":"b6798a7d-cf83-4917-bc88-4894cf994b78","resolution":{"observed_at":"2026-08-06T19:25:02.756176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-13T05:57:08.016883Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T19:25:02.762351Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.762351Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:efa71cd0a616e1554da6ba0811b8fbcf0850bbb2c9cc4ebcc1ec6ab7e161ddc8","observation_id":"0a905ad9-f29c-4e9c-b2ec-4f0b1b862264","resolution":{"observed_at":"2026-08-06T19:25:02.762351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.768004Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.768004Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3436c20f0b91d242319703787b4aba47b91d7785fb0a0f284549067b36d08e9c","observation_id":"608ab5c5-c239-4760-b351-dfcd833a97c9","resolution":{"observed_at":"2026-08-06T19:25:02.768004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-08-14T04:59:13.217854Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-06T19:25:02.773169Z","title":"Interngpt: Solving vision-centric tasks by interacting with chatgpt beyond language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.773169Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f1c03abff992fd41f54146a73b51d2457d76def2b0b4db5831837b102a9493f5","observation_id":"4b577851-b868-4a87-a58d-e891afe63e52","resolution":{"observed_at":"2026-08-06T19:25:02.773169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-08-13T00:50:05.558651Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-06T19:25:02.779348Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.779348Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:73148a76300991d24dc0a4aa9d9510f749c390b0f6da428c7bcb9122b5a23cb5","observation_id":"2e4a3485-1b56-4e99-860b-5402c90fa88f","resolution":{"observed_at":"2026-08-06T19:25:02.779348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.146680Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"65d39331-bde6-46b4-b995-fcca75331f50","year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.786553Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:6df6edb94fd75cc34bdc39b5710146c4cadc2156b24010fdd0968fb9b0ea2541","observation_id":"be5cb8d7-a020-43c8-a85c-1bb846236cd4","resolution":{"observed_at":"2026-08-06T19:25:04.152584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-15T01:58:37.525169Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T19:25:02.794185Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.794185Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:de3e5f5ec6aef627529fc2f3d0a4b797e40e7c1d6181872c1ed27589b43c4901","observation_id":"c64fb980-aa3b-45df-be78-a21e7f0a2fe3","resolution":{"observed_at":"2026-08-06T19:25:02.794185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.130237Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"2a99800b-286d-4ea1-b607-abb2ce667c58","year":2019},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.800568Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:6f38ef24e213b0ab706e908c0d5e91e88db4b194541a1eda9c072332e69c9c2a","observation_id":"327d3d31-edab-4095-808e-0eb026ee171d","resolution":{"observed_at":"2026-08-06T19:25:04.135326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T19:25:02.806358Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.806358Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:1f2f3742e903d717a470abf74e7da15f31d64ae017e2f90724c1baa6c396eb80","observation_id":"5625cbc4-79a1-42c8-8255-c8f792690acb","resolution":{"observed_at":"2026-08-06T19:25:02.806358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.811525Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.811525Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f8a14ab5209cd788fa5a186767238abb16ce0fdec2bc7a9790d368c4888f7cbd","observation_id":"446b98f5-a107-4b23-8d14-f98ce24d6a7b","resolution":{"observed_at":"2026-08-06T19:25:02.811525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T19:25:02.816755Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.816755Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:6c7a03d863714a6d1c91de996a994060295fe9923d21b58802c182741a7d911f","observation_id":"a79209ef-18ee-4598-bffc-0ed393c22227","resolution":{"observed_at":"2026-08-06T19:25:02.816755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-13T04:24:55.131656Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-06T19:25:02.822075Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.822075Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7ab4f98fc1318c2e7bce8daa533ddd575cc016ecb0b0353db15a42fe4d933339","observation_id":"087fa912-cbf8-437d-bf28-1d9225376729","resolution":{"observed_at":"2026-08-06T19:25:02.822075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.102812Z","title":"Reasoning to attend: Try to understand how¡ seg¿ token works","venue":null,"work_id":"65a1172c-0b9d-468d-9f02-a3e8cd3338c9","year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.828356Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c3a9257fea5f8d4d902252d77e59cf797bfaaa0b5216d68a6e950c06aea6a8a5","observation_id":"3ce61a4c-e2d4-4cfb-9076-cd599d3f71df","resolution":{"observed_at":"2026-08-06T19:25:04.108283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.086497Z","title":"10 Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"a8f05073-c65a-4315-b4b7-1f06d7f3baea","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.834105Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:493519e511a8e47101b1d81bdc59e98555d317bde5a07b1dfb7c6f06c8b6ab3d","observation_id":"f2eca709-119d-497e-88a1-f6efe28401e5","resolution":{"observed_at":"2026-08-06T19:25:04.091454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.069890Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"5691acc8-1ad1-408f-a729-1ab1ecb9a09b","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.839396Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c79a54370eb2faad25b029a9704246b3f47c8d81972511ab21f71f97de0a0da6","observation_id":"321b42bd-a7ad-405b-bdc7-4d7fd7a93ac3","resolution":{"observed_at":"2026-08-06T19:25:04.075155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.846541Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.846541Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:37520bdb1b7e83c107d968e00a4720be99f5814b16cb49901d95e2b6ec7c3491","observation_id":"ef42190d-5df3-4e58-8f53-d637060f1479","resolution":{"observed_at":"2026-08-06T19:25:02.846541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.041362Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"38d724c3-3db9-4a79-af2b-861aae1772c0","year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.851753Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:e7ffaffe03279598e98d48038048e36c1f89ad64710c4486d9377eec91f4ddb7","observation_id":"08f1824d-f5a8-4416-970e-15639a0b1d05","resolution":{"observed_at":"2026-08-06T19:25:04.047364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.022015Z","title":"Tinylvlm-ehub: Towards com- prehensive and efficient evaluation for large vision-language models, 2024","venue":null,"work_id":"d0246dee-bc94-4e51-a988-2f2332d62324","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.856963Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:0c03909ea4d68e2a53bff473553ce464f35d84ef537ec658fa5397003de96ec2","observation_id":"70e555ba-6fe2-4a70-b233-858ccd208a78","resolution":{"observed_at":"2026-08-06T19:25:04.027874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.862897Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.862897Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:4477a2f76b60b3f9487fabc46f00e7f71573a8a6e365c57f28fbdf0356f6abf0","observation_id":"a1553ffa-e220-4930-84d1-3e7668aa78e4","resolution":{"observed_at":"2026-08-06T19:25:02.862897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.992417Z","title":"Cambrian-1: A fully open, vision-centric explo- ration of multimodal llms","venue":null,"work_id":"961a9e2e-4f4a-420f-9cdb-6b2da2330878","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.869346Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:95bff6aeed209cad7aaa2470f5e532afe105adb3783d92e7ff879df12f0e9da1","observation_id":"951a132c-acf1-4cbd-b158-19561d0a73d8","resolution":{"observed_at":"2026-08-06T19:25:03.997513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:25:02.874944Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.874944Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:6d24713975afc73f9df39d6dfdf257512b9e804e7c85b761adc3e84e0115ddf1","observation_id":"34dc3d2c-51ae-41a9-a577-67bf4810d1a9","resolution":{"observed_at":"2026-08-06T19:25:02.874944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T19:25:02.881306Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.881306Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c73a31811acec43752dbb5f287761c8dd5d7c30b49cf696d079d5e6e3aa9e27b","observation_id":"1834aff1-5fff-49d6-8c83-2fbb9966a293","resolution":{"observed_at":"2026-08-06T19:25:02.881306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.975456Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks","venue":null,"work_id":"b8bb2839-7ea7-4d77-b73b-29acadcd9ffa","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.892908Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:57ae3d20f3c837caf49370ac7e6e2354732065c7fc489004e2e5e10ec4fb736f","observation_id":"6664a6e4-dea9-464e-bce3-8631bbe9691b","resolution":{"observed_at":"2026-08-06T19:25:03.980701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.957466Z","title":"Hierar- chical open-vocabulary universal image segmentation","venue":null,"work_id":"dbf07366-f0e6-4d3b-83a6-adb28d26b285","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.899849Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c1ac65e94d115d9b69329c6aba34f2f4a94e07d03cdc8768735759fe04b69d22","observation_id":"7727ef6d-8e2a-4681-add6-7b3405fa1997","resolution":{"observed_at":"2026-08-06T19:25:03.963856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18923","last_updated":"2024-10-31T19:44:05Z","snapshot_observed_at":"2026-08-12T22:15:43.659301Z","submitted_at":"2024-10-24T17:11:52Z","title":"SegLLM: Multi-round Reasoning Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18923","snapshot_observed_at":"2026-08-06T19:25:02.905453Z","title":"Segllm: Multi-round reasoning segmenta- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.905453Z"},"links":{"cited_paper":"/paper/2410.18923","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:a90f2e7facafe3ea8300e0e73ba2bcdcf5cdc6c27ab6b23ee672f437d5112717","observation_id":"a118ef6e-a4e0-4a5f-a839-c70b4d9bbcac","resolution":{"observed_at":"2026-08-06T19:25:02.905453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-13T00:31:54.264749Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-06T19:25:02.914864Z","title":"Lasagna: Language-based segmentation assistant for complex queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.914864Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:9fcf295cc7b3c851f9c0fde02c12443e4208d64dbc00a6d83e4d7777045e6b4d","observation_id":"079b2c5b-371f-4f8f-8e52-c5cff871c6e6","resolution":{"observed_at":"2026-08-06T19:25:02.914864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.940241Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":"15924f18-ec2f-49db-8437-809648847cb8","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.920393Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:8d097d2e1a1728b63ce61a73fdf273167d94f1b943bf02c478ca73f8df223e8b","observation_id":"0b659962-2df3-4eea-b750-fe0c9decdd8a","resolution":{"observed_at":"2026-08-06T19:25:03.946172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-12T23:44:22.154771Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-06T19:25:02.926461Z","title":"Visionllm v2: An end-to-end general- ist multimodal large language model for hundreds of vision- language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.926461Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:a14ec529657dca30216d1ed4ae188ac3e7fcc8800dba6e995e6b6b6e064f67f8","observation_id":"a8036437-e011-48ec-9078-abfa965eb13e","resolution":{"observed_at":"2026-08-06T19:25:02.926461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.923978Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"55d5f245-52a9-4c6b-9657-a47b99b3e482","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.934981Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ddf331ba6a81006221f0ee3bacddbef17f4db5763d9e2405e4af78b9b9e7ac04","observation_id":"59987610-2c72-4322-9dd0-1d553565e551","resolution":{"observed_at":"2026-08-06T19:25:03.929391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.906438Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"d3c87a80-cbfc-47f1-b047-4af150feb118","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.940703Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:199951f786191ce7d14cda4ff1885bf37a5fe7194b3c7f964b5271fd195b9891","observation_id":"30aae116-914d-4b0e-8ae2-252453f7df71","resolution":{"observed_at":"2026-08-06T19:25:03.911800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-06T19:25:02.946036Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.946036Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f2a055b24a5410312f46bb6ce0585c6f9e3d0d8d10505ea19593876bbbaf2cfe","observation_id":"8a51f921-683d-4c95-aaa1-d22e69acf980","resolution":{"observed_at":"2026-08-06T19:25:02.946036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.888686Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":"99c42410-c536-4452-9896-437b42f7d2dc","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.952327Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:89fec812ee48f69bfcd6eed851da33bea6970823e09eb8fe7c15725217c1600f","observation_id":"991fa207-564b-42eb-b34a-12de5323ffce","resolution":{"observed_at":"2026-08-06T19:25:03.894309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-13T04:52:37.935795Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T19:25:02.959690Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.959690Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ac02aa93be20fdc005a5170e9566b242b09050263166557ee4bdbdee57a924e2","observation_id":"ae5f731d-8a5b-4e55-8359-535d567b62d7","resolution":{"observed_at":"2026-08-06T19:25:02.959690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.870141Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":"16dcc591-9d9e-4fdb-8ad5-79cab1017cab","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.966226Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:70146b82ada5dc201ba545375523e672b48042fe4933e00a12b4282c259d8af1","observation_id":"6b3102a1-ab8f-4168-8805-3f6862cb943c","resolution":{"observed_at":"2026-08-06T19:25:03.876247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-14T09:06:05.525723Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-06T19:25:02.971505Z","title":"mplug-owl3: Towards long image-sequence understanding 11 in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.971505Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f5602df9ebbd9c4e9258abc00f3eb76ae24e28c22946d15ca0b80dc6648fc7fb","observation_id":"f156745b-ab03-44ca-becf-967ee861c55b","resolution":{"observed_at":"2026-08-06T19:25:02.971505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T19:25:02.977524Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.977524Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:6641c6944663f28b8235d666e2206e4923a798044b15ae9a84a60df8f6634bc0","observation_id":"2182922a-1b65-4d5c-8bf2-36da9a7155b1","resolution":{"observed_at":"2026-08-06T19:25:02.977524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.851340Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"0eec65a0-7fbc-437a-9798-861350835525","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.984296Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:2315424f7bead41886a56b16bad221eaa8ada51dba33acafd9c381c1eeecada1","observation_id":"836ac2fe-de2b-4583-aa04-dd43e5df3ee7","resolution":{"observed_at":"2026-08-06T19:25:03.857363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.834344Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":"b9de0ba6-3c1a-454a-8de4-13087ed44842","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.991047Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ba91ded41af103e4a9bc76a820d8184ada15eb2e1fabd1132661271daaac81b0","observation_id":"fe05fdce-4e5e-4b39-bd41-193b88ab0b47","resolution":{"observed_at":"2026-08-06T19:25:03.839191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.817538Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"a8bb8ebc-a8bd-4096-b65b-a53b549477dd","year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.998247Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:a690b27adc678ec10905fe51919f4f198e70ac5d1c959d17cc8aa668c7f9c64d","observation_id":"19788345-0a4a-453f-8243-d4300b29a1ec","resolution":{"observed_at":"2026-08-06T19:25:03.822751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-06T19:25:03.005676Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.005676Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:0c63b61c39c7b1f5e65f0acbb53bd514296f14841ea1ca8652a59410fc89c1c6","observation_id":"b9a6494e-4048-411a-9dcd-9946a68d8d5b","resolution":{"observed_at":"2026-08-06T19:25:03.005676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-13T11:00:14.993256Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-06T19:25:03.012476Z","title":"Gpt4roi: Instruction tuning large language model on region- of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.012476Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:e6a778cb88542030bcb952d3cceff4ea7b80add14ace5797fff8387c6cf59b61","observation_id":"fa0bda23-d1d4-4f18-ab4c-7c1957fad63b","resolution":{"observed_at":"2026-08-06T19:25:03.012476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.800614Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"9196457f-9e63-4b53-8205-77582b4e1cec","year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.020693Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:d387a12e62612d14e63668a222a01e28328c5fd6b5e2a5d2a6bfde6ff0923bb0","observation_id":"5faef72c-b81c-4aea-8c07-04ecd20f71e1","resolution":{"observed_at":"2026-08-06T19:25:03.805984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.781557Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"bdf8bf44-bdc2-4016-91b5-9574a8d27e52","year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.026335Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7cc16f83f7748aff272b2c2374feb5e95db4aa0dac9a42e60f0d1f79b253d062","observation_id":"d06d3946-b1e1-46c6-82e1-dcc182433d74","resolution":{"observed_at":"2026-08-06T19:25:03.787981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:25:03.032130Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.032130Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c692201f30f2a9cd5674b0817732cad39559fb0cdc94ba3a1d82357ed2afc8d9","observation_id":"068d6238-60ab-4185-b6b0-29f180f24a04","resolution":{"observed_at":"2026-08-06T19:25:03.032130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.761066Z","title":"When the provided information is insufficient, respond with ‘Unanswerable,’","venue":null,"work_id":"053f88a9-213e-4523-bf02-d28d4bed58af","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.038918Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:88d398a2cfd91b37d8d67c788640e070583e201171dbfcea7df0c768ad1a92b6","observation_id":"ffabad69-66d6-401c-9b0b-cfdb05f446f3","resolution":{"observed_at":"2026-08-06T19:25:03.769446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.318583Z","title":null,"venue":null,"work_id":"156b7b87-7a17-49a1-866e-a1b34cafda65","year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.672598Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:d7f9e2e32e11ca3250480ed199eea630df568dbc89b0d7047b8c619e4e5b321e","observation_id":"fd18e0b8-357d-4092-a28a-536a65f6a9a0","resolution":{"observed_at":"2026-08-06T19:25:04.323807Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 1 inbound Pith citation observation for arXiv:2507.06272."}