{"as_of":"2026-08-10T01:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:561f19d308d4b11a839f4d207d8d687c0252ee1657524da94f2cab3664f6645d","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:15:09.777799Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.06276/citation-record","integrity":"/paper/2512.06276/integrity","json":"/paper/2512.06276/citation-record.json","paper":"/paper/2512.06276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:04.539569Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.539569Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:0f9fcc79b0d802a5eff39ff2718e9cc7ad5353c48d8cb150fe4c99d4ccc17a28","observation_id":"da3a10ce-0c00-41d9-9d98-3bd16ecac0bc","resolution":{"observed_at":"2026-08-03T18:15:04.539569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T18:15:04.579056Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.579056Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:9fafd75ae56ed1e79421bf21ea284cb4317af8f98d2aee6c310fee64239355fb","observation_id":"1ac081a8-7e28-4f8c-bf34-9c7875622ae9","resolution":{"observed_at":"2026-08-03T18:15:04.579056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T18:15:04.635320Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.635320Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f163c33452a6e24c3977641cf3edca2ae44701a1dd8e97e80d73d6ab81e93c13","observation_id":"967822dd-61a2-4198-9923-dc5f5a705185","resolution":{"observed_at":"2026-08-03T18:15:04.635320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T18:15:04.693023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.693023Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:910d57d69e82e2477c2d0a04d8fae5288779d85e3c642fe62f11c74b59808008","observation_id":"bf67dab3-b5cb-428a-89e3-45a7a8e5868f","resolution":{"observed_at":"2026-08-03T18:15:04.693023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-07T15:35:48.142895Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-03T18:15:04.760809Z","title":"Univg-r1: Reasoning guided universal visual grounding with reinforce- ment learning.arXiv preprint arXiv:2505.14231, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.760809Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d4a8d39ad2c4e087ace39c0c8a821d0a7a14dae2605efbfdc3085d9d3370eb87","observation_id":"f24a486f-9919-4c6f-9c83-b659c5184936","resolution":{"observed_at":"2026-08-03T18:15:04.760809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:04.818019Z","title":"Revisiting referring expression comprehension eval- uation in the era of large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.818019Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:8358faa3f785732b6b9bc0abab5bb7850ad5ec6c237d96539faa1b39bf613025","observation_id":"4432b674-c5e6-4f3b-8cd3-af77f1dad750","resolution":{"observed_at":"2026-08-03T18:15:04.818019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-03T18:15:04.895286Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.895286Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:7799e940b579eadecac340c308b6e119b5c3ffd7cdd8b5a709da9536f3d35874","observation_id":"8d9db02b-185a-4933-8366-79daa45afdce","resolution":{"observed_at":"2026-08-03T18:15:04.895286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T18:15:04.999810Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.999810Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:6e7c7ee41e087db54b94d4b3346a53d9502323bb713f91014bfc815a9f344d2c","observation_id":"5b8fed1a-db9e-4431-99f9-2085bc73bb16","resolution":{"observed_at":"2026-08-03T18:15:04.999810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.037620Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.037620Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a541560b1dbac8524bf0d27801dba21d6ccb65a07afa4b7a3360968b1c80c0ad","observation_id":"78ef50aa-7bb2-4199-bf2e-a4359ee1dfa4","resolution":{"observed_at":"2026-08-03T18:15:05.037620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16182","last_updated":"2023-12-24T15:13:10Z","snapshot_observed_at":"2026-07-06T16:12:22.303188Z","submitted_at":"2023-08-30T17:58:50Z","title":"GREC: Generalized Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16182","snapshot_observed_at":"2026-08-03T18:15:05.093422Z","title":"Grec: Generalized referring expression comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.093422Z"},"links":{"cited_paper":"/paper/2308.16182","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:9a357e40683590770b6903b806fa6c4946dacc33fd41953095fc0d43ab7f0065","observation_id":"3945e791-9831-4f40-aeb9-39e4a7ffbf6a","resolution":{"observed_at":"2026-08-03T18:15:05.093422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T18:15:05.144797Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.144797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:de9366495f5585c90012503612db3ceaa04073f39971985d09d7db5b45debd4c","observation_id":"1c0a1b47-97c7-49b6-aa46-3b38fbb24aeb","resolution":{"observed_at":"2026-08-03T18:15:05.144797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-09T11:37:16.443400Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-03T18:15:05.207146Z","title":"Chatrex: Tam- ing multimodal llm for joint perception and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.207146Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:ed934144d698405aba59dd74ea1292af718647bf611fac39263c0a270ba9dcaa","observation_id":"21bcd62c-d96f-4fc7-a957-29b10de5adb9","resolution":{"observed_at":"2026-08-03T18:15:05.207146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04034","snapshot_observed_at":"2026-08-03T18:15:05.261966Z","title":"Rex-thinker: Grounded object re- ferring via chain-of-thought reasoning.arXiv preprint arXiv:2506.04034, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.261966Z"},"links":{"cited_paper":"/paper/2506.04034","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:64f7e7f990c744aa5a41b281caf78820c66fd9aae8ce792a4a1900c443981bae","observation_id":"681d3c20-3ae6-471f-993a-9a2a81638482","resolution":{"observed_at":"2026-08-03T18:15:05.261966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08507","last_updated":"2025-05-12T02:14:50Z","snapshot_observed_at":"2026-08-07T17:12:44.716807Z","submitted_at":"2025-03-11T14:57:14Z","title":"Referring to Any Person","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08507","snapshot_observed_at":"2026-08-03T18:15:05.304394Z","title":"Referring to any person.arXiv preprint arXiv:2503.08507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.304394Z"},"links":{"cited_paper":"/paper/2503.08507","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f285f7c5bf38919959aef42d98fb438433ef2a1ac37cdbcea23c753e5d736750","observation_id":"731f7b62-d644-49a6-9fc5-c6e0bae9b1d1","resolution":{"observed_at":"2026-08-03T18:15:05.304394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.368756Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.368756Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f58a9f9b5927a3020408d3a3f3d5f639063915935957564b1e509891bf9e6009","observation_id":"db7e48df-b46e-4f64-bfdf-b05045bf3f46","resolution":{"observed_at":"2026-08-03T18:15:05.368756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-03T18:15:05.459491Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.459491Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f87e14cc88f37597409d772f3688e88241eb113fa0ed73207b13589abf745030","observation_id":"b3603a2e-65cf-45c4-8f50-e6e53fa82e62","resolution":{"observed_at":"2026-08-03T18:15:05.459491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-03T18:15:05.561502Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language mod- els.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.561502Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fcc54daefd46c42adc4f42b875aee2ed977bef51d0cc0eec61b471669017ca0d","observation_id":"63fd2520-a011-4839-b7eb-25fdabc0b8cb","resolution":{"observed_at":"2026-08-03T18:15:05.561502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-06T02:17:30.272046Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-03T18:15:05.687979Z","title":"Eagle 2: Building post- training data strategies from scratch for frontier vision- language models.arXiv preprint arXiv:2501.14818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.687979Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a8224204ed07acb2931bc5860e20d17802c5dc08589ed1c0db614475ce40c8c7","observation_id":"9838a444-74c6-4038-9c95-699c7b9eb291","resolution":{"observed_at":"2026-08-03T18:15:05.687979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.753276Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.753276Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:06dae63370228c3a9f45d829397c2d34d2d779d215469d5ca45c398142de6c97","observation_id":"10e38b7f-9bbb-4f7b-8d35-e8a5196e304c","resolution":{"observed_at":"2026-08-03T18:15:05.753276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-08-09T01:44:49.494240Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05302","snapshot_observed_at":"2026-08-03T18:15:05.829843Z","title":"Perceive anything: Recognize, explain, caption, and segment anything in images and videos.arXiv preprint arXiv:2506.05302, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.829843Z"},"links":{"cited_paper":"/paper/2506.05302","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:339d16255b8d45d4753eac2a1ffa58bc1764edbb3b8ab21c90dfb58eb6fa263e","observation_id":"5bdff3cf-8f46-4932-b4a7-efc5fd55bbdc","resolution":{"observed_at":"2026-08-03T18:15:05.829843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14750","last_updated":"2025-01-11T15:12:37Z","snapshot_observed_at":"2026-07-06T19:20:14.980387Z","submitted_at":"2024-09-23T06:56:51Z","title":"FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14750","snapshot_observed_at":"2026-08-03T18:15:05.876710Z","title":"Finecops-ref: A new dataset and task for fine-grained compositional referring expression comprehension.arXiv preprint arXiv:2409.14750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.876710Z"},"links":{"cited_paper":"/paper/2409.14750","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:0936cab338bf03682d189ed2bf5d0806fdcf31e9c3973d6b7538bd1b74361a6b","observation_id":"ecb8f732-52e8-46c7-aa42-0f369074d339","resolution":{"observed_at":"2026-08-03T18:15:05.876710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.928558Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.928558Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:e42a91f90fdab1711506a787fadb13ecad996787c1e6b7dfd9279ab11a00fd55","observation_id":"d3744472-e751-4988-81d6-484f0af9c3e6","resolution":{"observed_at":"2026-08-03T18:15:05.928558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-03T18:15:06.001283Z","title":"Visual- rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.001283Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d4b4ca79def3eea7320ec6e90b27423005493783b9b6105984021f79b7e584ea","observation_id":"61ee1c29-9b90-442f-8d90-54e4bd3ce969","resolution":{"observed_at":"2026-08-03T18:15:06.001283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-07T21:47:16.436942Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T18:15:06.083870Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.083870Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:21292d3abffe5da3481079ee818ee6578ebe263ee158fc5f31c0320840e9132a","observation_id":"d081467a-fba5-47ed-8fed-6128430195bb","resolution":{"observed_at":"2026-08-03T18:15:06.083870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-08-03T18:15:06.151054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.151054Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f1b197a1c02e05b2dc50ace4dc55dd02692568fab3a06efd68fe7686e814ea37","observation_id":"f99a459e-4aaf-4b83-95b3-b768bf4252aa","resolution":{"observed_at":"2026-08-03T18:15:06.151054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.211228Z","title":"Multi-task collabora- tive network for joint referring expression comprehension and segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.211228Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:3d5138070a3b8c9ba4ffa6c88971335950e0b4ee5c7c306d3bf3baff18040954","observation_id":"402deff4-801e-4ee6-91ed-d8bc3fdcabcc","resolution":{"observed_at":"2026-08-03T18:15:06.211228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.257337Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.257337Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:31a6b06e02a7a7ea825ae59ab7c0aafec47756c0537f45a63146798e2da7388f","observation_id":"5a3c09eb-8af5-4315-b4ac-7e70bc71651c","resolution":{"observed_at":"2026-08-03T18:15:06.257337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.316009Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.316009Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d59fddd537117fa7050fab95294c96bdaf07152afca4ea78cf4399ef8d89a283","observation_id":"70e0be89-3c71-40ce-ada3-b967ab81f5c2","resolution":{"observed_at":"2026-08-03T18:15:06.316009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.430995Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.430995Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:86ea20783aea7f53a8c6707d5d956937b7b5e9e74a7523b7d93462ea38c61293","observation_id":"e0f64d39-28e0-4eb7-bc2c-991d0754030b","resolution":{"observed_at":"2026-08-03T18:15:06.430995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.490275Z","title":"Gpt-4v(ision) system card.https://cdn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.490275Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:7d31ae16f78581768e13fbbd501b71d4ca90f1833800753cd8a64a029f380856","observation_id":"0f3d6205-ec34-4f98-bc2e-16293ae0aac1","resolution":{"observed_at":"2026-08-03T18:15:06.490275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.546252Z","title":"Gpt-5 system card.https://cdn.openai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.546252Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:e33c75ed18216e15e94eca69b6c33b6be7d3a0a0b8ba2b078b85e12a50f495d1","observation_id":"a8f49206-0282-4865-84ca-bbbb87e053f2","resolution":{"observed_at":"2026-08-03T18:15:06.546252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.662874Z","title":"Referring ex- pression comprehension: A survey of methods and datasets","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.662874Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:e89aecb12e64d7a233caebe20714c31c415e894be8769ffce1095b0f5465d9a1","observation_id":"65a78f74-539f-4987-9c7f-731bc1de8bd8","resolution":{"observed_at":"2026-08-03T18:15:06.662874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.774752Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.CoRR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.774752Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:aca7009acbdf16ee506ad470154f2d3d61d00f81beb3128bec4935b2f34bce3f","observation_id":"9dfdd7a3-e0de-4829-8d46-949032369237","resolution":{"observed_at":"2026-08-03T18:15:06.774752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T18:15:06.876514Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.876514Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:daff0f92d77484faf2fcb1fd96f032d3b7b4a7511f056cbd568eae4824871dc8","observation_id":"576bdeb4-f9b7-4bf8-b7f6-5f07d1c93721","resolution":{"observed_at":"2026-08-03T18:15:06.876514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-03T18:15:06.983726Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.983726Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f865a5f63f842dd19bb3e23697f9e76a76400f06240661c416a97029321ff5ba","observation_id":"e1296e17-1939-44a6-8446-7d675f11bdad","resolution":{"observed_at":"2026-08-03T18:15:06.983726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.060034Z","title":"Patch-as-decodable-token: Towards uni- fied multi-modal vision tasks in mllms.arXiv preprint arXiv:2510.01954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.060034Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:b5429f8c004b69b783480858023f61a2019dc0afc948577ab63934d397ca4c0b","observation_id":"e6a80eed-482d-4ae2-84cc-0d40b7fb4b12","resolution":{"observed_at":"2026-08-03T18:15:07.060034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.259707Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multi- modal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.259707Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:3f0d85342e37bd4f3c5714f808a46f026b798a8fc2da17b290690b4bf2cfeb0d","observation_id":"9b4a338a-fb29-4a97-9e22-fac40314b0b3","resolution":{"observed_at":"2026-08-03T18:15:07.259707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T18:15:07.458967Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.458967Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d4c54a83c42d6b30cfd52f795b0bf3b7bb250a235179f3af7cb44086a946452b","observation_id":"3db9db6f-fcf0-4c3e-880a-67a7059bf4f5","resolution":{"observed_at":"2026-08-03T18:15:07.458967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.601795Z","title":"Cogvlm: Visual expert for pretrained language models.Advances in Neural Information Processing Sys- tems, 37:121475–121499, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.601795Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:250a7767c363e9f30c8af780af5fbde9da4d6a41e782da1f710549f3d3c45e1c","observation_id":"1ccea993-3747-459f-8f58-8bd87257ca8d","resolution":{"observed_at":"2026-08-03T18:15:07.601795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T18:15:07.683207Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.683207Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a0e026a497b45734c116f8ef130730275cd673162adc0b1d1a3a694bc5968938","observation_id":"da076246-6d8d-4668-bfce-913e2385243b","resolution":{"observed_at":"2026-08-03T18:15:07.683207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.787595Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.787595Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:386659b36a2f4c009f864cfc3b6999f34814a7a81fa6c21fbfab5ad60494a1cc","observation_id":"729569c2-b377-4281-b81b-4f524fefe190","resolution":{"observed_at":"2026-08-03T18:15:07.787595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-03T18:15:07.837162Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.837162Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a99db95bfe5123f1273b93ec9f006a546dff3da34678ef4785e6dfb0b0b74998","observation_id":"4d93ed22-5206-4c68-a1ce-0505f0e0f35e","resolution":{"observed_at":"2026-08-03T18:15:07.837162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07608","last_updated":"2025-06-05T11:49:09Z","snapshot_observed_at":"2026-08-07T15:47:50.795694Z","submitted_at":"2025-05-12T14:30:11Z","title":"MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07608","snapshot_observed_at":"2026-08-03T18:15:07.935450Z","title":"Mimo: Unlocking the reasoning potential of language model–from pretraining to posttraining.arXiv preprint arXiv:2505.07608, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.935450Z"},"links":{"cited_paper":"/paper/2505.07608","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:63cf35958d262680ab14d1325406ba8881d29888930bbcc49a347d5c3bf37518","observation_id":"db9bcf32-653c-4f92-a650-2d55ad2f5251","resolution":{"observed_at":"2026-08-03T18:15:07.935450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.030855Z","title":"FG-CLIP: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.030855Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:485b9f4c2f1d5e08010e7c0ebf2f6271d3d237a23fd9e4ab43171f4dd86a27d3","observation_id":"74f776f6-90cd-48e2-86b5-fdc20ff0c53a","resolution":{"observed_at":"2026-08-03T18:15:08.030855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-03T18:15:08.183639Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.183639Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:39dc3fa950970396c61036e9a67e649110f9a9e321d0221a95e11343c09de7fd","observation_id":"2dd413a9-b3c8-492c-8eac-b7f26b238764","resolution":{"observed_at":"2026-08-03T18:15:08.183639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.325970Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.325970Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:c99326e98f5a9fc2780fda15f681f07dd06f5a4ba4d0d96fd11e2893a670384a","observation_id":"b1bce0ce-06fb-40a6-a8ac-362c4126733b","resolution":{"observed_at":"2026-08-03T18:15:08.325970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.404859Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.404859Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a186f56fd68deb495c515f5cc52fbd3e8b1e680d4589fb641d94c8b791bbb9ea","observation_id":"5b00f6ce-5600-4dd7-999f-6f8b1b032c79","resolution":{"observed_at":"2026-08-03T18:15:08.404859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.514856Z","title":"Revisiting counterfactual prob- lems in referring expression comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.514856Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:91e3a296a5b075634125636392b5422b63151d1bd0bddd16362e7bacbd524e5f","observation_id":"69e15d4d-0cf5-44f3-a7dd-28377eee06ed","resolution":{"observed_at":"2026-08-03T18:15:08.514856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.637873Z","title":"Referring expression comprehension with semantic visual relationship and word mapping","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.637873Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:8f4c82685d6ca0d7c498c2c264d2094cd543d2041255d529589bbd1e6264730a","observation_id":"b08e51da-35fe-47f9-8f01-f04124ecdad7","resolution":{"observed_at":"2026-08-03T18:15:08.637873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-08T19:12:53.528060Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-03T18:15:08.771844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.771844Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d208b9fb985031161421dff7b4094f21433aa402867489984b6aa3db1513a7e8","observation_id":"81826f37-eb77-4845-9ef3-01f6a68d07a8","resolution":{"observed_at":"2026-08-03T18:15:08.771844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13076","last_updated":"2022-10-24T09:53:41Z","snapshot_observed_at":"2026-08-05T21:38:11.500694Z","submitted_at":"2022-10-24T09:53:41Z","title":"Towards Unifying Reference Expression Generation and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13076","snapshot_observed_at":"2026-08-03T18:15:08.894756Z","title":"Towards unifying reference expression generation and comprehension.arXiv preprint arXiv:2210.13076, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.894756Z"},"links":{"cited_paper":"/paper/2210.13076","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:bacb5767746576165ced0a92e82619ebbe00e71d75f745b09e3b45aff3c45adf","observation_id":"9fc71d84-4992-4e43-ac5e-d1b650761d0a","resolution":{"observed_at":"2026-08-03T18:15:08.894756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T18:15:08.960506Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.960506Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:3ae9c709ca0c53261b8d10abb3feb3fa18238dfb02ea57eaac6f6be658c1e95a","observation_id":"e41f54f7-240d-482c-b270-6870ee617ea7","resolution":{"observed_at":"2026-08-03T18:15:08.960506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.052966Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.052966Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fad43e5bcb9ba61ed8d3ce8200d406bd0e70aa481d8e7cfc238c9b2b50aea57a","observation_id":"8fb223f4-bf55-4590-a199-7f87fab54bbb","resolution":{"observed_at":"2026-08-03T18:15:09.052966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.163085Z","title":"We filtered the images based on their resolution, retaining only those within the range of 1024x1024 to 2048x2048 pixels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.163085Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4a5eb6fb7bc47a767fec33c61f9625f39ef9450d66b113bff6f6a78b73020aec","observation_id":"c8ea21a0-2dee-4786-a61f-ce9642f5adc9","resolution":{"observed_at":"2026-08-03T18:15:09.163085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.279542Z","title":"The improve- ments are most pronounced in Compositional Reasoning, especially within the Relation sub-category","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.279542Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:b18fdbc1b055325d261d8c4abe4844011f47ca1781dc16a0c12927258b3453f5","observation_id":"a106fe0a-25e5-4c9c-9802-0fac829d2afb","resolution":{"observed_at":"2026-08-03T18:15:09.279542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.349920Z","title":"These fig- ures provide a visual comparison of several representative models across challenging examples from all six categories","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.349920Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:ea275ed62eeb4cc6e226824f33446c1bf30408bb09a5582cd86c95050e9f770c","observation_id":"96c0b0bf-4123-4843-bae8-cc54859bf5b7","resolution":{"observed_at":"2026-08-03T18:15:09.349920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.425170Z","title":"Assign a clear and concise class label to each object (e.g., 'person', 'laptop', 'coffee mug', 'dog')","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.425170Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:1753b347ca7e4cf9f03235d58640f8f44f8a467defc3dd2e91d73f78347095c5","observation_id":"2859ab34-9466-434b-b8bd-1486a9a53c2e","resolution":{"observed_at":"2026-08-03T18:15:09.425170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.505935Z","title":"Each instance requires its own property dictionary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.505935Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:c78b6cedd5e0182418ddc2d855a0122fdf284d9d0d8c67a7e05e690c3ad19319","observation_id":"5b8032cb-9060-45fc-8df1-7153f10f2f0f","resolution":{"observed_at":"2026-08-03T18:15:09.505935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.567300Z","title":"Populate this object with all observable visual properties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.567300Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f22928a9941b81f00311273f16ec4968c89e0dffd6155433aa8e5452bedfe5a6","observation_id":"a7f42b7d-661b-4196-91ce-c0d280ed4473","resolution":{"observed_at":"2026-08-03T18:15:09.567300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.636249Z","title":"to the left of the monitor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.636249Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4e4413e23637b8f32faaa4ad6dad98a2e929dad3918a45c972edc55e3ce8ae76","observation_id":"c28d9f9f-0d1f-481e-9069-a7098eb5704a","resolution":{"observed_at":"2026-08-03T18:15:09.636249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.715916Z","title":"a white ceramic mug filled with dark coffee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.715916Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f5e79bef0edde680eaf49f0f116802cf14ca7d282d4a15e16474f9c249279e25","observation_id":"9b4d2d47-3db9-4cb0-9e7d-7d8426063bf7","resolution":{"observed_at":"2026-08-03T18:15:09.715916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.777799Z","title":"scene_properties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.777799Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:348bad208d78dff33d94259329fd9474c751c22b17cd513bcb92c7eb9cfe2439","observation_id":"37078029-0070-4c8d-a347-1af69d0f174c","resolution":{"observed_at":"2026-08-03T18:15:09.777799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2512.06276."}