Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T20:51:23.446353Z
Paper Citation Record · LEDGER
As of 20 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2505.11838.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T20:51:23.446353Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-07T14:27:16.976460Z
A source-named dated measurement, never combined with another source.
Source: pith, observed 2026-08-06T15:06:23.031057Z
34 of 34 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 8e680066-1f75-4a95-a243-71fa7857e919 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 34882888-5cec-4b6f-919e-4ef0d2094c8a · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 12c5b776-0ac1-4bc1-af6a-dca2f5e25f46 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Xmem++: Production- level video segmentation from few annotated frames, 2023
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 7897e6b0-a00e-4187-b006-4e2760cabde0 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 805914a6-098d-40d1-b5bf-a4fb9b3b2701 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Sam4mllm: Enhance multi-modal large language model for referring expression segmentation, 2024
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 422a5c2e-4f7b-4fa1-b54e-d0b46be65419 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cbc2b7bd-64f1-40b5-a847-4636b91678cc · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Everingham, L
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d172bf3b-e681-4412-84d1-908fcb2b2f95 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Digital twin: Enabling technologies, challenges and open research.IEEE access, 8:108952–108971, 2020
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 63ce6d0f-a584-4b73-8131-2c060e0922cd · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Referitgame: Referring to objects in photographs of natural scenes
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42903a0d-c5dc-434f-9e9a-abdd7a535443 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Segment Anything
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d704716a-fa1d-42b6-b31f-e0eef824911a · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Lisa: Reasoning segmentation via large lan- guage model
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation e4374edf-791c-4c0e-998a-00a51428e29c · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks ROUGE: A package for automatic evaluation of summaries
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 583d79b6-4ff8-4f86-a8ce-a89d419e66a1 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Gres: Generalized referring expression segmen- tation
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 28c4ee78-8c3b-4378-972b-61ccd2fd1486 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Improved baselines with visual instruction tuning
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ae2af742-7edd-4654-8d7f-e19283d5282e · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Martin, C.C
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 2abda5ed-62e6-4589-9cf1-9152da8e5c90 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks DINOv2: Learning Robust Visual Features without Supervision
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e3676ed-5d4f-4af4-a22a-bf0e101c5f3e · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Bleu: a method for automatic evaluation of machine translation
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 6e35947e-a3ff-4c48-bf91-bbde11a1bb14 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks A benchmark dataset and evaluation methodology for video object segmentation
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation a0e26df5-3a01-4e44-a9cd-d13b90858a42 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks The 2017 DAVIS Challenge on Video Object Segmentation
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 749cc0db-76fc-482e-86c7-82b27f89d329 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks SAM 2: Segment Anything in Images and Videos
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 06228c88-94ec-4723-b1ee-26566f01bdfd · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Position: Foundation Models Need Digital Twin Representations
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 62b0afb7-0921-484b-badd-43cd1bcd0375 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Operating Room Workflow Analysis via Reasoning Segmentation over Digital Twins
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e55708a-603f-41ed-aa0a-36ed465d4690 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Online Reasoning Video Segmentation with Just-in-Time Digital Twins
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42c786ed-fef0-4fae-ab8f-39b389c18581 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Lawrence Zitnick, and Devi Parikh
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 7cf4adea-803f-4cda-8f0f-eccdb8d42e9c · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Llm-seg: Bridging image segmentation and large language model reasoning
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 14a70f1a-4931-403f-8dd6-fad8a0633870 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Segllm: Multi-round reasoning segmentation, 2024
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 56a76897-c4e1-4fd7-b743-4b9ea84bbda0 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Lasagna: Language-based segmentation assistant for complex queries, 2024
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation d02c3672-f246-43ac-8afc-3e7fd41b5990 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Qwen2.5-Omni Technical Report
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 03755c2a-6af6-4934-a85d-088efd0306c3 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks VISA: Reasoning Video Object Segmentation via Large Language Models
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 991fbe76-f7df-4c96-96ff-6e76c5251d9d · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Depth Anything V2
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bd2367ed-de77-4e77-874c-ef2343081878 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks An improved baseline for reasoning segmentation with large language model.CoRR, 2023
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation e009d8a3-2fb4-4e60-ba33-5ddb3b359de0 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Weinberger, and Yoav Artzi
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7d86e2f1-943f-4fa1-9aea-55f1a324d422 · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks ViLLa: Video Reasoning Segmentation with Large Language Model
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1d6895ee-478d-40f7-a485-464f523808ce · outbound
RVTBench: A Benchmark for Visual Reasoning Tasks Scanreason: Empowering 3d visual grounding with reasoning capabilities
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation ab7aff1f-a7d5-44b9-82d4-6c5c1e4bc53a · inbound
Reasoning Segmentation for Images and Videos: A Survey RVTBench: A Benchmark for Visual Reasoning Tasks
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9c38a73e-c019-4a1e-a51a-9686a1255dcc · inbound
Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction RVTBench: A Benchmark for Visual Reasoning Tasks
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.