Pith. sign in

Paper Citation Record · LEDGER

Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2501.07888.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.07888 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 27 of 27 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 27 of 27 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T21:07:32.473373Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation ad0af566-b5c3-4249-9bc2-44d4c77eb671 · inbound

Goku: Flow Based Video Generative Foundation Models cites this paper.

Goku: Flow Based Video Generative Foundation Models Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-08T21:07:32.473373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T21:07:32.473373Z digest=sha256:102d5642a52731e2cc09f3896ff0ba3240c9bf2156069ffc7d1cfeb92f9b0779

Observation c4820ee3-cf4b-4940-b5c7-8710dff26a8d · inbound

Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval cites this paper.

Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-07T14:14:46.292799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:14:46.292799Z digest=sha256:d44ff33d5cd8963750ea1baf27aa120401e228450bc44456c854632da66183bf

Observation a745cefa-6f64-4205-8f2c-d09036d15a8b · inbound

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs cites this paper.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.456890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.456890Z digest=sha256:5c6bcc9ccc734cc3d6ee34ef825418ada5d26b49cec960c857a76bd606f515ef

Observation 71e9c9c5-ee26-4ec7-af1a-7aa1e7509853 · inbound

VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking cites this paper.

VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T11:40:55.923555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:40:55.923555Z digest=sha256:af13f95b578b0286bc569a9cd6ae537add8c26cdd40010a1816f4a178236188a

Observation c96d5b97-b387-450b-a5f1-13dc333d2a9f · inbound

How Important are Videos for Training Video LLMs? cites this paper.

How Important are Videos for Training Video LLMs? Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:51:07.913992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:51:07.913992Z digest=sha256:6e716424ed1e1d20cd411438bc870eae0167502c430d5108dabe65c64720b1a0

Observation c4a72311-99ba-4367-80b0-3e7fe61effcf · inbound

Seedance 1.0: Exploring the Boundaries of Video Generation Models cites this paper.

Seedance 1.0: Exploring the Boundaries of Video Generation Models Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-11T12:09:57.400029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-11T12:09:56.836351Z digest=sha256:4c9fd0096c759b3eded6b36032c6b03804df48a8e26fce73d45d08946f0dfeed

Observation 506152f2-e699-4975-852f-f94d86af54a0 · inbound

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning cites this paper.

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 54

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:33:50.994322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-11T00:33:50.471804Z digest=sha256:91c5cce5fcad89f70185c31682d25fb4345329a3ac1cbb4be112584e516204f5

Observation a136efc8-662b-450c-90c5-22835e454eb3 · inbound

Kwai Keye-VL Technical Report cites this paper.

Kwai Keye-VL Technical Report Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T20:45:10.093677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:45:10.093677Z digest=sha256:b94b68355cedb897a900739baf17255e5cb26b5e3b8ce80d7e8ffce80ea6d474

Observation 5672ce2c-f641-4552-ba1f-88334ca51faf · inbound

Kwai Keye-VL 1.5 Technical Report cites this paper.

Kwai Keye-VL 1.5 Technical Report Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T12:28:28.452005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:28:28.452005Z digest=sha256:5cbae1c3202e76a0ef0f29b46cd9f8507ef1f026edb2865c97f922f77bbd8f0a

Observation 71939508-e1c3-4376-8bb6-6eb0b7b8a73a · inbound

NeMo: Needle in a Montage for Video-Language Understanding cites this paper.

NeMo: Needle in a Montage for Video-Language Understanding Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-04T13:54:25.161492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T13:54:25.161492Z digest=sha256:a90c7261d95b96659035eec7a9b2f1d54f76c1aaedcf595f96a7defcc6efa4b4

Observation d8945482-6b3c-4c05-8c01-c345ae36d1ed · inbound

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing cites this paper.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.808955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.808955Z digest=sha256:a7d5f342a4dbf40d7e62ea762b674ccf5c0b449a7aae25dd2ff14ce4736f6767

Observation 837614d4-94f0-44a2-b888-7a5e2b1dad60 · inbound

Syn4D: A Multiview Synthetic 4D Dataset cites this paper.

Syn4D: A Multiview Synthetic 4D Dataset Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 130

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T17:46:07.659960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-08T17:14:50.827455Z digest=sha256:000367d00d7899d12b21b21bd61a79945edfbc4106e8cf45e995d681a95bdccb

Observation 97f91e0e-d866-4983-9f5d-63cfd6aafa82 · inbound

Syn4D: A Multiview Synthetic 4D Dataset cites this paper.

Syn4D: A Multiview Synthetic 4D Dataset Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 129

Resolution
unresolved
no resolver link, observed 2026-07-12T17:33:21.224727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-12T17:33:21.224727Z digest=sha256:fcfd8d98d3ce2adc714b96b55428a2c1a14efef35c81c2e1ce54fb097060f69c

Observation 81f5c3bc-281a-4040-813c-dd57eb4f54a0 · inbound

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models cites this paper.

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:31:26.810795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T04:13:21.487431Z digest=sha256:1b2e2d4984bf894fcfe60a93697195d6585762208d04cdafd9cdbb841748d67d

Observation 2fee3852-83c5-41a1-9c57-bdca37c063c4 · inbound

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models cites this paper.

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:57:28.247244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-13T06:53:42.726350Z digest=sha256:412aa9d2bf6d4b52aba893ead0ba2e8c06657185b1b659cc7a7d6a4864e59923

Observation c13f9945-5d2d-4cd3-b539-cdc63e8a7fcd · inbound

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction cites this paper.

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:50:24.582603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-25T05:46:57.253756Z digest=sha256:a069526dbb1f7e603c7d5f7c1a7fe3ca1d874e628925a3b8f978dff7f1b82229

Observation e825296b-f6c7-4712-8e04-fc4d80848624 · inbound

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence cites this paper.

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-06-29T22:13:59.509917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-29T22:12:05.365596Z digest=sha256:7a586e16f258e06ab4774c2931ff981de8dfeb0972a6ea96a76c068a19852eae

Observation 2e656377-e5d8-4dd9-a5dd-4f8f19bbae3b · inbound

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning cites this paper.

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.467011Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-29T13:13:57.599970Z digest=sha256:bfc18a8e8ef191fdca9590398622538b50eb9fceb9bf938157c43c39039dd5d9

Observation 2d08a864-9ca4-44ec-9909-28ed378eedee · inbound

Task-Focused Memorization for Multimodal Agents cites this paper.

Task-Focused Memorization for Multimodal Agents Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-06-29T00:12:50.491227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-28T23:14:45.287255Z digest=sha256:9d4e3c81a4db34967c4b31cbe98d53fb2944f3e6b4a437a7c1b69a72bde8fe0b

Observation d344e5c1-beb9-4a5f-a9ab-a1c298b9f080 · inbound

Watch, Remember, Reason: Human-View Video Understanding with MLLMs cites this paper.

Watch, Remember, Reason: Human-View Video Understanding with MLLMs Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:27:15.563714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T22:00:28.350003Z digest=sha256:f736294799ae924ebf884351dd66994a5ba8218c9e195997ac88e153e94e5194

Observation 8cce8127-212d-43fe-8fed-4edf35c38d80 · inbound

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning cites this paper.

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 95

Resolution
verified exact
arxiv_id, observed 2026-07-03T00:17:29.003700Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T17:21:38.543724Z digest=sha256:44df53a45e3e8eddc54499bac4a0497ccf27898ad2fd9090063e07ade15c83a4

Observation 28359097-2996-405b-9bfd-b14c2bf3938d · inbound

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning cites this paper.

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-07-04T17:40:00.898737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-25T23:29:24.520537Z digest=sha256:166dd8f984703a370a4c0ca81c42f1e1de50ad47815076fd9c443103b4da08cb

Observation d43b88f3-90dd-4d8c-b055-ba896156cbef · inbound

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos cites this paper.

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T07:24:21.165380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-30T07:21:46.783970Z digest=sha256:ae28d9791655fa5b7081e59f3d7d9ead7699759701801fa37df7fc1029aab82c

Observation bba6e8b5-3184-4c67-af0b-ba8051221a73 · inbound

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models cites this paper.

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-07-02T13:46:58.616375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-02T13:44:48.250838Z digest=sha256:b4127ed8eef6690e3017f2f76836d56a126c9163d7d238e2bf09535bab79bdaa

Observation e23db478-1672-4805-8959-7441d03e82d8 · inbound

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning cites this paper.

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 66

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T16:38:39.648951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-03T16:37:06.384435Z digest=sha256:729365cf32fb565fcea69bcedf30f70ecb91052a4431d1176937b57b2f981945

Observation dc8bdbe5-db5f-4970-bc1b-09f5f5777cae · inbound

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding cites this paper.

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T00:44:43.581545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T00:44:43.581545Z digest=sha256:6bf308797afe0c7859203382a114b5bf70e17010cc062eab591148b195391af7

Observation 5a5680dd-462b-49e5-a284-ee7adb09ce1f · inbound

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models cites this paper.

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T06:33:14.955758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T06:33:14.955758Z digest=sha256:9c69f5f17d96478cae97a9f58d2975c65209d6f431904a036ae4b1c3809357f3