{"as_of":"2026-08-09T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd40e71864fa82f128e497444257bc08fb00b56b00b818ff74f9fdd422eb813a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:07:32.473373Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-08T21:07:32.473373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.473373Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:5e8916dd8ab3124f621a5baa974d07f931ff823e8fc34ec31e55d7ae25957655","observation_id":"ad0af566-b5c3-4249-9bc2-44d4c77eb671","resolution":{"observed_at":"2026-08-08T21:07:32.473373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T14:14:46.292799Z","title":"Tarsier2: Advanc- ing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.292799Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9e75b2a5288b0e33a47e7b64572dd38addecabe0ba2bd20bf76fd85b8f5e83c2","observation_id":"c4820ee3-cf4b-4940-b5c7-8710dff26a8d","resolution":{"observed_at":"2026-08-07T14:14:46.292799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T13:14:08.456890Z","title":"Tarsier2: Advanc- ing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.456890Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c2639d8647655886c28ec388688a5b3932b718d46ad8723607b5de1cc30558cb","observation_id":"a745cefa-6f64-4205-8f2c-d09036d15a8b","resolution":{"observed_at":"2026-08-07T13:14:08.456890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T11:40:55.923555Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.923555Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:46eeb0727d618907f22e0e0a3780d2b949c73cef83d5f4a30d18e0a2bf15cd2b","observation_id":"71e9c9c5-ee26-4ec7-af1a-7aa1e7509853","resolution":{"observed_at":"2026-08-07T11:40:55.923555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T05:51:07.913992Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.913992Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:a04faeaffca4a64fdd9aa99f8911ac1cae87ce241984e893b66f04bf70f161ec","observation_id":"c96d5b97-b387-450b-a5f1-13dc333d2a9f","resolution":{"observed_at":"2026-08-07T05:51:07.913992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-09T02:36:54.979612Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T12:09:56.836351Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.09113"},"observation_digest":"sha256:30d5c8813d3dec5fda634b93906aafe0bf18b43d37faed7cc27a71aec76407af","observation_id":"c4a72311-99ba-4367-80b0-3e7fe61effcf","resolution":{"observed_at":"2026-05-11T12:09:57.400029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:1c2b2ad81e6aae0212c802eda644933bc213d8f33117de45de239df2868569bb","observation_id":"506152f2-e699-4975-852f-f94d86af54a0","resolution":{"observed_at":"2026-05-11T00:33:50.994322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-06T20:45:10.093677Z","title":"Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.093677Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:676b2fa30bc25da30c8788e218fe01ec1f12ea2d3459e9df9bdeceafc45391bc","observation_id":"a136efc8-662b-450c-90c5-22835e454eb3","resolution":{"observed_at":"2026-08-06T20:45:10.093677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T12:28:28.452005Z","title":"Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-08T11:15:53.631141Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.452005Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:232b666325f21e1094ee6b5771cf29f704683126acf72fcadf9658aba0ef1b0e","observation_id":"5672ce2c-f641-4552-ba1f-88334ca51faf","resolution":{"observed_at":"2026-08-05T12:28:28.452005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-04T13:54:25.161492Z","title":", Wang , J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24563","last_updated":"2026-07-15T12:54:15Z","snapshot_observed_at":"2026-08-08T23:25:33.156446Z","submitted_at":"2025-09-29T10:16:05Z","title":"NeMo: Needle in a Montage for Video-Language Understanding","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:25.161492Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2509.24563"},"observation_digest":"sha256:33bd9b751fd08b8fb49e1f63dbdaf46d2cdd965ace52f5d5d0c26eaed02f59cb","observation_id":"71939508-e1c3-4376-8bb6-6eb0b7b8a73a","resolution":{"observed_at":"2026-08-04T13:54:25.161492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-03T16:25:59.808955Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.808955Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:b5ef553f9c8c656867b695823e4be0c3d1fa4ad7295fa7d08db75f2534a923f1","observation_id":"d8945482-6b3c-4c05-8c01-c345ae36d1ed","resolution":{"observed_at":"2026-08-03T16:25:59.808955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.05207","last_updated":"2026-07-04T22:32:17Z","snapshot_observed_at":"2026-07-12T17:31:58.542742Z","submitted_at":"2026-05-06T17:59:55Z","title":"Syn4D: A Multiview Synthetic 4D Dataset","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-08T17:14:50.827455Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.05207"},"observation_digest":"sha256:e2c6f0f0ae9281fbc11d0645667c5c0091366c0673861d0f21186e468e612f6c","observation_id":"837614d4-94f0-44a2-b888-7a5e2b1dad60","resolution":{"observed_at":"2026-05-11T17:46:07.659960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-07-12T17:33:21.224727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.05207","last_updated":"2026-07-04T22:32:17Z","snapshot_observed_at":"2026-07-12T17:31:58.542742Z","submitted_at":"2026-05-06T17:59:55Z","title":"Syn4D: A Multiview Synthetic 4D Dataset","version":2},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-07-12T17:33:21.224727Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.05207"},"observation_digest":"sha256:58ce5ac393171a00bd7e95c687775e05885bdab7ffca5c4e5865a5b8b2416798","observation_id":"97f91e0e-d866-4983-9f5d-63cfd6aafa82","resolution":{"observed_at":"2026-07-12T17:33:21.224727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:21.487431Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:e02a7b5e713970af98393ae096bcb3cab8865866e2d811a46806d7b9cfd5f781","observation_id":"81f5c3bc-281a-4040-813c-dd57eb4f54a0","resolution":{"observed_at":"2026-05-12T06:31:26.810795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:42.726350Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:aff3f100cc1faa686d4f9e824ac031722586324d1aef774e881ae05cb4d0b4de","observation_id":"2fee3852-83c5-41a1-9c57-bdca37c063c4","resolution":{"observed_at":"2026-05-13T06:57:28.247244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.22962","last_updated":"2026-05-21T18:47:56Z","snapshot_observed_at":"2026-07-06T23:33:14.457450Z","submitted_at":"2026-05-21T18:47:56Z","title":"GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T05:46:57.253756Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.22962"},"observation_digest":"sha256:f46e8f3f63cbd87cf983ae3b762933c4e7eb7f3ee7a999e6a4b0fc1fb20be4b6","observation_id":"c13f9945-5d2d-4cd3-b539-cdc63e8a7fcd","resolution":{"observed_at":"2026-05-25T05:50:24.582603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:468f3b4b8c1b63ce5fe093da1c5fbe8bc1fa87675a06ef95ed7632c2361a34ff","observation_id":"e825296b-f6c7-4712-8e04-fc4d80848624","resolution":{"observed_at":"2026-06-29T22:13:59.509917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:39a604fedbb0fe56b7fe157043f6835fc64a5f8114b9676a537d25162f7b2d2d","observation_id":"2e656377-e5d8-4dd9-a5dd-4f8f19bbae3b","resolution":{"observed_at":"2026-06-29T13:23:28.467011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2605.31075","last_updated":"2026-05-29T09:43:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-29T09:43:35Z","title":"Task-Focused Memorization for Multimodal Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T23:14:45.287255Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2605.31075"},"observation_digest":"sha256:3d6bab714288b0e96a8f5bb1105c176f6bf519367c1e2f60025a969e09d9478c","observation_id":"2d08a864-9ca4-44ec-9909-28ed378eedee","resolution":{"observed_at":"2026-06-29T00:12:50.491227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:06303c0d0ae8e324406de4c5adb7c86fb2d7ddb552e3eb933a223f3f681a7749","observation_id":"d344e5c1-beb9-4a5f-a9ab-a1c298b9f080","resolution":{"observed_at":"2026-07-02T17:27:15.563714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:ae10b3f3a9f311d3fe8ca913173ea175aae55135589098ae95e55bcc2dbfdace","observation_id":"8cce8127-212d-43fe-8fed-4edf35c38d80","resolution":{"observed_at":"2026-07-03T00:17:29.003700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-08-07T23:34:44.066451Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:86b9013da95024c59f12f2d21c094c0a44a73cca530f01e18e9ed4ae39e3887c","observation_id":"28359097-2996-405b-9bfd-b14c2bf3938d","resolution":{"observed_at":"2026-07-04T17:40:00.898737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2606.29531","last_updated":"2026-06-28T17:54:55Z","snapshot_observed_at":"2026-08-02T23:05:17.329812Z","submitted_at":"2026-06-28T17:54:55Z","title":"MotionAtlas: Detailed Region Captioning for Motion-Centric Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T07:21:46.783970Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2606.29531"},"observation_digest":"sha256:e65e154d3190c7b0e940a51f3965dd7f4ca47668429b50266a0c2b69130a96b3","observation_id":"d43b88f3-90dd-4d8c-b055-ba896156cbef","resolution":{"observed_at":"2026-06-30T07:24:21.165380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2607.01117","last_updated":"2026-07-01T16:04:24Z","snapshot_observed_at":"2026-08-01T19:51:36.300993Z","submitted_at":"2026-07-01T16:04:24Z","title":"MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-02T13:44:48.250838Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2607.01117"},"observation_digest":"sha256:7dff2520c87737ba09653a8e90e0b1fab20e8bf9fd166d4c675efcf6c4c4ebfa","observation_id":"bba6e8b5-3184-4c67-af0b-ba8051221a73","resolution":{"observed_at":"2026-07-02T13:46:58.616375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.07888","doi":"10.48550/arxiv.2501.07888","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":"ArXiv.org","work_id":"77605c65-9b44-4521-ad8c-79d9c78cf33a","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:6de743481fe899045517220232ade75134efbbdf20adc35a1f2c62b647cf8a14","observation_id":"e23db478-1672-4805-8959-7441d03e82d8","resolution":{"observed_at":"2026-07-03T16:38:39.648951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-02T00:44:43.581545Z","title":"Tarsier2: Advancing large vision- language models from detailed video description to comprehensive video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.581545Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:77dddb45fd6fadcba9f48d350cb4077e0fd1675c701236027e75112387a8c112","observation_id":"dc8bdbe5-db5f-4970-bc1b-09f5f5777cae","resolution":{"observed_at":"2026-08-02T00:44:43.581545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-02T06:33:14.955758Z","title":"arXiv:2501.07888","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-08T00:02:57.646683Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.955758Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:4aa48d7ad540f8ca6a2d48df6fe980137b28aef8222fef3f99fedffee8e40b29","observation_id":"5a5680dd-462b-49e5-a284-ee7adb09ce1f","resolution":{"observed_at":"2026-08-02T06:33:14.955758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.07888/citation-record","integrity":"/paper/2501.07888/integrity","json":"/paper/2501.07888/citation-record.json","paper":"/paper/2501.07888"},"outbound":[],"paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:41:38.983267Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2501.07888."}