{"as_of":"2026-08-10T21:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27fd58db9ea0819f2753bca3c1b8b2ad75667e068986a2898b4a9d21f522040e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T10:48:17.950215Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T13:13:40.485342Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T13:17:18.568779Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.16786","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16786","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Lan- guage Models for Video Understanding","venue":null,"work_id":"33d1b923-1308-4ebd-bb03-617eeebb0c3c","year":2025},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2501.16786","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:e7ff1a68d50fd94791d6d142693888f6cf075564f2f0e48cd57de52db5abb254","observation_id":"1f9d51a0-8931-4a44-990f-d86b12465850","resolution":{"observed_at":"2026-05-19T13:17:18.571134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16786/citation-record","integrity":"/paper/2501.16786/integrity","json":"/paper/2501.16786/citation-record.json","paper":"/paper/2501.16786"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T10:48:17.758736Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.758736Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:1150e23382a21cb78084078d7d92d10f212d62c5da8393e50a2b68efe49a4310","observation_id":"75b632ad-046b-49b4-8fcd-17c3a05b0fbf","resolution":{"observed_at":"2026-08-10T10:48:17.758736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T10:48:17.776805Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.776805Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:086e38e26f0db38aa2f71cadb9583ec726c3255b4de64d6bec2d66027bd13912","observation_id":"73a91c07-9dad-4382-a05a-62699548d179","resolution":{"observed_at":"2026-08-10T10:48:17.776805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T10:48:17.792593Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio under- standing in video-llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.792593Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:d3333184d3019f8c63862ba698a8cbb643b3a88839a41807b28b7d37a5a05174","observation_id":"500db361-7377-474b-9f70-21366cad3cce","resolution":{"observed_at":"2026-08-10T10:48:17.792593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:48:17.798591Z","title":"E., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.798591Z"},"links":{"citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:1eeb1d2d8abccc774b7d98b09765f5e1a2d19607d966bddb682356bd92467d00","observation_id":"f2bd6e7a-17bb-4522-8487-680d3125d74d","resolution":{"observed_at":"2026-08-10T10:48:17.798591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-10T10:48:17.803897Z","title":"Internlm- xcomposer2: Mastering free-form text-image composi- tion and comprehension in vision-language large model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.803897Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:4b7114fe9eb0aa370e9c718bee8905f564b558ad555777b36161d19b0fc29ff5","observation_id":"290033b8-cb34-45a7-b3af-d47a703105ba","resolution":{"observed_at":"2026-08-10T10:48:17.803897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-10T10:48:17.809722Z","title":"S., Lynch, C., Chowdhery, A., Ichter, B., Wahid, A., Tompson, J., Vuong, Q., Yu, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.809722Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:3837ed87bdffcc4c77cd1a4566841399379ac0885853493818d53c3ebcf0fe95","observation_id":"f598d0c2-0a34-4639-9c67-ec2de9c01e16","resolution":{"observed_at":"2026-08-10T10:48:17.809722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-10T10:48:17.816075Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.816075Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:fdcfde7c6bc717241a247deab4d83e356b7de580def25ef6bde3058a503cf8a9","observation_id":"fae8d7b2-9d0d-43e9-b3e4-73f8e60ef4e0","resolution":{"observed_at":"2026-08-10T10:48:17.816075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04052","last_updated":"2023-04-08T15:44:29Z","snapshot_observed_at":"2026-08-10T11:58:13.376663Z","submitted_at":"2023-04-08T15:44:29Z","title":"Decoder-Only or Encoder-Decoder? Interpreting Language Model as a Regularized Encoder-Decoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04052","snapshot_observed_at":"2026-08-10T10:48:17.821361Z","title":"M.-C., Hu, S., Liu, Z., and Collier, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.821361Z"},"links":{"cited_paper":"/paper/2304.04052","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:be954d1de873e8615a7968949e2f130470e564ea5d16cc15eeccbb373b3760da","observation_id":"47d3c21a-0711-48a9-ba7d-54d3919f7cd2","resolution":{"observed_at":"2026-08-10T10:48:17.821361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T10:48:17.826834Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.826834Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:c8ae38661985c9c42a0728ad28883187024e363704691015d85d62e4bc2941b7","observation_id":"d90a5ac2-0c5c-4817-baa2-6507bebe835e","resolution":{"observed_at":"2026-08-10T10:48:17.826834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:48:17.832020Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.832020Z"},"links":{"citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:0efae61c401a83e8878821285d45f9f040c7ceb0dc37616991a17d63e9ec8c71","observation_id":"7538c262-4576-4bdc-8932-834bf4b6d100","resolution":{"observed_at":"2026-08-10T10:48:17.832020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-10T11:57:00.228306Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-10T10:48:17.852698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.852698Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:9f142cab3b8c26b4ec8ada05e2f20344ad7178a67cecf5dd8a0caddcaa0ce45c","observation_id":"ff23c886-4446-4908-a7b9-a8bf1dff7b4f","resolution":{"observed_at":"2026-08-10T10:48:17.852698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:48:18.622586Z","title":"Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., et al","venue":null,"work_id":"1e97a4cd-0186-4769-be8f-3c3a251b28a2","year":2024},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.868669Z"},"links":{"citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:59f401784aff3172fd0ebf89a32f8d5cd50686fad0e3d1855e9c90e4f5eb9f11","observation_id":"3a01c820-c8a5-43b0-a3be-fa9537e63bad","resolution":{"observed_at":"2026-08-10T10:48:18.628744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-10T10:48:17.877288Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.877288Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:68758adbce502969a21cee9d9ea1b4023617b9148a2eae920383654b1294ae35","observation_id":"e29ab880-dcb7-4151-805d-5fe5b1837272","resolution":{"observed_at":"2026-08-10T10:48:17.877288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T10:48:17.882899Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.882899Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:accef8ab699ff7f98eb5749e3a91696550737e7720ed2f8afabca03a8f3153fd","observation_id":"0a168a47-981a-4c8c-b045-3b6e3d651477","resolution":{"observed_at":"2026-08-10T10:48:17.882899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T10:48:17.888246Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.888246Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:121bdefbcdde4fe01c534a888803021ffc4617c54d18f97a9fcd12968860019a","observation_id":"ea803d1b-9603-41f8-960f-ee58bbba00e3","resolution":{"observed_at":"2026-08-10T10:48:17.888246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-10T10:48:17.895385Z","title":"Y ., Li, Z., Liu, Q., Liu, X., Ma, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.895385Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:234165f99347224e538bd8a83041050e321301247573c1c97085f3c8b30e38c6","observation_id":"145a6331-b68b-437c-8687-a1e0c029a285","resolution":{"observed_at":"2026-08-10T10:48:17.895385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T10:48:17.912512Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.912512Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:fb78d0e3153528027de129e54709557d31be0c721504f5b72e14f4a534da0895","observation_id":"ce7ce885-3b72-4e58-853e-092787676375","resolution":{"observed_at":"2026-08-10T10:48:17.912512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-10T10:48:17.918447Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.918447Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:5817e14dd446b6985fda579427f3e08f7f8c87c01a9808019d8f7f03a6537970","observation_id":"6916f56e-e1ed-48d5-a2c8-4beb7bebcedc","resolution":{"observed_at":"2026-08-10T10:48:17.918447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T10:48:17.923525Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understand- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.923525Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:de56de571ce73ba5010e14ee43ad9712466e9a28f3103743d255db2ea7a62bb6","observation_id":"43dccc6f-11bd-4bd9-8b36-83a012f1d99e","resolution":{"observed_at":"2026-08-10T10:48:17.923525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-10T10:48:17.929538Z","title":"Di- rect preference optimization of video large multimodal models from language model reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.929538Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:8e4833913af6994d3344aaa071e189a222bb8e39f60360774f8b4378c61f3b9f","observation_id":"33be5698-4a49-4642-8d2b-1211d59d4c0c","resolution":{"observed_at":"2026-08-10T10:48:17.929538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T10:48:17.936475Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.936475Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:d731dadea8558a08c330ce89a192caec412655b627922fd5846105ec0b16cacc","observation_id":"ec5a6765-7fa8-4da4-bca8-93e9a593e3ea","resolution":{"observed_at":"2026-08-10T10:48:17.936475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:48:18.596258Z","title":"LLaV A-OV-STE and LLaV A-Video-STE refer to LLaV A-OV-STE-3-(2:2) and LLaV A- Video-STE-3-(2:2), respectively.) A","venue":null,"work_id":"9ee1b338-7bcd-40f7-abb8-848828509f58","year":2019},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.942857Z"},"links":{"citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:dddb88f185c19bd478891e5f8ce467ed4ae49de4e5a961e507f65f68f281080f","observation_id":"1d3bcfc1-2645-4076-9670-406a32aaac5c","resolution":{"observed_at":"2026-08-10T10:48:18.608821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:48:18.573006Z","title":"LLaV A-Video-STE-1/2/3-(2:2) represents LLaV A-Video-STE using 1/2/3 layers of (2:2)","venue":null,"work_id":"0fd240b2-743a-45a3-b2fc-b5e32bb2e554","year":2023},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.950215Z"},"links":{"citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:ba9fdf09cba1d21a7f533091659bb96c163598ca8eb9a28de849be2d1e209e0b","observation_id":"4d1c987c-b698-48d1-b4b9-03cd5fbcb579","resolution":{"observed_at":"2026-08-10T10:48:18.582282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T10:48:17.837710Z","title":"Llava- onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.837710Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:0c4ff9389129d950f04ba2051a95ad74b104a5c071cae945571ca1d8bb6cc61c","observation_id":"aab48173-787c-4e01-acf6-46778c48d019","resolution":{"observed_at":"2026-08-10T10:48:17.837710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-10T10:48:17.902301Z","title":"K., and Feng, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.902301Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:2f19a9bcfc912d88f814a0d86c4f7753761d45406d56a8e3574c85210736fcce","observation_id":"1e007916-5c72-4fef-9a00-8bab48f022fa","resolution":{"observed_at":"2026-08-10T10:48:17.902301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13469","last_updated":"2025-01-11T10:20:26Z","snapshot_observed_at":"2026-08-10T14:37:48.378822Z","submitted_at":"2024-06-19T11:50:09Z","title":"Encoder vs Decoder: Comparative Analysis of Encoder and Decoder Language Models on Multilingual NLU Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13469","snapshot_observed_at":"2026-08-10T10:48:17.862854Z","title":"S., Enevoldsen, K., and Schneider-Kamp, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.862854Z"},"links":{"cited_paper":"/paper/2406.13469","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:f85aa5bac88a800757a3597d2b7db3e2bdcb153fb22e94e28824278933fb4d14","observation_id":"f975545c-17ed-491f-9460-32ab7b9b94f4","resolution":{"observed_at":"2026-08-10T10:48:17.862854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-10T10:48:17.784123Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.784123Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:9a2d2180c316e5bb6e561e4f2628a235d65c0795b4e521cde68b313aa39c5ffe","observation_id":"4dc51d34-64a4-4a73-a5f3-bd76d8e8c094","resolution":{"observed_at":"2026-08-10T10:48:17.784123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-09T11:58:18.895378Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-10T10:48:17.769194Z","title":"Accessed: 2024-12-18","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.769194Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:16de64dcf9488cb1183fea399d454869fd80b5f87035ed4525ac71dc047f80d8","observation_id":"8438e5c6-47a7-45db-a941-39bef0466c81","resolution":{"observed_at":"2026-08-10T10:48:17.769194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-10T10:48:17.846752Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.846752Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:8577600c2197bcc8341af89a1783b89c72fb03d3e57deb2ff729d6a2131b4c04","observation_id":"9ef87b41-155a-4009-a522-fa0e77db1a6c","resolution":{"observed_at":"2026-08-10T10:48:17.846752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2501.16786."}