{"as_of":"2026-08-13T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46f11ee821a2d1fff52833394fecf08505321782bfde18ef9215472e3451c9d1","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:18:18.203170Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:39:26.597389Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15513","snapshot_observed_at":"2026-08-02T04:39:26.597389Z","title":"arXiv:2501.15513 [cs.CV] https://arxiv.org/abs/2501.15513","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16322","last_updated":"2026-07-15T09:37:58Z","snapshot_observed_at":"2026-08-09T21:37:18.308785Z","submitted_at":"2026-07-15T09:37:58Z","title":"GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:26.597389Z"},"links":{"cited_paper":"/paper/2501.15513","citing_paper":"/paper/2607.16322"},"observation_digest":"sha256:7e4f7a90a318ca53e314d4341a9e61649c06a274e35755fc8fe4a997e02e3bd7","observation_id":"ca6bb9bc-a892-4943-a3f2-fc70019a7e86","resolution":{"observed_at":"2026-08-02T04:39:26.597389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15513/citation-record","integrity":"/paper/2501.15513/integrity","json":"/paper/2501.15513/citation-record.json","paper":"/paper/2501.15513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.356749Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.356749Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:7bd2eb2f6b050585751464d12bd01bf073e90b0fcb6ffd645d437c4be24ccd1b","observation_id":"0594859a-02ad-4274-b5cb-675f791c02be","resolution":{"observed_at":"2026-08-10T14:18:17.356749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-13T00:37:45.501808Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-10T14:18:17.386325Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens.arXiv preprint arXiv:2404.03413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.386325Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:91e5f7c7a2b57640f6b1e1b5b1f8f2f614b19e3c2c3c50b9cd654c96b6bfcb4c","observation_id":"8b723536-4ad9-4cf2-a9a7-dd830a5299c9","resolution":{"observed_at":"2026-08-10T14:18:17.386325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T14:18:17.411410Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.411410Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e858278b2cf39b58448db066c8419669e57fd922efe5ed50f14d10822710d760","observation_id":"b8072065-f2ca-4289-aeef-d172b1250d6f","resolution":{"observed_at":"2026-08-10T14:18:17.411410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.788115Z","title":"On attention redundancy: A comprehensive study","venue":null,"work_id":"d68aaa99-3434-4386-9b25-76eeb850e0a2","year":2021},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.446172Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:41e030d197256d56e7333a2738c1328a1cc9c5c62cfb6c653a5e1aeef59883cf","observation_id":"da7685aa-0d17-435c-8389-f3141c41ff2a","resolution":{"observed_at":"2026-08-10T14:18:18.819859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-12T23:48:30.486852Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T14:18:17.464986Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.464986Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:17f23c471d392f2a285996e45c12336d8035ecd91a22f524a2f92de9f5b0304c","observation_id":"d0610ac8-318e-447b-a2a3-8986869d718d","resolution":{"observed_at":"2026-08-10T14:18:17.464986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T14:18:17.488069Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.488069Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:bab3a8d2a2573554c8551440648daf792f38a343aaff7ee260e5676b84f05376","observation_id":"5fde84b7-b003-4cf6-8e4e-75596a287cc8","resolution":{"observed_at":"2026-08-10T14:18:17.488069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-10T14:18:17.511758Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.511758Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:95fc58cb3496fad4062f7ae9b3e2ac792eb75413685307cf4d7c5c6ec83a0315","observation_id":"c371f93b-dd3b-4003-8e41-3bdd221f361a","resolution":{"observed_at":"2026-08-10T14:18:17.511758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-13T04:16:46.302787Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-10T14:18:17.531656Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.531656Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:bdd9010cb06e35d28292093cf2ad843d398f141ebcde695ac93c0bbb07c3ee86","observation_id":"94764db4-f09f-4834-9d11-812e5a47907d","resolution":{"observed_at":"2026-08-10T14:18:17.531656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.549431Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.549431Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:705c03711e1b5dd94ea175c6f4b1a5e834f48ed2ea1d14a4c0dbff9dbd05cf57","observation_id":"1228130b-8da1-477f-8bf7-98b9e7adb483","resolution":{"observed_at":"2026-08-10T14:18:17.549431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-10T14:18:17.558446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.558446Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e86cc2a6862ab74f792e8a553d738e404ac221ce892f0804c9518efa8aa06099","observation_id":"2ea93c03-052e-44e2-a882-852655171b02","resolution":{"observed_at":"2026-08-10T14:18:17.558446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.678862Z","title":"Phi-2: The surprising power of small language models.Microsoft Research Blog, 1(3):3, 2023","venue":null,"work_id":"4e72b243-70bb-4884-b867-b8ea10c09107","year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.570633Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:6c5c03e239e9f726f35f2104b9539f5be7e9ed667ece97193bf9a9fcb43ab4e0","observation_id":"ee1e81e6-e1d9-427f-89f6-59ac41686970","resolution":{"observed_at":"2026-08-10T14:18:18.727706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.580777Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.580777Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:18ce03f4bb74ab3629abe43d2b9e5b2ec905f068a1b0f6234bf89f4abec92df8","observation_id":"e7f2384a-558d-4916-b860-04b6f227d507","resolution":{"observed_at":"2026-08-10T14:18:17.580777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-10T14:18:17.592863Z","title":"Otter: A multi-modal model with in-context instruction tuning.arXiv preprint arXiv:2305.03726, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.592863Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:2e72384ea5bf8d87a6e2176176b16cc0fb06c96b2d4211d32f7b0f756ddd6baf","observation_id":"5035d900-4a80-48fe-97fb-804f35289731","resolution":{"observed_at":"2026-08-10T14:18:17.592863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-10T14:18:17.605226Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.605226Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:c858d4749d70e18171bfaea420da23e4610d202e4b40f98e34b359cf236ee21b","observation_id":"39898d34-2355-4ed0-82d8-51ca383af8ed","resolution":{"observed_at":"2026-08-10T14:18:17.605226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.618502Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.618502Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:300ce6787455fdebadcb53bc6694af7fc8a40bac044c4390f6a4d5a50487eaf9","observation_id":"07ab9965-e9d8-471e-94ff-916d0f37064c","resolution":{"observed_at":"2026-08-10T14:18:17.618502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.599770Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"a8c27736-f0f9-4262-8f87-6275ad9de3ae","year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.645852Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:5c516d8371bb1eb371a63c5ca062792d2b6c815b09e539f9cadb83026397c57a","observation_id":"584475cf-7c6c-47b5-9226-14e34cbec53e","resolution":{"observed_at":"2026-08-10T14:18:18.618280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T14:18:17.694223Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.694223Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e40aa15fddc3f1702cf0d57acba1f1e075d136fd63aec306c5dcb0ffcc9f985b","observation_id":"6334ebe2-a2e4-40c8-a56f-ac9683e0c18d","resolution":{"observed_at":"2026-08-10T14:18:17.694223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-10T14:18:17.735844Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.735844Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:39efffbdd5bd004bad333eaa6b87456b10ecd6a409f689c385e8d6aa0b8cface","observation_id":"d0a71bda-cba0-4041-965d-e16e645a9f62","resolution":{"observed_at":"2026-08-10T14:18:17.735844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.787631Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.787631Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:4144deee29066c4c45a9cd111cd2ba88a668a616a92c5beb9aeff88709e2bf8b","observation_id":"ee1fd6ce-9700-4652-9bbc-78cbd819c634","resolution":{"observed_at":"2026-08-10T14:18:17.787631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.816391Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.816391Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:9746e8519bf6d322c88efc67118e48703bb4480f4c88acb74af961ff706eea57","observation_id":"87cf6f5f-bda8-418f-8086-cc2bfa6f68b9","resolution":{"observed_at":"2026-08-10T14:18:17.816391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.576943Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":"f990b2b3-7efe-4b0c-bc16-1f653ba2dcd3","year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.845024Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:64856dce3807cf6eba3d8ca5ff322b0815817c42021a5c926b7674364111625b","observation_id":"72a5ebb0-6080-4aa6-8c4f-b2863db0fc86","resolution":{"observed_at":"2026-08-10T14:18:18.580148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-13T11:18:51.693524Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-10T14:18:17.857839Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.857839Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:ca4d629d9dd31eca565a1436ee149c3521260ea37bf5b7cfd5ad7c0c7ddd5c91","observation_id":"38287e0a-7220-4daf-9cbd-e6fcfdf0004d","resolution":{"observed_at":"2026-08-10T14:18:17.857839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-10T14:18:17.898432Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.898432Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:a24312139f5296b3855e24d12d458184d4b7ea2c922be8a6c7bec48b44353e95","observation_id":"1ee46f66-a036-46a2-be2b-a8e42416aa54","resolution":{"observed_at":"2026-08-10T14:18:17.898432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T14:18:17.916023Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.916023Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:a0a6b84336575a2bb237d0ba8234215100cdaad9024c907883afd3fab8f25b93","observation_id":"c07d4a9d-4c35-428a-866d-5cca2a9b9ade","resolution":{"observed_at":"2026-08-10T14:18:17.916023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.929562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.929562Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:894db9f5019abd36859a9bba4fa63cc94a2dbc67a7e0d80a72817bd16baedfed","observation_id":"94812177-582d-490a-9e94-0bbc74402419","resolution":{"observed_at":"2026-08-10T14:18:17.929562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.934235Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.934235Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:4b50f9b782722bd70f295ae06433e5a30427a0dd51bc1220ade2b07b3ac9f675","observation_id":"294d4da3-d181-4240-89ef-097f885f3295","resolution":{"observed_at":"2026-08-10T14:18:17.934235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T14:18:17.947719Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.947719Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:89a7556f1f27a21ff724b6fd32c9963e5dfbd390a0b946b799a5f0fe77ae2203","observation_id":"722f96a5-9ef2-4191-b2a7-581d452959de","resolution":{"observed_at":"2026-08-10T14:18:17.947719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-10T14:18:17.964511Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.964511Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:8719711c1a65dbca5bc35d82e8abc56ecde5283c8c08b25c0c2e389e37ade73e","observation_id":"d49048db-9381-46d5-b43a-c05e9d6b6cf5","resolution":{"observed_at":"2026-08-10T14:18:17.964511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-10T14:18:17.977599Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning.arXiv preprint arXiv:2404.16994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.977599Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:722b9d8f509aa6f28f586fad6219ae5279e1eeb08fc0ff223116fdbd1b504d72","observation_id":"a0a81bc9-a7e6-4d8f-9d69-ee685f2fb426","resolution":{"observed_at":"2026-08-10T14:18:17.977599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.553434Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"43434fe9-4dd2-42ef-9590-562ad87f3056","year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.988770Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:0f0bb81afcf9fe055597162609edecdae7a84aae9ee49323109d3f78add915dc","observation_id":"aa8b79b0-698f-4177-b0f7-7f4bc1b232d7","resolution":{"observed_at":"2026-08-10T14:18:18.557231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.992793Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.992793Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:359aa5ba2f65f41bdf230bf129e35b6720e05287ec2788388acb50b442691f32","observation_id":"35d0e1c7-193d-47c4-8c84-d15690c79cfa","resolution":{"observed_at":"2026-08-10T14:18:17.992793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.998128Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.998128Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:b00eae019967e1be0fc7e4f754819929f7333762f58d1c77ef8c43953c834714","observation_id":"a8d7feb4-d9bf-4e6f-bcd9-228401fa8cf8","resolution":{"observed_at":"2026-08-10T14:18:17.998128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T14:18:18.004242Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.004242Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:60c163b916d2a69f841f343c8844d1a6b914fb6687e6fc2b2dd5fa67a981badb","observation_id":"4b280291-3a34-49c4-b416-3ed501db93fa","resolution":{"observed_at":"2026-08-10T14:18:18.004242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T14:18:18.008511Z","title":"Tinyllama: An open-source small language model.arXiv preprint arXiv:2401.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.008511Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:c4dcdd2c2036bca93d8d25b2a84eca930f1f7fa1409db632d31d5c5787a6ee06","observation_id":"8ef89105-5643-4fc6-b894-96a13c1bc000","resolution":{"observed_at":"2026-08-10T14:18:18.008511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-11T01:31:42.961611Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-10T14:18:18.012399Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.012399Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:f64c3f3df843d350ee0d931e896b0cbb219b7b43c1718d1fe08ed7048095690a","observation_id":"86aeb704-3adc-4170-afc5-5eac48021193","resolution":{"observed_at":"2026-08-10T14:18:18.012399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T14:18:18.042072Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models.arXiv preprint arXiv:2406.08487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.042072Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:4af10a4ef53c2fe38aa523b4cef3139456a06804c6b4d4cb89271d94fe192ee1","observation_id":"fe5d7b0f-5675-4012-8c79-da07e7ebffe9","resolution":{"observed_at":"2026-08-10T14:18:18.042072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-10T14:18:18.086229Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.086229Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:9d5d63475da199de5845bf286840de42db76e4a5988931cf085c34811fa99cc6","observation_id":"7ce12156-d8cc-4ea6-ba88-ee60aab2a8c3","resolution":{"observed_at":"2026-08-10T14:18:18.086229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-10T14:18:18.139242Z","title":"Tinyllava: A framework of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.139242Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:db482da999ed09e886c8042b511cc6acd9f9ceec867c0dfc1d3ce37f0e30f162","observation_id":"ede505cb-e091-4b28-a534-6a91bffb337e","resolution":{"observed_at":"2026-08-10T14:18:18.139242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-10T14:18:18.168610Z","title":"Attri\",","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.168610Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:a8a98cbe141e61c97f735205c175681a3362dd5a8ed0ab2ca3648b8f0fcb6311","observation_id":"4eba6fca-bc13-46c2-9fb9-6984553edddb","resolution":{"observed_at":"2026-08-10T14:18:18.168610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.525250Z","title":"The best results are indicated byboldface","venue":null,"work_id":"297a0e81-d3c8-4234-94a5-44fe15bb4ff1","year":null},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.203170Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:5868fb00d31d87674d8ccfe57009b337ba6439e43d567ca06b95cfd50780c57a","observation_id":"2216e17b-a605-4ba7-9dc2-b2692de0cbf6","resolution":{"observed_at":"2026-08-10T14:18:18.533114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:47:20.442523Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2501.15513."}