{"as_of":"2026-08-12T05:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df490753788c74cc1a3bb99209c6c25cb537782915a674a4855c80c863769ff7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:35:24.362275Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:29.898625Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:8e6ba1ff197ee94031fd890bafa83fae2ea06402b3aafdfb4925e5d7b15c9561","observation_id":"05397695-4940-4979-8b87-c9bb464a2e02","resolution":{"observed_at":"2026-05-10T23:20:33.156675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:9b895a0467d1bbbb1bb0b7be9e3bada7bcbb6871ce6d658da07b67f532c3c115","observation_id":"38b01930-0c6e-4c15-8049-3efbe895413d","resolution":{"observed_at":"2026-05-16T13:53:33.711388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T22:35:24.362275Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-11T22:29:21.460148Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.362275Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:caf7d4117f89833e9cdb1c8de6086e715238125694a7cb9ce5e61a5b6d04c657","observation_id":"0a008773-a7cf-4d40-8821-176c5e918590","resolution":{"observed_at":"2026-08-11T22:35:24.362275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:aec0dd7846efffe45418f255dede51d67616f9050661c128b8b10194faa9e48a","observation_id":"1574aa84-21a1-442e-9207-b8afb5df4826","resolution":{"observed_at":"2026-05-23T07:42:43.161469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T20:54:16.543027Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-12T00:30:38.189874Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T20:54:16.543027Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.05185"},"observation_digest":"sha256:5af6c8362866e7e3a9d789f0e92154e3797241968061079a81675d0eb544f771","observation_id":"47d7345f-2cd6-49c2-ae8a-22677989dc35","resolution":{"observed_at":"2026-08-11T20:54:16.543027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T17:02:17.010894Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09530","last_updated":"2024-12-12T18:20:41Z","snapshot_observed_at":"2026-08-11T16:55:20.288600Z","submitted_at":"2024-12-12T18:20:41Z","title":"Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:17.010894Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.09530"},"observation_digest":"sha256:800779a17882be44d284a58768cecfbb434584c8631633b3b2043cf6cb470001","observation_id":"87d0de7b-e66a-447e-bf0d-8fa8f8cb0c7b","resolution":{"observed_at":"2026-08-11T17:02:17.010894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T16:11:10.710115Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-11T17:37:01.087489Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T16:11:10.710115Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.10360"},"observation_digest":"sha256:7ad6daba35f1c5b7f585629f671cf2da32f00a7ea6bddabecb5d6595ee504f29","observation_id":"ebe804c1-4aeb-4ef2-81e3-a8dc5116d457","resolution":{"observed_at":"2026-08-11T16:11:10.710115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T13:44:50.577987Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-11T17:45:15.774121Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.577987Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:3cb255b1907e5aea7908395a256e4a58355db3336d5fdce1b02f0efa45c7a796","observation_id":"2645119b-22bc-472e-8c14-06d5518652da","resolution":{"observed_at":"2026-08-11T13:44:50.577987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-10T22:27:56.445639Z","title":"Slowfast-llava: A strong training-free baseline for video large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01645","last_updated":"2025-05-13T06:38:44Z","snapshot_observed_at":"2026-08-10T23:44:47.423609Z","submitted_at":"2025-01-03T05:32:37Z","title":"HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:56.445639Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2501.01645"},"observation_digest":"sha256:dc4d12be2cce3b8fa4a9f7ec22a33dd63b56fff26f52b15ed0fb56fd2f22a929","observation_id":"5252730d-c4ac-44a8-9b52-b2d50ffadf6b","resolution":{"observed_at":"2026-08-10T22:27:56.445639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-10T23:09:25.126995Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-08-10T23:44:53.833723Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:09:25.126995Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2501.01986"},"observation_digest":"sha256:a9bf20ab00c90dde421d27ecb15bac75f17a70628f990867faad6246b1fff116","observation_id":"8cdbed8d-6423-4f4c-9c10-2ec71ced3420","resolution":{"observed_at":"2026-08-10T23:09:25.126995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:82733dde88d3e4827a637732e6a3ae5b78b30c4cf747703a25d6d411b77974a2","observation_id":"d84ca329-0445-4314-8988-8bf20ebd8055","resolution":{"observed_at":"2026-05-11T01:20:00.062242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:ce7f5c362f3b419c075d6f274cd53aa2ddccf8ac445bc7e2438c4c30b3b2a5ac","observation_id":"8e6a65e6-3602-4ea7-b3d4-6eab3cc07ab7","resolution":{"observed_at":"2026-05-17T05:53:26.197276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T15:41:09.214825Z","title":"SlowFast-LLaV A: A strong training-free baseline for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14321","last_updated":"2025-05-20T13:07:55Z","snapshot_observed_at":"2026-08-07T23:44:06.171904Z","submitted_at":"2025-05-20T13:07:55Z","title":"Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:09.214825Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.14321"},"observation_digest":"sha256:84b4a6c56cd5001a8d5ef2d3d0161a0b44d8e1b2b407b44288595fa6e9a697bd","observation_id":"7a46c902-f8b5-4033-88b7-c49360ce7c9a","resolution":{"observed_at":"2026-08-07T15:41:09.214825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T15:34:55.852874Z","title":"Slowfast-llava: A strong training-free baseline for video large language models.arXiv:2407.15841, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-07T20:35:28.075030Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.852874Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:882fa5551ad4b85e02c7e0fa1780ce624145de4667f56b5b1063942dead4f8db","observation_id":"0121dee9-6d54-4503-89a9-2066e849809e","resolution":{"observed_at":"2026-08-07T15:34:55.852874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-10T22:50:24.267781Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T14:26:59.015559Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.15269"},"observation_digest":"sha256:6cbdbf25797b370f2ed3ecea658bf979ba8f7420bb0e668e863ffb417e51ab6f","observation_id":"91fb4939-f0b4-4ccc-a4c0-9fc639f510d9","resolution":{"observed_at":"2026-05-22T14:31:40.800513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T15:20:47.549466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-12T03:45:23.360415Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.549466Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ca8d7cc6beedd1cda120fe00d3dee0c24cc5c74f910b4e8388a5f1a1b066f0a6","observation_id":"0a170583-a703-4bcf-9e43-4138824d1160","resolution":{"observed_at":"2026-08-07T15:20:47.549466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T12:37:23.032653Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-10T08:26:14.415807Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:23.032653Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:b692821d9fc896f7a4893c9aacc90bb1419dff344b9f6d43f12f0b1510935986","observation_id":"cba55f33-db7f-408d-99fa-78317f5baaca","resolution":{"observed_at":"2026-08-07T12:37:23.032653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T11:55:28.590775Z","title":"Xu Mingze","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01119","last_updated":"2025-06-01T18:53:27Z","snapshot_observed_at":"2026-08-07T11:48:15.825538Z","submitted_at":"2025-06-01T18:53:27Z","title":"MOOSE: Pay Attention to Temporal Dynamics for Video Understanding via Optical Flows","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:28.590775Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2506.01119"},"observation_digest":"sha256:ea8f37a0da9a8b47f6c8fe1429e941cc3378a9b1cc66ec39e08d099569eb0f14","observation_id":"2ca677bd-85df-4f23-bf31-c6e4b77df4bb","resolution":{"observed_at":"2026-08-07T11:55:28.590775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-06T22:37:39.555689Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:39.555689Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:6dd62eae535012e259bc0cd48778b437bcfb198c802ea2f5f9c419fa6bf441c2","observation_id":"489e65a4-c689-416e-a146-ba4a2a8813dd","resolution":{"observed_at":"2026-08-06T22:37:39.555689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-06T21:55:47.885592Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23102","last_updated":"2026-07-06T06:04:13Z","snapshot_observed_at":"2026-08-08T21:05:19.837782Z","submitted_at":"2025-06-29T06:08:55Z","title":"Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:55:47.885592Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2506.23102"},"observation_digest":"sha256:df69ff06d77fba6f7877243412763a8cc47b8999c6ca4b1dbfd9055efb4f58a9","observation_id":"9ec28918-801c-48e3-a1b7-284e41643535","resolution":{"observed_at":"2026-08-06T21:55:47.885592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-06T22:00:07.796070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00068","last_updated":"2025-06-28T12:12:06Z","snapshot_observed_at":"2026-08-09T10:41:05.778908Z","submitted_at":"2025-06-28T12:12:06Z","title":"MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:00:07.796070Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2507.00068"},"observation_digest":"sha256:c9800ce550f6b6815cd419ba8698c1b20d2902d187386687ddd7cbd34c3e0036","observation_id":"52342c69-8d84-47d4-908e-36077b7c5952","resolution":{"observed_at":"2026-08-06T22:00:07.796070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-06T14:36:29.673490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.673490Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:3a1d5a1a3f76c78610516007456ffbb7ece9a77b4e10f1f3dd30a8c195dba748","observation_id":"53ec807f-a90b-4c6d-a069-f22338da95a8","resolution":{"observed_at":"2026-08-06T14:36:29.673490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-05T10:58:18.397448Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-07T14:11:47.550063Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:18.397448Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:fa40f296386126f54c84539bee7328f93d19f787b11dcd9535c72586eba20d1f","observation_id":"e49916f7-c529-4d14-8a85-dbf10b8ef374","resolution":{"observed_at":"2026-08-05T10:58:18.397448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2509.08016","last_updated":"2026-04-09T01:22:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-09T00:55:04Z","title":"Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T18:35:01.328250Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2509.08016"},"observation_digest":"sha256:433a052e9a5c1e306eb98368163713bfa72314340b5eca2a25146c1ede8cca12","observation_id":"13d067ec-0901-4417-ae9a-7df704bc5cd6","resolution":{"observed_at":"2026-05-18T18:36:44.160046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2511.18373","last_updated":"2026-04-11T05:44:20Z","snapshot_observed_at":"2026-08-11T05:10:55.239779Z","submitted_at":"2025-11-23T09:43:44Z","title":"MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T05:55:11.495430Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2511.18373"},"observation_digest":"sha256:09d1e741eda13d395b720e13456f7e6e2752e76a7879b3609cdb798644edd35c","observation_id":"b41929b7-75f7-4fcb-b25d-25142ef52b0c","resolution":{"observed_at":"2026-05-17T05:59:08.712440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:6bcd21d2050fb197cb904ff7dabfeeefa2e340679cf5d3b570655566ff979dd4","observation_id":"e54c71a7-b589-40e4-8698-aa6b8ab7bf57","resolution":{"observed_at":"2026-05-16T04:21:29.783947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-03T07:02:08.774478Z","title":"E” and “I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.21444","last_updated":"2026-06-01T05:52:56Z","snapshot_observed_at":"2026-08-09T23:13:15.744935Z","submitted_at":"2026-01-29T09:23:13Z","title":"APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T07:02:08.774478Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2601.21444"},"observation_digest":"sha256:dfa791d89f86ff98f2bc55bcf0cb09185ea3ada813b9149f80b9e4abb7b2b9cb","observation_id":"e40e8b56-6ef9-4885-8737-9f6dc53236f1","resolution":{"observed_at":"2026-08-03T07:02:08.774478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-11T02:30:31.429201Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T19:11:52.694778Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:25fc4c35b9a98cd8d2a11d109a2a9815e657f20a4ffab0f9c8862a0c924c5124","observation_id":"4016aeb4-078b-482d-bb10-a143f7678108","resolution":{"observed_at":"2026-05-15T19:16:31.733752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-02T20:38:44.615002Z","title":"Slowfast-llava: A strong training-free base- line for video large language models.arXiv preprint arXiv:2407.15841, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-11T02:30:31.429201Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T20:38:44.615002Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:3bf2ce80da5a6286b14722d6b4016ec024a3a81cab8e74290988b3bd1d13c7df","observation_id":"835a5c98-cc5b-483f-a37e-9daf7baccd97","resolution":{"observed_at":"2026-08-02T20:38:44.615002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-08-11T17:29:29.888451Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:6ea62fd70443118fb2136b5abdfcf48b5fa298d4490357d4f8d9c3f12611debc","observation_id":"5962e419-38d9-4350-b3ba-319120e1c9f6","resolution":{"observed_at":"2026-05-10T13:30:26.516769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2604.19564","last_updated":"2026-04-22T03:52:37Z","snapshot_observed_at":"2026-08-11T17:03:21.591027Z","submitted_at":"2026-04-21T15:15:02Z","title":"EgoSelf: From Memory to Personalized Egocentric Assistant","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:21.119521Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2604.19564"},"observation_digest":"sha256:279c5c8d5a2f672719832099172af92e0c99c76a184ad9c2562b5321568ed6f6","observation_id":"746f123b-cbf3-4c36-b8e7-f66d6fec7f4b","resolution":{"observed_at":"2026-05-11T13:06:03.801398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-08-05T23:06:05.311364Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:64c5424cd25a2227c0fd2690386bcc6350b720dbe9b03b61cb2709aace1fdd57","observation_id":"8ed0375a-ec45-4b75-ba15-d609e1622694","resolution":{"observed_at":"2026-05-11T16:36:07.887239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2605.28229","last_updated":"2026-05-27T09:43:06Z","snapshot_observed_at":"2026-08-05T02:10:57.115222Z","submitted_at":"2026-05-27T09:43:06Z","title":"VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T13:01:42.880738Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2605.28229"},"observation_digest":"sha256:005bc0530bb3f240c7ad8f492e214db5db098b3782d0d440568a8750b9a5f1ec","observation_id":"1e76134c-26d1-44d4-bacd-125336067b52","resolution":{"observed_at":"2026-06-29T13:03:25.914694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2605.31598","last_updated":"2026-05-29T17:59:02Z","snapshot_observed_at":"2026-08-07T05:09:45.280725Z","submitted_at":"2026-05-29T17:59:02Z","title":"Linear Scaling Video VLMs for Long Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T23:00:11.246232Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2605.31598"},"observation_digest":"sha256:c61663388ec18e327bac3dd9ed52d5250c3efbbe8ddaa3f9f5f4a08f55e70982","observation_id":"265f85fd-529f-44cc-b304-b4fccd0d919c","resolution":{"observed_at":"2026-06-28T23:02:46.236920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2606.00508","last_updated":"2026-05-30T03:54:44Z","snapshot_observed_at":"2026-07-06T23:41:10.825760Z","submitted_at":"2026-05-30T03:54:44Z","title":"V-LynX: Token Interface Alignment for Video+X LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T19:00:18.702121Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2606.00508"},"observation_digest":"sha256:260b6a0252090858212d95711bd4870a5c20569e0ef2b9da6d9723149ef3d2b0","observation_id":"e6c52ccc-1d76-4dfb-a9aa-00019a82e63c","resolution":{"observed_at":"2026-06-28T19:02:34.161789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2606.05917","last_updated":"2026-06-04T09:23:31Z","snapshot_observed_at":"2026-08-04T03:04:58.385559Z","submitted_at":"2026-06-04T09:23:31Z","title":"MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T01:52:33.768494Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2606.05917"},"observation_digest":"sha256:9d7b789bfc7857a377f1258bbc8b2fa5cee9f8ea0684cc7703c1166511590a28","observation_id":"d43f3e47-6db7-4ff9-a3f3-42971a4175bf","resolution":{"observed_at":"2026-07-02T12:46:56.883859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2606.12125","last_updated":"2026-06-10T14:19:15Z","snapshot_observed_at":"2026-08-11T10:27:53.575075Z","submitted_at":"2026-06-10T14:19:15Z","title":"Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T10:04:29.739632Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2606.12125"},"observation_digest":"sha256:8045c1797d2a9eb5cc6cfe1ec408845fdeaba8a7ebb4f4d3f2a313193ae2ef1e","observation_id":"e9a935e4-350f-4f6a-90ff-8778fee50540","resolution":{"observed_at":"2026-07-03T10:27:56.050250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-06T15:40:32.013079Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:0c18638996df8b05feb25da6c2499d326c5c2550837d138dbb89dadf17850f04","observation_id":"cf97c963-6366-4263-830e-b9b627f77316","resolution":{"observed_at":"2026-07-04T03:19:29.901021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-01T22:38:42.003198Z","title":"arXiv preprint arXiv:2407.15841 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.003198Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:936def1e32ee01d854543eb5c8e7632039b224cd89675702e28b6ee41ac279c5","observation_id":"16129752-a127-47ff-a819-6c64e0f6fe8d","resolution":{"observed_at":"2026-08-01T22:38:42.003198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-01T18:11:03.486399Z","title":"Slowfast-llava: A strong training-free baseline for video large language models.arXiv preprint arXiv:2407.15841, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17386","last_updated":"2026-07-19T19:07:19Z","snapshot_observed_at":"2026-08-09T17:28:55.542980Z","submitted_at":"2026-07-19T19:07:19Z","title":"SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T18:11:03.486399Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2607.17386"},"observation_digest":"sha256:9f6b04bc619789f59957973fef93f945c14a07d07b435a53b15a2f3884ee271d","observation_id":"9ce06e3c-e938-4b4b-ab75-acf4c575595c","resolution":{"observed_at":"2026-08-01T18:11:03.486399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-31T06:20:13.737936Z","title":"SlowFast-LLaVA: A strong training-free baseline for video large language models.arXiv preprint arXiv:2407.15841, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-10T20:15:55.135228Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.737936Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:4989d58fac98658b6155c92a735106098dd8310a85d7c30a20854bda94a56fe1","observation_id":"e7103d0d-f290-430d-9da5-604b896cb835","resolution":{"observed_at":"2026-07-31T06:20:13.737936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.15841/citation-record","integrity":"/paper/2407.15841/integrity","json":"/paper/2407.15841/citation-record.json","paper":"/paper/2407.15841"},"outbound":[],"paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:43:54.740334Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2407.15841."}