{"as_of":"2026-08-19T16:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:249c63eb50370403ceb79451654873d8e2168a4077d6f6f56cc3269777af948e","coverage":[{"denominator":116,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:16:27.201212Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.405635Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:19:20.332342Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-08-16T11:46:40.405635Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.405635Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:1151a21e1901984f2915867fd20548d361eb248326a46fe40ba933ba0d1c6d34","observation_id":"79481876-9f37-4128-8e6c-513d58e8d9dd","resolution":{"observed_at":"2026-08-16T11:46:40.405635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":"2504.16030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-07-04T01:19:20.332342Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":"aac60863-9c01-4d6c-a903-1ac633d05c98","year":2025},"citing_paper":{"arxiv_id":"2511.21998","last_updated":"2026-04-12T05:29:07Z","snapshot_observed_at":"2026-08-17T19:35:26.177104Z","submitted_at":"2025-11-27T00:54:35Z","title":"Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T05:36:09.208754Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2511.21998"},"observation_digest":"sha256:69e7b1d4b0d99cca0514a9dff0719935f47f6833dec4645f357f7382025a4b4c","observation_id":"9b7594dc-5632-4def-816d-b98de7c8a0bd","resolution":{"observed_at":"2026-05-17T05:39:06.101648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":"2504.16030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-07-04T01:19:20.332342Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":"aac60863-9c01-4d6c-a903-1ac633d05c98","year":2025},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-08-12T14:20:57.728113Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:fe21965190306dc38d719daa0db2fa8a15ad028bb0dcb8eaefb30898a31cb934","observation_id":"cecdb1c9-4d81-4dd4-bb48-b83e4bef12d2","resolution":{"observed_at":"2026-05-10T07:42:06.765151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":"2504.16030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-07-04T01:19:20.332342Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":"aac60863-9c01-4d6c-a903-1ac633d05c98","year":2025},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-08-17T04:09:44.469533Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T13:36:44.071188Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:8d5d1bba198039c9e67004682e7c92756cba979698ba1951a788466157433122","observation_id":"dbba1ab8-add9-4c98-a3ef-7ee2c9dc6af4","resolution":{"observed_at":"2026-05-20T13:38:19.144883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":"2504.16030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-07-04T01:19:20.332342Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":"aac60863-9c01-4d6c-a903-1ac633d05c98","year":2025},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-08-17T04:09:44.469533Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-04T01:11:42.073993Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:0a3a9636a84464f1ff439f41cfe45d389abca3d4283794920f4813a77c461fb2","observation_id":"84dc0ba4-7c41-432b-8e86-6922425289cd","resolution":{"observed_at":"2026-07-04T01:19:20.334651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":"2504.16030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-07-04T01:19:20.332342Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":"aac60863-9c01-4d6c-a903-1ac633d05c98","year":2025},"citing_paper":{"arxiv_id":"2605.17921","last_updated":"2026-06-01T06:29:58Z","snapshot_observed_at":"2026-08-15T01:27:26.647958Z","submitted_at":"2026-05-18T06:29:44Z","title":"An Efficient Streaming Video Understanding Framework with Agentic Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-20T11:30:22.151045Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2605.17921"},"observation_digest":"sha256:51b566eb5e6a3e164b1f473873a87cbe22ad97d5cec9214a7920846fdde417b1","observation_id":"69338436-7dfc-4746-9633-f9fba57f9c20","resolution":{"observed_at":"2026-05-20T11:33:14.482051Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-07-31T06:20:13.899753Z","title":"Livecc: Learning video llm with streaming speech transcription at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-15T01:08:05.619745Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.899753Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:ab79a8aa426aca0006c65dd7370c4eaf55b1f4610898aeb1c7043d5849699b5f","observation_id":"aabb4aa2-8816-4064-8777-56c364f342e3","resolution":{"observed_at":"2026-07-31T06:20:13.899753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16030","snapshot_observed_at":"2026-08-14T04:39:27.447842Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08469","last_updated":"2026-08-09T04:22:57Z","snapshot_observed_at":"2026-08-19T07:19:28.705024Z","submitted_at":"2026-08-09T04:22:57Z","title":"Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-14T04:39:27.447842Z"},"links":{"cited_paper":"/paper/2504.16030","citing_paper":"/paper/2608.08469"},"observation_digest":"sha256:8ddb5cd68e0dc36476ef4e40f9b3046bdaa3303c9698240977265851039a4048","observation_id":"d29b28de-f054-48a9-8b66-5a1aa809c1e3","resolution":{"observed_at":"2026-08-14T04:39:27.447842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16030/citation-record","integrity":"/paper/2504.16030/integrity","json":"/paper/2504.16030/citation-record.json","paper":"/paper/2504.16030"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.761886Z","title":"Marks, Chiori Hori, Peter Anderson, Stefan Lee, and Devi Parikh","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.761886Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:8b8d451574e37c82edd9ea7b6c24a43e619d592fe2a2d934e6939f7563a8a9b9","observation_id":"fd0846cc-809a-4cf8-86c4-31118228f770","resolution":{"observed_at":"2026-08-16T11:16:26.761886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.767470Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sa- hand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Kar ´en Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.767470Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:836a036a0daa4689df7eae629f27d109013bc5561c9ec147efdc316ad270edb3","observation_id":"257cfb55-f212-4089-8193-d20bcafc34f9","resolution":{"observed_at":"2026-08-16T11:16:26.767470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T11:16:26.771846Z","title":"Dai, Anja Hauth, Katie Millican, David Silver, Slav Petrov, Melvin Johnson, Ioannis Antonoglou, Julian Schrittwieser, Amelia Glaese, Jilin Chen, Emily Pitler, Timothy P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.771846Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:020eceb4960ac9888d44c00ac04f2cbbdf25786fa8b963b2243f4a0f2a29c1e4","observation_id":"d60b12ad-da72-44e3-bca3-0a1283a0944c","resolution":{"observed_at":"2026-08-16T11:16:26.771846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-16T11:16:26.776536Z","title":"Qwen tech- nical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.776536Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:41b1654a090c018844f81075c8a9c89326029eb0b9fe273dab0ffcf9a2f9a52e","observation_id":"8503c045-d28f-44ce-b3cd-e1ffcd0e39a7","resolution":{"observed_at":"2026-08-16T11:16:26.776536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T11:16:26.780847Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.780847Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0c1799ae45e27d2668bb13e0fb56ab02dddda57d0ae25c40f116487877bc692a","observation_id":"b1b66b2b-b51d-4da7-bb04-aecaae912591","resolution":{"observed_at":"2026-08-16T11:16:26.780847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T11:16:26.785092Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.785092Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:36cc3ca302a2ca9c1f8f9c6b6976d5c8a70f9d0caa5b8933e449ec5c8efe58ce","observation_id":"a0e4853b-eebf-4d64-95ec-29d260a6bcd6","resolution":{"observed_at":"2026-08-16T11:16:26.785092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-16T15:51:36.830951Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-16T11:16:26.789286Z","title":"Whisperx: Time-accurate speech transcription of long-form audio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.789286Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:46168f8c279f2ca588b02d5c3eed89f756919e540fc975c19dd6172e982268fc","observation_id":"baa3eead-eedc-4049-887c-697ccd1d3d82","resolution":{"observed_at":"2026-08-16T11:16:26.789286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.794090Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.794090Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:17a755e5002476ad1bd3b3938fc39e1250b9b3b29aada00192ef05a6d3349caa","observation_id":"02f23cd0-dbda-4da0-bb09-6a7f53641bbf","resolution":{"observed_at":"2026-08-16T11:16:26.794090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.797881Z","title":"Sst: Single-stream tem- poral action proposals","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.797881Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:c643520a3abbba1bab886aa1c3eb5ae87eaa6319ea3c744a6fdc7c1a5d96d878","observation_id":"6a700740-b763-49ba-8d96-5002fc650141","resolution":{"observed_at":"2026-08-16T11:16:26.797881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.801885Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.801885Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:950f76bcf9d3a2317efabaa5edd897caceeabf9000b15a548f14362bc3364034","observation_id":"637d85f5-6c9b-4253-8e3b-9a2c22076285","resolution":{"observed_at":"2026-08-16T11:16:26.801885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.805640Z","title":"A short note about kinetics-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.805640Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:3cc8e4cbb6d05d60e06a979797ed8f2350d1c4f2f622c0b1799e10f92a572955","observation_id":"39a73a2a-f219-42cc-af70-7f311920b156","resolution":{"observed_at":"2026-08-16T11:16:26.805640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-16T11:16:26.814227Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.814227Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b384cbb57130087611717b01bfc691d0e35776ef25228a56da79ce6114e04d18","observation_id":"b3906aa8-2eb9-49e1-bea1-c5fa40ad6293","resolution":{"observed_at":"2026-08-16T11:16:26.814227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.818806Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.818806Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b2abd01e25a4f5297e1e46791d5ea60c9b1e61a6d001143ddef5e7a2c06cb036","observation_id":"17c4cc69-e049-4d5c-b875-416653183106","resolution":{"observed_at":"2026-08-16T11:16:26.818806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T11:16:26.823292Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.823292Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:89c021933f2561572264357d3058977885fcf54b4d5819adb3923c6eeb00c469","observation_id":"e9cba1c9-195a-4afb-93b7-0eb6c5e9d4c7","resolution":{"observed_at":"2026-08-16T11:16:26.823292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.828107Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.828107Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:80a264f5a2ee01b0ba857146fe73d2b143b7128ab22b15f0d5aa06e9fa92d101","observation_id":"77644c62-c134-4fe2-9834-7ab34e3a176e","resolution":{"observed_at":"2026-08-16T11:16:26.828107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T11:16:26.832033Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.832033Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:512fed88e76b63354654ea71492f160f5d7fc20aea4dc5582ee55c58dbc11949","observation_id":"0b99d661-5a1b-4200-8165-41a5236dbc2c","resolution":{"observed_at":"2026-08-16T11:16:26.832033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-16T11:16:26.836191Z","title":"How far are we to gpt-4v? clos- ing the gap to commercial multimodal models with open- source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.836191Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:67e791bfed13649593a1f91a7ebafe2fff7e21f97814fb47b4a48624b85ab40e","observation_id":"850fc669-e29b-47e6-8e96-0bc22d9a53d1","resolution":{"observed_at":"2026-08-16T11:16:26.836191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-16T11:16:26.840455Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.840455Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:035f2ce18e8138e80946b46573a13afdf8f9117c1b9651ad0d27c28691c18165","observation_id":"28bba35b-989d-44c4-8fc6-7864199704c3","resolution":{"observed_at":"2026-08-16T11:16:26.840455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.844728Z","title":"Unsupervised cross-lingual representation learning at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.844728Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:6bf1961cadff09aa03f1db7b8c931f8cdcc0fb329f91a709db7a07e2138f7cf5","observation_id":"6e651ea4-e587-453e-a528-de11543ad32b","resolution":{"observed_at":"2026-08-16T11:16:26.844728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-16T11:16:26.849493Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.849493Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ab880a9fe1fe19d296f9b93e5df609c888e071acc2f1d19d1ddfbce8c572d507","observation_id":"c70153ca-b921-4f37-9612-fafd25b58018","resolution":{"observed_at":"2026-08-16T11:16:26.849493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.853854Z","title":"An im- age is worth 16x16 words: Transformers for image recog- nition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.853854Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:e3cc2f244dd4ce80f106d5e185d6ce882d6585938c8c463a7639d6e5b0983f78","observation_id":"d8233268-17be-4faa-9c2d-eec836006a46","resolution":{"observed_at":"2026-08-16T11:16:26.853854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:16:26.858399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.858399Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:394903db5f07554a66004c04ef798dfb04bf3d92ecdc8bc73c92a46852a86d24","observation_id":"cfad65e2-bc85-4f24-a418-c4c601ef3d18","resolution":{"observed_at":"2026-08-16T11:16:26.858399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T11:16:26.862576Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.862576Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:9a8a07e7520f9ea5904ea1bb98ba0d15513c366b71884e63215dbe59783d513c","observation_id":"8476e595-0b83-4c5e-8269-2ad8f2e8c03d","resolution":{"observed_at":"2026-08-16T11:16:26.862576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-16T13:27:24.086813Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-16T11:16:26.866575Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.866575Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:850b6d7561ad8d998f43c53c033350e9d63da064818e47e58e04c3f3820f9863","observation_id":"8dc06081-1aae-4958-b77a-dcdb6a00ab8e","resolution":{"observed_at":"2026-08-16T11:16:26.866575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-16T11:16:26.870990Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.870990Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:2f3876abe7dbc8f4c16e997ab8ae7b8ac997033c0dad9468bfbd2f38ac612b81","observation_id":"9e2eda36-8332-4475-9a88-c8091db910b1","resolution":{"observed_at":"2026-08-16T11:16:26.870990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.875352Z","title":"Online action detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.875352Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:f7a2a94efb6f987370d0029917e3d6fa008a1b0c6a93d61db94c88cd17b1c052","observation_id":"4d46e76a-8a11-4884-a8e2-d70247e88d0e","resolution":{"observed_at":"2026-08-16T11:16:26.875352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T11:16:26.880005Z","title":"Gemini 1.5: Unlocking multi- modal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.880005Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:c3cf10963bfb09158d64944bda60fadf635474990f954d93c6f64a1e23247e27","observation_id":"f0bd417b-6f8d-4d82-9668-a01a5d2d271d","resolution":{"observed_at":"2026-08-16T11:16:26.880005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.884157Z","title":"The ”something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.884157Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:72a717cf4c6113a8ddb2c18bfe8e1f97d3ab507d5a09e9aa1b5af89ac892a41b","observation_id":"345faeed-0bb8-4911-a8ff-dbf4bde53adc","resolution":{"observed_at":"2026-08-16T11:16:26.884157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.888082Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.888082Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ad77f8c341f1fcf0ba86e0d52de5eab18a8cb17316d5c508446370558a566ece","observation_id":"3a1aec64-51eb-4c9b-994c-805a2a69db50","resolution":{"observed_at":"2026-08-16T11:16:26.888082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.891983Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.891983Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:05520a1c590ee5ae131f406dec9285fb436085544c28c6c0f84957330147624a","observation_id":"9f364702-6318-4367-9f49-f75d0c5cc226","resolution":{"observed_at":"2026-08-16T11:16:26.891983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-16T11:16:26.895809Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.895809Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b55add55c7b17383ef9b2cddeecab23f8dce17f70c0be72ddb4a0d4323a7609e","observation_id":"1bbc3a83-cd54-4a0b-b16c-5a1c2b391f4c","resolution":{"observed_at":"2026-08-16T11:16:26.895809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.899907Z","title":"Multimodal pretraining for dense video cap- tioning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.899907Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:2eaabd2b5e5a60a20ca3dfa0c3c6e6138506a2132ba767a82e012daeffca86c3","observation_id":"8a0aa7b7-c973-4720-877a-f412a50cbdda","resolution":{"observed_at":"2026-08-16T11:16:26.899907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-15T21:07:19.601850Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00584","snapshot_observed_at":"2026-08-16T11:16:26.904234Z","title":"Online video understanding: A com- prehensive benchmark and memory-augmented method","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.904234Z"},"links":{"cited_paper":"/paper/2501.00584","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0398c0434f8fc4198c10bfe2266a07208fada821d54a10a25aa55d4e8445d149","observation_id":"428d89ef-547a-4ba3-825f-4f4f83c794ea","resolution":{"observed_at":"2026-08-16T11:16:26.904234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.908553Z","title":"Zamir, Yu-Gang Jiang, Alex Gor- ban, Ivan Laptev, Rahul Sukthankar, and Mubarak Shah","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.908553Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:8baba247c892cfd0dd03b906a4cb6a55a051f033320b9ad6ddb0801c9a96fdc2","observation_id":"f4f299d2-6ecc-4193-a4bc-91bf59650387","resolution":{"observed_at":"2026-08-16T11:16:26.908553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.912817Z","title":"Cag-qil: Context-aware actionness grouping via q imitation learning for online temporal action localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.912817Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b94ce907c9df94a3c93b419665e31d0ea2800db8ccb98f5ad68c6117f36b0deb","observation_id":"f4cdbe42-2727-42c3-aeb5-d2d4787d36cb","resolution":{"observed_at":"2026-08-16T11:16:26.912817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:16:26.916707Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.916707Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:8f59eca94590a1125a67a87bb55d2fa9f1e96dc2f546ec44f8f7ed455661a74c","observation_id":"641431e4-bdf7-480c-8305-e6399750a792","resolution":{"observed_at":"2026-08-16T11:16:26.916707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.920757Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.920757Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:72184d5dbdc619d1a012324c099611b2914e080ecfa8ad3fe69b476190a87856","observation_id":"6c304600-fece-4dc5-8a03-72e345afe0c0","resolution":{"observed_at":"2026-08-16T11:16:26.920757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-16T11:16:26.925639Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.925639Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:afbabe5fa71d176d8a397c05582a3e01a796300ccd883fc752cbbc35ddb0d519","observation_id":"deb05087-b1eb-4e89-ab60-1d6b2374109c","resolution":{"observed_at":"2026-08-16T11:16:26.925639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.930291Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.930291Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:d4bfcbffbb7b38993957833a0accef3cd88c435daec0d2df3a4a3e017ac2b789","observation_id":"db32a862-f260-4ab9-b921-d6165fa57ce0","resolution":{"observed_at":"2026-08-16T11:16:26.930291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-16T11:16:26.934804Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.934804Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:60ae7e6a1a1c4fd08cf567b8731e32dd4f6c8367ba08601878f6609095db1048","observation_id":"c787d8c2-8e6b-480a-8cd7-3178a0f78d2c","resolution":{"observed_at":"2026-08-16T11:16:26.934804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T11:16:26.944573Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.944573Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:479718b11bf6c3af5408aaec1b6ce12771e7c1691dbdff8affd834aa44313acb","observation_id":"95f7775e-a62a-46b2-80ac-5fe3d9b007aa","resolution":{"observed_at":"2026-08-16T11:16:26.944573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-16T11:16:26.949183Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.949183Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:abfc401c9c0df8b2817e187a64c1d5574599dd5db85fc8ca035fb2b12ed032d9","observation_id":"0306f9d0-0158-41f2-ba01-58846d135246","resolution":{"observed_at":"2026-08-16T11:16:26.949183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T11:16:26.953754Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.953754Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:56011a9233bda7221216fbc79b45f233931d777058767c9f36ed5265d60a57cc","observation_id":"9e8c2cc3-be2d-4146-ab18-8a688712a39a","resolution":{"observed_at":"2026-08-16T11:16:26.953754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.957684Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.957684Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:e6017f72b4de689f874405bfdd9170ac904b38366d9d226b9a1fe804130ba513","observation_id":"87110916-75ce-4f5b-a40e-85b5ea15f5c7","resolution":{"observed_at":"2026-08-16T11:16:26.957684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-08-16T12:59:25.994981Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-08-16T11:16:26.961719Z","title":"Ovo-bench: How far is your video-llms from real-world online video understand- ing? arXiv:2501.05510, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.961719Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ff2518397f3f3551158de350bf18723ce4400a74de80fadf357c77be51ab9175","observation_id":"73670dad-9bbd-4051-b0bb-0b5e114ad508","resolution":{"observed_at":"2026-08-16T11:16:26.961719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.966886Z","title":"A light weight model for active speaker detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.966886Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:22495d8a7aafac6918b20596ee62c40ddf1bd53305543ce5252a5c6081d4fca3","observation_id":"20e60bc7-4ae4-4d0f-b46d-9410274097ba","resolution":{"observed_at":"2026-08-16T11:16:26.966886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-16T11:16:26.970697Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.970697Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ec4d6134bcfdae06d8cd17615a33cf33c766fb262406f0ed51367df9e41ac004","observation_id":"19ad1bae-9999-4bdc-8a78-abe754dffd57","resolution":{"observed_at":"2026-08-16T11:16:26.970697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-08-16T13:02:34.563787Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-16T11:16:26.974973Z","title":"Streaming- bench: Assessing the gap for mllms to achieve stream- ing video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.974973Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b0a9bc7cd40f4a92468ec01a7e743a2f75f1c9d289ff6c43efb82d7f0b12bbbb","observation_id":"b345a33e-efb2-405e-b171-865a7a5412c5","resolution":{"observed_at":"2026-08-16T11:16:26.974973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.979524Z","title":"VILA: on pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.979524Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:c36aedfa4efa86f7df5e770b4e7fd094a773ebbd7c500f41b39a2fc176bb0ad4","observation_id":"dd5d5368-5f9d-4747-8bf3-7eb8169b8a2e","resolution":{"observed_at":"2026-08-16T11:16:26.979524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01670","last_updated":"2022-10-13T03:31:05Z","snapshot_observed_at":"2026-08-16T16:55:28.178235Z","submitted_at":"2022-06-03T16:28:58Z","title":"Egocentric Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01670","snapshot_observed_at":"2026-08-16T11:16:26.983262Z","title":"Egocentric video-language pretrain- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.983262Z"},"links":{"cited_paper":"/paper/2206.01670","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ff0741067831a37a19f6ab1f2a0d49936b5d5e629da941662f335582e8d2a707","observation_id":"53da6c4a-db92-437f-bbd4-4015c36bba8d","resolution":{"observed_at":"2026-08-16T11:16:26.983262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.987297Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.987297Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:904b1a7501b771bbcdd9f9fef4568c92590135d82c168c37a65985b16499d20a","observation_id":"da39fea7-c1e7-411a-8328-376f24a542ef","resolution":{"observed_at":"2026-08-16T11:16:26.987297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-16T11:16:26.991162Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.991162Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:50106e80a253c350ed5ef29795ed95ea04d2fc9605470819718c3d16e18b1db1","observation_id":"d2736919-88c5-4959-81bd-1faebf7becef","resolution":{"observed_at":"2026-08-16T11:16:26.991162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:26.995196Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.995196Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0456d4efa0bb6845d13ebc46591899b031671d345e6aac1ccc6ce89de14c5a03","observation_id":"4bbcf587-60c7-4ea5-b55a-a7d3ee96cf44","resolution":{"observed_at":"2026-08-16T11:16:26.995196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08646","last_updated":"2025-03-30T05:25:58Z","snapshot_observed_at":"2026-08-16T13:00:14.848164Z","submitted_at":"2024-12-11T18:59:54Z","title":"StreamChat: Chatting with Streaming Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08646","snapshot_observed_at":"2026-08-16T11:16:26.998921Z","title":"Al- varez","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.998921Z"},"links":{"cited_paper":"/paper/2412.08646","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:e089661562ae76fc73c62310fc20db6a3b855ea5ffb1aca6b5b667959d083593","observation_id":"5a39f103-01bb-4617-8264-92f69a929d96","resolution":{"observed_at":"2026-08-16T11:16:26.998921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-16T11:16:27.002786Z","title":"Oryx mllm: On-demand spatial- temporal understanding at arbitrary resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.002786Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:07c8603a4f9e2660ac47b50aef942a616df6eb926171e900a4815b2d66c2deb3","observation_id":"e984bf2f-6b36-497b-a987-99e4c1bbab05","resolution":{"observed_at":"2026-08-16T11:16:27.002786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.007316Z","title":"Video-ChatGPT: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.007316Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b663ca9b4bf9ad19a48868dd2c091e933882d292d1e3606d3994bcebf0378a5d","observation_id":"a19029ba-75b2-4a8a-bac7-c146adf0e1f4","resolution":{"observed_at":"2026-08-16T11:16:27.007316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.011424Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.011424Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b97a7137ed40f9be691d7934e4378b2d0b6828b009abc08c07510b29b17a97ca","observation_id":"e081aa2a-6b19-4c75-a395-b26121927e2f","resolution":{"observed_at":"2026-08-16T11:16:27.011424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-16T11:16:27.015320Z","title":"Mm1: Meth- ods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.015320Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ab1f9ed6b8f8f20ffa95ff2b2cfbdd0c2af9621055910b60f6d8d8f3331f4b73","observation_id":"704b455b-9793-4287-9fb4-01d6fda1d00e","resolution":{"observed_at":"2026-08-16T11:16:27.015320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.020223Z","title":"Howto100m: Learning a text-video embedding by watch- ing hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.020223Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:109299c19b52aa741d4bcb95ce824ff0fbc37e060ba0d982a574e3cc15e62bbf","observation_id":"0ab3ac74-9a11-427f-b50a-af80fb355c76","resolution":{"observed_at":"2026-08-16T11:16:27.020223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.024877Z","title":"Soccernet-caption: Dense video captioning for soccer broadcasts commentaries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.024877Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0097182cdf64528f00094b50ae586a656353e1413be1e90adc4f1bdc8e642817","observation_id":"fb594618-7bd0-4f8e-8580-f6e324dad4b3","resolution":{"observed_at":"2026-08-16T11:16:27.024877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.029317Z","title":"Introducing chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.029317Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:497afa1fce92bbeeb8246cd4c3bb6b29bf0aacef26bc25c40241b640962510a0","observation_id":"d01ed2e3-3edd-48e3-a019-af951c800f96","resolution":{"observed_at":"2026-08-16T11:16:27.029317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:16:27.034669Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.034669Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:635d0bdedf275fb6bb1ec554421d8f17d5b27b214ed424e22928bf35cc5ce4cc","observation_id":"e4341a45-59f6-4dbb-bb11-777f7b1e4312","resolution":{"observed_at":"2026-08-16T11:16:27.034669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.039213Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.039213Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:a9e60033e8b35a13b25761a4761a05289837b8d8e24b30645c2e7fb04c7b771d","observation_id":"9d084c85-cd3f-4b17-a10c-f6facc010116","resolution":{"observed_at":"2026-08-16T11:16:27.039213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.043228Z","title":"Py- torch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.043228Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:6bc9e4ada6db81e1bc10db5d961b8319006aadef4927beec1bb6cf457d74e9e6","observation_id":"33c8a06b-c802-4e9b-93ba-cb1eb361dffb","resolution":{"observed_at":"2026-08-16T11:16:27.043228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.047488Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.047488Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:ea001a8069330afbd91937d6323a731074cbd0cca14b835cfd794ee6d9d2e303","observation_id":"e8a3bf00-bb5e-4d79-b235-3401fa466da5","resolution":{"observed_at":"2026-08-16T11:16:27.047488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.052049Z","title":"Streaming long video understanding with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.052049Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0a54c0e2e94d7064a2e7f00fd30787b03774709e0e16f1ffc68178fc2889e7c1","observation_id":"c5e902d5-a7ab-415d-bdf6-4ba3878abb42","resolution":{"observed_at":"2026-08-16T11:16:27.052049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03218","last_updated":"2025-01-06T18:55:10Z","snapshot_observed_at":"2026-08-16T12:59:35.733260Z","submitted_at":"2025-01-06T18:55:10Z","title":"Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03218","snapshot_observed_at":"2026-08-16T11:16:27.056202Z","title":"Dispider: Enabling video llms with active real-time inter- action via disentangled perception, decision, and reaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.056202Z"},"links":{"cited_paper":"/paper/2501.03218","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:7c1fcc966daab3bd0b6ba8fbf6c8cc89a73af30d9a82c9edbfa93155b1b2036e","observation_id":"ca7c4f55-dbfc-4924-a060-cae46446bc3d","resolution":{"observed_at":"2026-08-16T11:16:27.056202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.060284Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.060284Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:46994286f6eee91c1c80c0e130fd6122a81859c73d15fbab6f903ae15f0a8f1b","observation_id":"aa23ca37-cace-4089-b2af-98460344288a","resolution":{"observed_at":"2026-08-16T11:16:27.060284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.067380Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.067380Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:5709f9f8a2ad70f15a3c79408afb531f242259b9d97e93871c0897f6a96ecaff","observation_id":"ef305958-3548-40f9-a71c-2293c9743234","resolution":{"observed_at":"2026-08-16T11:16:27.067380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:27.071808Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.071808Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:bfb2a8b500bf8272d53bae8023781da0220dac1193290e8924a83eddc466a2d6","observation_id":"4b4012d9-27a3-45ec-8565-100beaa417eb","resolution":{"observed_at":"2026-08-16T11:16:27.071808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.688478Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"6c1c4ea5-f2a8-48a6-8268-9e6032981d67","year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.075969Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:c43a03d4ea04ce5e60d78555a4d6782110314a1a0402815679dec520ab6bdc25","observation_id":"28fbe0e7-2d3f-49b1-893d-06b3fa2deaf2","resolution":{"observed_at":"2026-08-16T11:16:28.693273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18530","last_updated":"2024-11-18T04:45:19Z","snapshot_observed_at":"2026-08-16T13:39:20.390167Z","submitted_at":"2024-06-26T17:57:25Z","title":"MatchTime: Towards Automatic Soccer Game Commentary Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18530","snapshot_observed_at":"2026-08-16T11:16:27.080241Z","title":"Matchtime: Towards automatic soccer game commentary generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.080241Z"},"links":{"cited_paper":"/paper/2406.18530","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:59cdd61da63e4bcce26ceda71fa3af40acab4b49a9eec2502d44596cda98879a","observation_id":"056449bd-b9ad-4b29-881a-b2fc58207442","resolution":{"observed_at":"2026-08-16T11:16:27.080241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.673346Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"0383c170-514d-469f-888c-fef1b35ce834","year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.085140Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b7a1285d47a0c49a2283a8a0f0e71bd11c8e7780dc2a72b3cdc055ff9228df71","observation_id":"379b02c1-19be-44e4-acd5-8c204cd94060","resolution":{"observed_at":"2026-08-16T11:16:28.678959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-16T11:16:27.089055Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.089055Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:83857efd40d808ec2a44874052c6d16c2b92119dae8f407adb71543a1ab46da6","observation_id":"d5e1b67b-44c2-4022-a2ae-042f7f86450f","resolution":{"observed_at":"2026-08-16T11:16:27.089055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.654508Z","title":"Online real-time multiple spa- tiotemporal action localisation and prediction","venue":null,"work_id":"79a059ae-0ee3-45a3-b919-9722cf71b726","year":2017},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.092797Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:3aafc8e26a0665b9f36fb0f8fab0c0f647d23a5dbff9dd9794051719f9f658b6","observation_id":"f55b5798-3b4b-4500-9a7d-8198f6e820ac","resolution":{"observed_at":"2026-08-16T11:16:28.659905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-17T16:14:50.126982Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-16T11:16:27.097192Z","title":"Moviechat: From dense token to sparse memory for long video understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.097192Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:e20c751e14654a600d1ffa69f47960d2b7e3ddd0f3953fdf864ed14f62869590","observation_id":"daeffac6-c7c7-4239-8447-2dca8966603c","resolution":{"observed_at":"2026-08-16T11:16:27.097192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:16:27.101689Z","title":"Llama: Open and efficient foundation language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.101689Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:268abaaf92c102fcacfc889ef5d83dfa9606c6e91577e91d5687107a10f77604","observation_id":"8689b0fc-8e52-4dcb-9195-5afd5fff4288","resolution":{"observed_at":"2026-08-16T11:16:27.101689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:16:27.106533Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.106533Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:21f20ba1b009461ee0549dca223e92599f134c756ed1fe1c74c8e1af63554634","observation_id":"61a5b472-9a3a-481e-8ed3-550f9bbd6367","resolution":{"observed_at":"2026-08-16T11:16:27.106533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T11:16:27.111394Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.111394Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:a6219fed4856314e54fc8823ef0718ca3d167bd960b94bc8a0bae1ece8517afc","observation_id":"f63131da-0943-4629-b683-176fe23c49e8","resolution":{"observed_at":"2026-08-16T11:16:27.111394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-16T11:16:27.115890Z","title":"Internvid: A large-scale video- text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.115890Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0dc9cec54d549790dae63caeed9c55bfafd3208f76db3d5cf64d70b99d962077","observation_id":"e83e75d0-0d1c-48b8-a29a-e92780fc3161","resolution":{"observed_at":"2026-08-16T11:16:27.115890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.639419Z","title":"Videollm knows when to speak: Enhancing time-sensitive video comprehension with video-text duet interaction for- mat, 2024","venue":null,"work_id":"64b387d9-d357-4a7b-bb60-5df88dd54f24","year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.120862Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:f3769f722e753875abd9373d24a23d8514d2a6e17f0ef650f201a20e85edbbb0","observation_id":"d7d822a3-1677-41ea-a25e-dce7d9195ba0","resolution":{"observed_at":"2026-08-16T11:16:28.644173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-08-18T22:16:48.287474Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-16T11:16:27.125134Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.125134Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:7c9da4ce72e1e751619764e800f4a98ec98cbc1eb14a3c1bb441d06d2f938314","observation_id":"eb4a92e9-fd24-4b10-af18-29c4ca55e21c","resolution":{"observed_at":"2026-08-16T11:16:27.125134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.625307Z","title":null,"venue":null,"work_id":"f57180ac-c492-4dc6-a0b3-48cb4204f989","year":2020},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.129671Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:1592bc0966882a8a96c8c7dae75002baf1efd74d87f924d92d62aa99a57ad05a","observation_id":"0a23ce1f-3f8c-438d-b923-afd5063047f8","resolution":{"observed_at":"2026-08-16T11:16:28.629649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.611401Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"4b23db85-835a-4243-b7a8-275983e337fd","year":2021},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.133486Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:fdf36ac001c7c7e44287dd68876b9bf1afb800d1b60ad25c43e4fa6ce3fdba9e","observation_id":"c1d9e19d-5e9a-4611-bc4c-8983f837b543","resolution":{"observed_at":"2026-08-16T11:16:28.615771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.597669Z","title":"Streaming video understanding and multi-round interaction with memory- enhanced knowledge","venue":null,"work_id":"3084878d-f3df-41e1-94ff-358d7b51235c","year":2025},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.138131Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:e2cd99c91a4ac82125af36f2c8f7f2b307a28a515282db444e2e215137ccdb3d","observation_id":"459444c9-7720-4835-9eb8-e9c9effc9025","resolution":{"observed_at":"2026-08-16T11:16:28.601678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-16T11:16:27.142050Z","title":"Qwen2.5-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.142050Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:a4902caf4a46273aded89891e5c9428975e5cc6fccb17ec1ed54492b2aea8cce","observation_id":"0fe113c2-9cf0-4d41-be15-037a91c09db0","resolution":{"observed_at":"2026-08-16T11:16:27.142050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.581545Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"ffc2099f-f493-4ef2-8c8f-765dca37edce","year":2022},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.146546Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:395766b7a64b34297496acdb5d8ac75df661a1948d5804d59706952460e4e096","observation_id":"07193edd-8de9-4dfa-a029-9731f769c61e","resolution":{"observed_at":"2026-08-16T11:16:28.586709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.565373Z","title":"Vidchapters-7m: Video chapters at scale","venue":null,"work_id":"9ca316c0-4b3d-41ba-a1c4-d263023e4588","year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.150371Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:6e59d082195b0b7a36ffebbdaf2f76ab1176a46c9ff4b2f6bc9d086639eb5b7c","observation_id":"c0803101-3fc9-4742-970c-411378aad026","resolution":{"observed_at":"2026-08-16T11:16:28.570350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.549943Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"2ad75463-eeba-4d7a-89a0-25ca9d33c0ec","year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.154457Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0a4d437d9d57a9813ebc175fa69b7a9080ffad853346d2d460503aaa9d0fc0eb","observation_id":"6f5dd80e-7e9d-4929-9b80-b19945ea7bc1","resolution":{"observed_at":"2026-08-16T11:16:28.555068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T11:16:27.158788Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.158788Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:db5d545e4a836ea6e456d04791f2ec6164e269ce6a03652916718d71f891a1fd","observation_id":"65debb99-407b-4073-adb0-cb6930d30c85","resolution":{"observed_at":"2026-08-16T11:16:27.158788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-16T11:16:27.163742Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.163742Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:6bf3d91f696261b2bcb42f2e8cd4022770c8d84dde1303b5778546b0699ab24f","observation_id":"4bc2f568-8612-4aa5-8c20-724dcd182927","resolution":{"observed_at":"2026-08-16T11:16:27.163742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14327","last_updated":"2023-11-29T07:52:18Z","snapshot_observed_at":"2026-08-16T14:57:46.269785Z","submitted_at":"2023-09-25T17:53:29Z","title":"DeepSpeed-VisualChat: Multi-Round Multi-Image Interleave Chat via Multi-Modal Causal Attention","version":3},"cited_work":{"arxiv_id":"2309.14327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.14327","snapshot_observed_at":"2026-08-16T11:16:27.543645Z","title":"DeepSpeed-VisualChat: Multi-Round Multi-Image Interleave Chat via Multi-Modal Causal Attention","venue":"cs.CV","work_id":"42af9411-d1c0-477c-8bad-64fc301eaccd","year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.168143Z"},"links":{"cited_paper":"/paper/2309.14327","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:8a3dadfdb7f4c66c9aa3d8a130d38ce345224d49002436c9d43891222bb6730f","observation_id":"3f81d77e-263a-45a8-8b99-488b5add7216","resolution":{"observed_at":"2026-08-16T11:16:27.554006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-16T11:16:27.172576Z","title":"mplug-owl3: Towards long image-sequence understand- ing in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.172576Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:0a421a2b1913ebf60badb4087f3db2b276911ba9ef4e8aa87087f8f3a0751c07","observation_id":"8b02ac2e-064a-4ef4-85b6-b71b2296a5c9","resolution":{"observed_at":"2026-08-16T11:16:27.172576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-16T11:16:27.176811Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.176811Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:3cf2708818348a0dae67c066111fd7811db60d27e31464715d8e4df3c6027bc5","observation_id":"fcc8537d-1432-4ac2-81a4-50ab1f6b6782","resolution":{"observed_at":"2026-08-16T11:16:27.176811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.535590Z","title":"MERLOT RESERVE: neural script knowledge through vision and language and sound","venue":null,"work_id":"c67b6635-fcc4-49ff-bc6d-d43f42392148","year":2022},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.181405Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:7fe811bdf66743f1441d5237a006f80fd1b4e87eafeba0986a63a96493beaa56","observation_id":"699fbecb-687c-4872-acaf-50204469c765","resolution":{"observed_at":"2026-08-16T11:16:28.540022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:16:28.521115Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"1a83d7fd-8952-4be9-b158-19dd192b9cca","year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.185356Z"},"links":{"citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:c22b2a0eaccd383ac5bb3b8b830f8cfbb9dcf0b59c62d8073bbd7faea9391bdf","observation_id":"6305bd7d-de47-49d2-af13-1964a3e9a72c","resolution":{"observed_at":"2026-08-16T11:16:28.525984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-16T11:16:27.189191Z","title":"Videollama 3: Frontier multimodal foundation models for image and video under- standing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.189191Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:288d1ba2d27aaa88ba8421e77a050100952e682c9b3640b8512c60ab10f2b2af","observation_id":"514febb0-d8a4-4197-9b0f-93e6126e6316","resolution":{"observed_at":"2026-08-16T11:16:27.189191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T11:16:27.193114Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.193114Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:b9cc4a6f7c9006ff72d1d2a71b4ca689db69d7a12c79434f8298ced6598d03f6","observation_id":"8283c1e8-3d87-4f24-b9c2-f5773644ae1b","resolution":{"observed_at":"2026-08-16T11:16:27.193114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-16T13:43:48.910620Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-16T11:16:27.196961Z","title":"Flash-vstream: Memory- based real-time understanding for long video streams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.196961Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:61f2c3fb999edcc8f1b3dd586cc941b36a7107724b690eccaffee7fcb65398c2","observation_id":"bdfee9e1-d589-47d1-82de-7faa174aa7ae","resolution":{"observed_at":"2026-08-16T11:16:27.196961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-16T11:16:27.201212Z","title":"Lmms-eval: Reality check on the evaluation of large multi- modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:27.201212Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:61db5734c7abc3807e57b27c75e0a228c5c0143d3b372bfa8c393da368fe495c","observation_id":"babcce6b-24f5-4b23-9bfc-00867f7882e0","resolution":{"observed_at":"2026-08-16T11:16:27.201212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":116},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 116 outbound references and 8 inbound Pith citation observations for arXiv:2504.16030."}