{"as_of":"2026-08-19T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:829ae2baed7bb0d2f3eaa7d50c6973471b418f9637539af3e0bb8bca03b6e911","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":89,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:19:36.459440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.677235Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:7215124aa708b1c2e431655fa286dab2efdd4dc1c4de3cc6d0f5fa1054cac8d6","observation_id":"69acf894-d236-4b03-910a-a38fbbe25c9d","resolution":{"observed_at":"2026-05-14T19:55:26.521910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:8b261b88ed18f2148f9f315be130c3747e9c2f0e15a17b5907bd50c74f1a1709","observation_id":"9c1b1b1a-f9be-4f69-9ab9-2203b31acd9e","resolution":{"observed_at":"2026-05-17T10:46:28.714646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:26b79ed4539ed9cafd94a7138484ba2b7acc093586dde0b67611159193906d16","observation_id":"13c3cee9-ad9c-4bf5-9fc0-a5837391ad38","resolution":{"observed_at":"2026-05-10T14:23:49.613523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":203,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:d15a3bc3da03f6cb31c58527944ba16771799ef3ea369091e36b5df0c70311e1","observation_id":"74c89a1a-f1f0-4b83-971d-a272a19e5b5d","resolution":{"observed_at":"2026-05-20T06:20:36.347366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:44809d19f1b4139aecb20768a0b33c2d495393fed558f1b429d6cce64610193a","observation_id":"37de3bd8-d552-455b-8ae0-d85ac3b9b3dd","resolution":{"observed_at":"2026-05-17T03:51:25.468836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:5964a60d121a9ec3e45647d41250fa875da5536d4f837ee2a7af2d5da9c64d55","observation_id":"adafa0e3-6f81-4449-ad51-6dc21c67c500","resolution":{"observed_at":"2026-05-16T20:10:27.726864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:8bc5b1d772901ffa208a036fc2f85af3e37340dc64974a038860df5b5b2297b4","observation_id":"39825b21-8a01-4bc2-bf4e-a2fbf81ed070","resolution":{"observed_at":"2026-05-10T23:20:32.495104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T12:12:14.613620Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2410.17247"},"observation_digest":"sha256:a4632a354eb707fd093f9bf115b52cfba52882dd4407cbca5149dfb3322cfa70","observation_id":"b2e0239e-d167-4485-84a0-1d2e663f2c9b","resolution":{"observed_at":"2026-05-15T12:12:14.756329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T20:34:16.148369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09577","last_updated":"2024-11-17T20:04:46Z","snapshot_observed_at":"2026-08-17T19:15:33.400101Z","submitted_at":"2024-11-14T16:35:17Z","title":"SimTube: Generating Simulated Video Comments through Multimodal AI and User Personas","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:34:16.148369Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.09577"},"observation_digest":"sha256:2a39c82144935cba2efc21e92b3390adb774e4885da21a9e2623b04904a795cf","observation_id":"eb74b757-d340-4bc8-96d8-8ae242490ded","resolution":{"observed_at":"2026-08-12T20:34:16.148369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T16:42:55.681332Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13281","last_updated":"2025-03-23T11:01:22Z","snapshot_observed_at":"2026-08-17T13:00:25.898260Z","submitted_at":"2024-11-20T12:48:34Z","title":"VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:42:55.681332Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.13281"},"observation_digest":"sha256:7903c6040855fe2ecb27e8c952d1a27d9ed9ac01929e485264a31dbdd2862455","observation_id":"81927198-2aef-4d3b-ba16-d860bcfcb006","resolution":{"observed_at":"2026-08-12T16:42:55.681332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T14:56:52.507092Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-14T11:20:48.477344Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:56:52.507092Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.14794"},"observation_digest":"sha256:495c1cb942c39e5228074bd0c6b65e9fd528a19b069be307487db4174a8e7409","observation_id":"411d20e4-f21d-4d13-a7f7-a189a9d5d80d","resolution":{"observed_at":"2026-08-12T14:56:52.507092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T13:34:39.353218Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:39.353218Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.16156"},"observation_digest":"sha256:1672823c34dbd438f0d7bfb28d9cdf7661f932c886c9f5a80e8cea155f9d7459","observation_id":"d2ae6eec-bd68-44f2-ba7a-00b1f27df4a0","resolution":{"observed_at":"2026-08-12T13:34:39.353218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T13:31:04.016872Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.016872Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:95ea697747ec389bdb6624f71126c004c17d02992897265d8442c8d00924f70d","observation_id":"d115cd80-01c9-43a4-be4d-04a3b491d210","resolution":{"observed_at":"2026-08-12T13:31:04.016872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T12:47:21.195627Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16932","last_updated":"2024-11-25T21:01:11Z","snapshot_observed_at":"2026-08-19T02:52:55.334016Z","submitted_at":"2024-11-25T21:01:11Z","title":"Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:47:21.195627Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.16932"},"observation_digest":"sha256:a060782cf5ae81fc73ab27a52a95d98ba4131a03932c7ef003d248bfc5ba9e24","observation_id":"ac0f485a-7c69-4684-b804-b43b6a35248c","resolution":{"observed_at":"2026-08-12T12:47:21.195627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T10:18:48.819643Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.819643Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:53366e4870573528f3745d7e3e7d95b8993d473e4af90f78805f2807027998d0","observation_id":"130a81ae-75d5-47e6-afa2-7b1689c72968","resolution":{"observed_at":"2026-08-12T10:18:48.819643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T05:53:34.377247Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19772","last_updated":"2025-03-20T11:55:30Z","snapshot_observed_at":"2026-08-16T12:00:09.003403Z","submitted_at":"2024-11-29T15:18:06Z","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:53:34.377247Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.19772"},"observation_digest":"sha256:53e90e183ac439a1ad11f1cc764ffdb376bd365b6d2fbaf0207037b465e8f9e5","observation_id":"c023be49-699a-45cb-a054-d045b7b2efcf","resolution":{"observed_at":"2026-08-12T05:53:34.377247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T04:56:01.190716Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00927","last_updated":"2024-12-01T18:27:28Z","snapshot_observed_at":"2026-08-18T22:21:12.062480Z","submitted_at":"2024-12-01T18:27:28Z","title":"VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal Augmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:56:01.190716Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.00927"},"observation_digest":"sha256:41b5b2e2ffd7b63ff10c3f7071c1d3ba808ce5e47946919448b0ee78560a398f","observation_id":"039c3b39-f01a-4617-964a-34ba3e6b9ec7","resolution":{"observed_at":"2026-08-12T04:56:01.190716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T23:55:58.299593Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02071","last_updated":"2025-03-26T02:26:56Z","snapshot_observed_at":"2026-08-15T15:38:26.650897Z","submitted_at":"2024-12-03T01:21:28Z","title":"Progress-Aware Video Frame Captioning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:58.299593Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.02071"},"observation_digest":"sha256:9e50c00f45476fad06d66b578c3da7c313c0aa139c933d43b4b5ec2dbe316d10","observation_id":"721f1b58-4bc5-4a1c-876f-64120cd3f48a","resolution":{"observed_at":"2026-08-11T23:55:58.299593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4664d295e5633db28b3af298ef25ce2f40905c1d496d46c9b19c6a7a7778781a","observation_id":"111ec42d-5624-46bc-9f4d-494adccba1d7","resolution":{"observed_at":"2026-05-23T07:42:43.549699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T21:30:00.165171Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04447","last_updated":"2025-04-11T07:10:02Z","snapshot_observed_at":"2026-08-14T15:38:54.058153Z","submitted_at":"2024-12-05T18:57:23Z","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:00.165171Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.04447"},"observation_digest":"sha256:e8843ef1ff9df7e82364b12b8658f88d5090930a662ed6df14309e11ef3f86c2","observation_id":"ddbd9cb0-6eba-4ab4-8f0e-b6cb83285c48","resolution":{"observed_at":"2026-08-11T21:30:00.165171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T20:54:15.963977Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-15T18:10:10.082702Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:54:15.963977Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.05185"},"observation_digest":"sha256:18f4ed82f94b192db2b846f860e122d2cc3940a568ae3581ea98fc6e34b294fd","observation_id":"885d6d3d-6697-418d-8e0f-df75883c3c6d","resolution":{"observed_at":"2026-08-11T20:54:15.963977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:7e94eb09247943a544da19f51fdb355cf382f04b4ef0b8b578f53908bd8c0163","observation_id":"235ff406-5120-49e3-9bd1-921fedb6817a","resolution":{"observed_at":"2026-05-10T13:23:57.967610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T19:09:32.726429Z","title":"Sharegpt4video: Improving video understanding and generation with better captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07183","last_updated":"2024-12-10T04:41:44Z","snapshot_observed_at":"2026-08-16T13:03:33.843600Z","submitted_at":"2024-12-10T04:41:44Z","title":"Exploring What Why and How: A Multifaceted Benchmark for Causation Understanding of Video Anomaly","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T19:09:32.726429Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.07183"},"observation_digest":"sha256:91dc643dbb493317c638d75f94e6a3ef43fd0d79c925aebf4f2e3ee492d164ed","observation_id":"514a8eda-260c-4fda-a60e-170b9fd0e581","resolution":{"observed_at":"2026-08-11T19:09:32.726429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T17:10:21.897243Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.897243Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:d75d5e7711a2d8fe1004a6283c06af596bf640f80ebc19dfd728ce23bd42569d","observation_id":"4ebfefe2-7ddf-48c5-b74f-a80380af84ad","resolution":{"observed_at":"2026-08-11T17:10:21.897243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T17:02:16.705603Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09530","last_updated":"2024-12-12T18:20:41Z","snapshot_observed_at":"2026-08-15T11:11:08.377686Z","submitted_at":"2024-12-12T18:20:41Z","title":"Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:16.705603Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09530"},"observation_digest":"sha256:84a14ebd4496b578f4f8c77ee9909a7f520300209baee8b6993466616f959a13","observation_id":"a2949096-c0f9-4c23-990b-a3306ac34c6f","resolution":{"observed_at":"2026-08-11T17:02:16.705603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T16:56:06.030029Z","title":"ShareGPT4Video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:06.030029Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09596"},"observation_digest":"sha256:9896d70e4d1608851b17d36fb31dfd388a8c83a2f1eaf2a77f1694fda10e47fc","observation_id":"6f00bb27-f81e-463f-84e7-8ec8086f4590","resolution":{"observed_at":"2026-08-11T16:56:06.030029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T16:57:35.748209Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09601","last_updated":"2025-03-05T07:06:15Z","snapshot_observed_at":"2026-08-16T18:56:20.789827Z","submitted_at":"2024-12-12T18:59:11Z","title":"TimeRefine: Temporal Grounding with Time Refining Video LLM","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:35.748209Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09601"},"observation_digest":"sha256:972450486314964683a647c3af0cc2c99bedecda6cb2f4b83dc6f90c3dfa83ae","observation_id":"fd22d433-36fd-4676-9c06-eae22651bc0c","resolution":{"observed_at":"2026-08-11T16:57:35.748209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T16:56:42.304316Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-15T13:28:02.644563Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:42.304316Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09613"},"observation_digest":"sha256:bf271751e30235dcaf90d43ca86a77e29faf880875e7660b22bc662d16824912","observation_id":"e60fdd45-4d6b-417e-ba35-1b90bb74b59a","resolution":{"observed_at":"2026-08-11T16:56:42.304316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T14:52:04.292949Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12223","last_updated":"2025-03-28T03:50:25Z","snapshot_observed_at":"2026-08-14T03:18:45.580820Z","submitted_at":"2024-12-16T09:02:24Z","title":"Can video generation replace cinematographers? Research on the cinematic language of generated video","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:52:04.292949Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.12223"},"observation_digest":"sha256:5fb60ad5bd67eac28cb986147a84b0baa5b02f8106aa52410f5322c17c7f1341","observation_id":"17a07dd3-0067-4586-a54f-f922941b0114","resolution":{"observed_at":"2026-08-11T14:52:04.292949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T13:56:48.029586Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12675","last_updated":"2024-12-17T08:44:29Z","snapshot_observed_at":"2026-08-18T12:04:33.164372Z","submitted_at":"2024-12-17T08:44:29Z","title":"ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:48.029586Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.12675"},"observation_digest":"sha256:1c6ffaae54549af6a23c0d6220b55aff67a604fc35c93e587879796e16aec073","observation_id":"7d254a1c-332f-4cae-b067-0cf07920621b","resolution":{"observed_at":"2026-08-11T13:56:48.029586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T13:44:50.004298Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.004298Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:58a6afc97fee8cac69a566c9dac3f7370df7fc5d045460d2866c15eee7a9c0fe","observation_id":"e07e8417-78d9-4864-b5c2-a8077e335d3b","resolution":{"observed_at":"2026-08-11T13:44:50.004298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T12:47:17.079003Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13845","last_updated":"2025-02-24T03:37:59Z","snapshot_observed_at":"2026-08-17T16:57:34.317634Z","submitted_at":"2024-12-18T13:38:06Z","title":"Do Language Models Understand Time?","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:47:17.079003Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.13845"},"observation_digest":"sha256:e2950e79e6c77cf112f4519b9b912bb0152b10710c007b2a0a14f65f97a5f36c","observation_id":"b28a0493-06ed-4eaa-bb9d-23cb296d62b9","resolution":{"observed_at":"2026-08-11T12:47:17.079003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T11:09:12.947500Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-08-16T14:52:33.599355Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:09:12.947500Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.15838"},"observation_digest":"sha256:d178b554ab4c70ee316e213a3ef4f7085826ee183d028d7db86460cafad3385a","observation_id":"88c47207-6c7b-49ab-bc00-ebfba7a9d09e","resolution":{"observed_at":"2026-08-11T11:09:12.947500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2412.17574","last_updated":"2026-04-13T15:05:36Z","snapshot_observed_at":"2026-08-16T15:46:38.002728Z","submitted_at":"2024-12-23T13:45:56Z","title":"HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T07:05:08.716223Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.17574"},"observation_digest":"sha256:98b5767647191a48474492bdf7971550de0c8a5b2b2e9b712ad662d80979eb4a","observation_id":"7e65a34e-54fd-4d6b-99d1-356c8031ba8a","resolution":{"observed_at":"2026-05-23T07:05:29.181506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T01:05:25.154177Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.154177Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:8a1f2985e56e1e7ec5be6d4ae25bfa822998d13d19d8df52bbbe958936d24315","observation_id":"e75adb01-ee7a-49bd-b510-13c046284058","resolution":{"observed_at":"2026-08-11T01:05:25.154177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T00:47:12.087492Z","title":"Sharegpt4video: Improving video under- standing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-18T16:50:17.549997Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.087492Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:8111986d29497f1058e59fb2a56b13d4ba20815fe37acda7667cfbc6ca8dd9a7","observation_id":"6c4c4aab-e7c2-4666-a51d-e9e39f8c8b7a","resolution":{"observed_at":"2026-08-11T00:47:12.087492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T22:57:39.830271Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-15T21:07:19.601850Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:39.830271Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.00584"},"observation_digest":"sha256:cfe2589ee2b8d4309336d8aa018e65699203922a0d5ee7d0edd3a241d18d0036","observation_id":"29bee933-1e99-43d5-ba38-f71ccc284572","resolution":{"observed_at":"2026-08-10T22:57:39.830271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T21:23:57.849584Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-15T23:52:44.354788Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:57.849584Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.05037"},"observation_digest":"sha256:f7a39b45904104d56d4c1b69f1747c164e48a96d6de82cfb643f7eb9a9034ec2","observation_id":"e551242d-40a3-4331-bc06-41df8990ed44","resolution":{"observed_at":"2026-08-10T21:23:57.849584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-08-17T12:15:46.752690Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:3e8d1f040a591b87ba1b7c957660b08f5e6b31fad0c8ec4b154f7cd1edf294b8","observation_id":"55563787-0898-4098-923d-ce3997e27789","resolution":{"observed_at":"2026-05-23T06:02:37.376961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T20:33:53.918678Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07978","last_updated":"2025-01-14T09:52:56Z","snapshot_observed_at":"2026-08-16T13:55:24.379397Z","submitted_at":"2025-01-14T09:52:56Z","title":"Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:33:53.918678Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.07978"},"observation_digest":"sha256:0bf030626df925603e09d7928603fa44974879abc0e9a752f649f27287a4e379","observation_id":"7ade2e87-b39e-4fb9-a3b9-2a3bacd370d0","resolution":{"observed_at":"2026-08-10T20:33:53.918678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T17:18:40.016166Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-17T21:21:26.500724Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.016166Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:2919d89ddd459cbc4dd7f66c628e29703084fd8f84405e43d1266d30d43f78a6","observation_id":"f76dc3b8-f695-4eaf-9c72-ed9ca8af8034","resolution":{"observed_at":"2026-08-10T17:18:40.016166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:c41b5eca7c084faba72ae5669adb7e47d614333cb5d8b1513cf9671aab710c0f","observation_id":"cfd511f4-7199-41c0-8ae9-99e0872b6a71","resolution":{"observed_at":"2026-05-11T01:19:59.849967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T15:32:55.381407Z","title":"Sharegpt4video: Im- proving video understanding and generation with bet- ter captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13893","last_updated":"2025-01-23T18:08:57Z","snapshot_observed_at":"2026-08-13T23:14:19.264762Z","submitted_at":"2025-01-23T18:08:57Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:55.381407Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.13893"},"observation_digest":"sha256:f906f89120ba63f6dbd2ddcb718768d9d82f6a86f57e379c058d5909b463304d","observation_id":"faf5498b-79b0-4d6f-b1cc-31a0ebcfeb59","resolution":{"observed_at":"2026-08-10T15:32:55.381407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T15:35:30.082895Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.082895Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:b0b7176c7c30411807fdbffa292ba81f020fe0717dc8dd9c1684dbb16b471bbf","observation_id":"431f0539-0b9d-447c-9712-5c0ea0be68f2","resolution":{"observed_at":"2026-08-10T15:35:30.082895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T14:40:55.172325Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-18T05:01:23.171038Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:40:55.172325Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.15111"},"observation_digest":"sha256:6ed07fd7a2ed4b6bc55c39b483d15dc564f687e326b3651ef702e3b218f99eb9","observation_id":"9bc1d275-3d71-404b-9f56-69b217851a25","resolution":{"observed_at":"2026-08-10T14:40:55.172325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T14:18:17.464986Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-14T19:51:36.696522Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.464986Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:a60c8ea8bebe2885da94b2dfef207054132e32700b003598b5a33041d4a542b7","observation_id":"d0610ac8-318e-447b-a2a3-8986869d718d","resolution":{"observed_at":"2026-08-10T14:18:17.464986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-09T21:21:45.575570Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19098","last_updated":"2025-05-19T10:18:07Z","snapshot_observed_at":"2026-08-16T13:38:37.801093Z","submitted_at":"2025-01-31T12:45:46Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T21:21:45.575570Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.19098"},"observation_digest":"sha256:a99b25df8b43e6a6dd77f54a012b4af51e489fc3a108397385a261df173abcd1","observation_id":"d94dd3c6-0fe4-4d42-9c67-1d61c89559f3","resolution":{"observed_at":"2026-08-09T21:21:45.575570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T22:47:39.062734Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.062734Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d0ba52e4662bec93364d481147e7ef0445b7d9c749d097ac9e04ae9b31cc591d","observation_id":"84909031-5f6e-4f8d-8289-8991b2a172e7","resolution":{"observed_at":"2026-08-08T22:47:39.062734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T20:06:35.097848Z","title":"Sharegpt4video: Im- proving video understanding and generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-18T11:58:35.073639Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.097848Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:ea2a75f5645413965af997418aca2d044758334429a597ae22cfd7bf2afcfe0a","observation_id":"c48653a7-17e7-4649-b1f8-6273adf43fdc","resolution":{"observed_at":"2026-08-08T20:06:35.097848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T15:31:16.900888Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-16T04:28:10.624059Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:31:16.900888Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.06428"},"observation_digest":"sha256:485ca4bde40cd2901ea5c1dad99cb5306b921e469572e07ce2c2e094974c3ffb","observation_id":"299b4d8f-4f58-4ea2-b784-d23ec64689c3","resolution":{"observed_at":"2026-08-08T15:31:16.900888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T12:54:56.138227Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-17T22:15:14.890879Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.138227Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:09bb4d33995a38e5f765f89d9dfbc9925fcd4678e911aa1758b6eafa32e9cd7b","observation_id":"6a3ad532-9edd-4f91-a7da-72196dccc641","resolution":{"observed_at":"2026-08-08T12:54:56.138227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T18:23:49.679159Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-17T15:53:34.369922Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.679159Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:5947156ef23db6ec36bb5dc448e55b62a87f2ea029af36247b4091ec5c8d1d9a","observation_id":"8f907f7d-2050-48be-abc9-27c2a2d25941","resolution":{"observed_at":"2026-08-07T18:23:49.679159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T12:19:36.459440Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.459440Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6e08d61a40cac83c9a135860f143264d7009483755efe84f05578e20c684e459","observation_id":"c44d3654-2579-4e20-b1e4-fb6f56135dc3","resolution":{"observed_at":"2026-08-16T12:19:36.459440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T11:52:25.260944Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14470","last_updated":"2025-04-20T03:30:59Z","snapshot_observed_at":"2026-08-16T16:37:23.812696Z","submitted_at":"2025-04-20T03:30:59Z","title":"Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:52:25.260944Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.14470"},"observation_digest":"sha256:0f2370484e14637a72a96f3f585267c91fec96c9a2a8212a36388314931c33b2","observation_id":"8a3d83d8-9cee-4397-a0ce-37873dbe3792","resolution":{"observed_at":"2026-08-16T11:52:25.260944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T11:46:40.415013Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.415013Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:9134a5f0f69df92f68d9d03c624670e88f45a7e6cf5432e7d07c19672c69fb63","observation_id":"1efd48a1-dfb1-4daf-b9c6-e74ab80eb44e","resolution":{"observed_at":"2026-08-16T11:46:40.415013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T11:16:26.823292Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16030","last_updated":"2025-04-22T16:52:09Z","snapshot_observed_at":"2026-08-19T05:13:45.267045Z","submitted_at":"2025-04-22T16:52:09Z","title":"LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:26.823292Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.16030"},"observation_digest":"sha256:89c021933f2561572264357d3058977885fcf54b4d5819adb3923c6eeb00c469","observation_id":"e9cba1c9-195a-4afb-93b7-0eb6c5e9d4c7","resolution":{"observed_at":"2026-08-16T11:16:26.823292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T10:50:21.372047Z","title":"ShareGPT4Video: Improving Video Un- derstanding and Generation with Better Captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17213","last_updated":"2025-04-28T05:05:24Z","snapshot_observed_at":"2026-08-18T13:50:31.935936Z","submitted_at":"2025-04-24T02:54:40Z","title":"MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:21.372047Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.17213"},"observation_digest":"sha256:1068a1aad0a20a6d016fa8ebcd0e12acac6017b19edad3f59dd78bfdde4d8dc9","observation_id":"e182584c-e789-40c6-b5c7-1d808da72705","resolution":{"observed_at":"2026-08-16T10:50:21.372047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T11:00:03.440183Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.440183Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b2a70c76a5927e9ba0b09a85482795e5c7e757b5a441f3c2f8918be9cbf0c198","observation_id":"a610f35c-47f6-427a-bd63-3ff7d1c30a28","resolution":{"observed_at":"2026-08-16T11:00:03.440183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T10:50:29.737303Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-18T18:37:54.019807Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.737303Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:feeae0427659add3bc4b110426cea7e571ac63d889bd2576c02103cadc238107","observation_id":"c7dfa941-13be-4f45-b591-a253d06c7c01","resolution":{"observed_at":"2026-08-16T10:50:29.737303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T10:28:35.458263Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18152","last_updated":"2025-04-25T08:05:32Z","snapshot_observed_at":"2026-08-18T23:12:11.726082Z","submitted_at":"2025-04-25T08:05:32Z","title":"ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:28:35.458263Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.18152"},"observation_digest":"sha256:97779506bb70b78938625950708ebf33cbcec0cec39f8211927095ba52ffae67","observation_id":"329b37c3-0136-49cf-a6d1-28dd703339eb","resolution":{"observed_at":"2026-08-16T10:28:35.458263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T05:02:11.077076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21650","last_updated":"2025-05-13T09:04:40Z","snapshot_observed_at":"2026-08-16T05:49:51.509180Z","submitted_at":"2025-04-30T13:55:28Z","title":"HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:02:11.077076Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.21650"},"observation_digest":"sha256:8acc67404afc1bf2d4a557f5edc313d46e7507aa41895be4767dad342e1e97c4","observation_id":"b28086b4-d914-4043-8d35-b1de08144eeb","resolution":{"observed_at":"2026-08-16T05:02:11.077076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-15T20:35:54.366150Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12589","last_updated":"2025-05-19T00:57:04Z","snapshot_observed_at":"2026-08-18T02:06:36.869670Z","submitted_at":"2025-05-19T00:57:04Z","title":"SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.366150Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.12589"},"observation_digest":"sha256:1dbfea3c744e59c9764c80daadef973dbdda7047ad6a6713df32a20d50e7f8f0","observation_id":"3a20c8e5-9658-4394-8b3d-e13cbc5bd47c","resolution":{"observed_at":"2026-08-15T20:35:54.366150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T15:41:03.468248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14405","last_updated":"2025-05-20T14:18:56Z","snapshot_observed_at":"2026-08-17T00:29:28.847897Z","submitted_at":"2025-05-20T14:18:56Z","title":"Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal Inconsistency","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:41:03.468248Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.14405"},"observation_digest":"sha256:c2b4c38b40778c7fd596590e78f106b055cce0dca3904fab96d64282c8010236","observation_id":"d7edd419-47c9-47fb-babc-346f8edd4be0","resolution":{"observed_at":"2026-08-07T15:41:03.468248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T14:37:47.747310Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-15T13:50:06.766318Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.747310Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6fc605964be935aaa47b119661dfa42d94465d61a48fcd06f048e39b750308c0","observation_id":"b005e4b9-97e1-43e2-939f-20470ea8ce43","resolution":{"observed_at":"2026-08-07T14:37:47.747310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T14:02:59.821440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-18T20:35:04.425130Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.821440Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:eb9cb8e5d7816b937502b0d2175eb18195d6a08b9e5ad240d83ba63ede6bd49a","observation_id":"b07fa147-f2c7-48ef-9f80-c9173bc1072a","resolution":{"observed_at":"2026-08-07T14:02:59.821440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T11:51:25.703132Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:25.703132Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:1da33fb80bd6dc85ddee356213f617fe85cce951713b9ceba4e0b9adce2cc3e9","observation_id":"10c02465-053a-418b-b21f-3b8822bafc83","resolution":{"observed_at":"2026-08-07T11:51:25.703132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T11:40:09.778162Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-15T09:52:26.987289Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.778162Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:262d8a7e15e456de89267f1d6a4e824e80b9c988dc67ff367b52c82fc31dedf9","observation_id":"2ef9d158-91d2-4043-b920-430cefab504d","resolution":{"observed_at":"2026-08-07T11:40:09.778162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T10:28:51.015037Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-16T15:12:01.896424Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.015037Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:350e256a155e5357996e01a36e7a68bbdbf84b8b67275b486d5aa14e263f7e5d","observation_id":"c2782dec-d4a8-494b-bbe4-8deb106d887f","resolution":{"observed_at":"2026-08-07T10:28:51.015037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T23:42:12.861061Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-17T01:14:16.847511Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.861061Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:aae645dd2f44d6834d2db8ab57df023ea88ce586e3d09c551c2b1ac029a8f75e","observation_id":"7381ecb4-c8b7-408c-aeab-a652d13bdaa3","resolution":{"observed_at":"2026-08-06T23:42:12.861061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T22:36:36.613827Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-15T05:43:52.433858Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.613827Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:1cac2b7e41cfbe77ff2d4d90b5a8d92f94f9cc29954167e405c523873fc9b509","observation_id":"3c9cd646-4ba3-44ce-8828-ca0f1aeea3ea","resolution":{"observed_at":"2026-08-06T22:36:36.613827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T22:11:53.460393Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22298","last_updated":"2025-06-27T15:08:54Z","snapshot_observed_at":"2026-08-13T08:36:36.575448Z","submitted_at":"2025-06-27T15:08:54Z","title":"OutDreamer: Video Outpainting with a Diffusion Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:53.460393Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.22298"},"observation_digest":"sha256:2c67651ad85fb0c1768c56402b32b56b58a5fc9bb4071613791e46f2ff823802","observation_id":"9c6f1df4-7b18-491e-9890-07aaa8a4c393","resolution":{"observed_at":"2026-08-06T22:11:53.460393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T20:29:48.489965Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-16T03:11:40.337117Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.489965Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:5caa16e765564b31b1019a842212edb059f733c05aac0e715ec275b78a5bd2fb","observation_id":"67515cb2-5b29-4a06-be65-585b37f24353","resolution":{"observed_at":"2026-08-06T20:29:48.489965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T17:38:14.432529Z","title":"arXiv:2406.04325 (2024) 1, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-13T10:47:40.351375Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.432529Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:d862f52dd3fc0c10f8a52c00fb560a11b853d211becabccb0f745e8a5cdbf1f2","observation_id":"2da34952-7e06-42c6-ad0f-7a60dfe52fc0","resolution":{"observed_at":"2026-08-06T17:38:14.432529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T05:15:41.519124Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:41.519124Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:5d7e4a46101188bc5bb1acc49d5e306b42f5efad3bff272efe678b9d931f23d3","observation_id":"56eef71a-7d12-400a-8d99-5b6bc27ffb9a","resolution":{"observed_at":"2026-08-06T05:15:41.519124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T05:12:33.079542Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.079542Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:bfb1e72644b287b39eb25f5df1993c7db4406c4e3b894537c70be9b74fd7f511","observation_id":"7255e154-2e35-4724-8474-3cd9e6b63110","resolution":{"observed_at":"2026-08-06T05:12:33.079542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T04:49:37.464967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-13T14:57:48.174747Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.464967Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:bd5d429984828684128fbc710e7638eb14c9d203d1020281f9053eed4eadad83","observation_id":"457862a8-afb3-48f7-85d2-efa803b70330","resolution":{"observed_at":"2026-08-06T04:49:37.464967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-05T17:13:05.984791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.984791Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:fa72e2430ca5ea9c5d21933b6258650a3faa9cced52b0a48746e2c402540d7e7","observation_id":"ea14db05-ebb2-4935-96bc-d8559c0b8a65","resolution":{"observed_at":"2026-08-05T17:13:05.984791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-05T06:00:27.385958Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-15T23:11:42.439873Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.385958Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:02749f2805a2edddb41f4cfcb13ef976daf9bcef3cf9e6d317f970d0d3aee7df","observation_id":"0aa4d782-5645-4153-abea-5c2f8d9af55e","resolution":{"observed_at":"2026-08-05T06:00:27.385958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-03T08:15:15.112945Z","title":"Sharegpt4video: Improving video understanding and generation with better captions, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-17T20:18:47.174609Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:15.112945Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:6dd98a65cb7610b373c8c4995c2996485c8ba7fd62bb79b4b0b87e365908de4a","observation_id":"b8bf05d2-7dc4-4c8a-942c-c4cdef0977f2","resolution":{"observed_at":"2026-08-03T08:15:15.112945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2604.17749","last_updated":"2026-04-20T03:07:22Z","snapshot_observed_at":"2026-08-15T03:06:30.351654Z","submitted_at":"2026-04-20T03:07:22Z","title":"Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:26:48.606759Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2604.17749"},"observation_digest":"sha256:e61ccf60dedcd94c55cea7519555971c9241ead4a5c42873500355bf239ed862","observation_id":"642d51a8-20ff-417c-9e70-b963f6116528","resolution":{"observed_at":"2026-05-10T06:56:48.013222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T03:49:58.240883Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:d889bc8c3c4aba5edef84262be5046a2a2face0fa6cc4d5c375eba152bbfe790","observation_id":"6e744474-39a8-494e-8bac-3deef550e724","resolution":{"observed_at":"2026-05-13T03:52:12.619855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T06:06:20.658030Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:21fbc67e04b69bca123587d95a11fa44a99f2f9c34b8a011bdcce0e811c9e2ed","observation_id":"c858b49c-ac43-48b9-b779-a0dc22e0868f","resolution":{"observed_at":"2026-05-15T06:09:50.452757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2605.18018","last_updated":"2026-05-18T08:09:37Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:09:37Z","title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:10:54.874012Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2605.18018"},"observation_digest":"sha256:44dc5d06d3cc1c85476b5149b642bfc25a7bb145aa1921ae8508d7f6c5557df9","observation_id":"6241f389-bd1b-4315-b1d4-789929997f9a","resolution":{"observed_at":"2026-05-20T12:13:16.313346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2606.05748","last_updated":"2026-06-04T06:20:23Z","snapshot_observed_at":"2026-08-16T21:29:02.433077Z","submitted_at":"2026-06-04T06:20:23Z","title":"UNIVID: Unified Vision-Language Model for Video Moderation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T22:56:26.674841Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2606.05748"},"observation_digest":"sha256:0946f8de68de5db5ab8bd4074fa4b2e8c9b82baf6520e1bfbd43c0519a14de14","observation_id":"124ed411-0beb-4cc4-8191-f166e6c26330","resolution":{"observed_at":"2026-07-02T16:07:09.294420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-08-17T19:24:43.936240Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:cfc3b69adaf39e9ea346ef8308b7f3bb4b28045e91c4b00af8c1333eb01df5d3","observation_id":"d9cb0997-5ccb-4b5f-89c3-df9657029bc5","resolution":{"observed_at":"2026-07-01T22:26:17.970978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:c9d18117f55fee7f8b1b51ea2d167cd21ec9c891ae93b26020944c03de29342a","observation_id":"fab0ff6e-ec31-4328-acb1-0c8a0f266401","resolution":{"observed_at":"2026-07-04T06:39:37.678650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-11T08:59:46.244502Z","title":"arXiv preprint arXiv:2406.04325 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05089","last_updated":"2026-07-06T13:50:15Z","snapshot_observed_at":"2026-07-11T08:59:45.751461Z","submitted_at":"2026-07-06T13:50:15Z","title":"TimeThink: Reasoning with Time for Video LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T08:59:46.244502Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2607.05089"},"observation_digest":"sha256:388fbfb4531c6c9de09679db70c1f9a4a7dd06ce99737acb0e260038daa94868","observation_id":"9268b81e-016b-4aa9-9175-b18cd1c6f956","resolution":{"observed_at":"2026-07-11T08:59:46.244502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-02T00:44:50.075651Z","title":"Sharegpt4video: Improving video understanding and generation with better captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-19T11:37:45.224155Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:50.075651Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:7fa8f2a7ccbc423b39d2b17a4b9479b358afbef196d066e49de2ef7d5fe1b6fb","observation_id":"ddeb7df9-80c5-4bf3-9afe-bdd40ebea329","resolution":{"observed_at":"2026-08-02T00:44:50.075651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T21:18:34.108407Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.108407Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:fd8a139a897e44fd941cf7c0bce269bbc106a942a2728876a19544b38d487e8f","observation_id":"581d0e6d-922b-493d-957d-1ec240bfe891","resolution":{"observed_at":"2026-08-10T21:18:34.108407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.04325/citation-record","integrity":"/paper/2406.04325/integrity","json":"/paper/2406.04325/citation-record.json","paper":"/paper/2406.04325"},"outbound":[],"paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 89 inbound Pith citation observations for arXiv:2406.04325."}