{"as_of":"2026-08-09T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cece319fc41368e40c232717d53bc5473d377c5ffcb3b02379aaccf6d8836864","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:06:35.158259Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:06.409899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T16:59:50.495335Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2307.16125"},"observation_digest":"sha256:a08df92684fffe30046dafcca39438380bf341091bec0622e9bb45a4e49c898c","observation_id":"897e4d1c-875a-441b-b2f8-26c72af5d579","resolution":{"observed_at":"2026-05-12T16:59:50.650439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-14T18:08:01.166072Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2311.10122"},"observation_digest":"sha256:9b7bf549da72b7d2b6852856fd35ac309458e7e4200485188ae4d8dc7e253729","observation_id":"c342be09-1bd7-449d-b81d-5e098411cd7c","resolution":{"observed_at":"2026-05-14T18:08:01.242531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:e5d04da829cf7755b514cc1fc36911a2b358a67937dd0aa6dbb1970c0d98d467","observation_id":"f560f83b-f72e-4b21-9b3f-27f69a86c5a5","resolution":{"observed_at":"2026-05-17T20:22:35.014045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:4d68068f8931c1efeffdad1809d09580a1028372ff078da21efedfcb2f973c00","observation_id":"da2205a2-3c68-494f-bd58-63204b3bf502","resolution":{"observed_at":"2026-05-17T02:46:16.769669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:a4674458b5ee0f92c1d94827006d507b2417ca7df3d3c730d2a7d6818e96c8ae","observation_id":"d8272357-eb90-40ef-b937-06bdfc05800d","resolution":{"observed_at":"2026-05-17T10:46:28.884272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:865dd592bac1168b3e8510d767212760fb266bfc19327173b498502cb9f4587e","observation_id":"634a0eee-6bd6-4860-99f0-19f0893c45f8","resolution":{"observed_at":"2026-05-16T13:53:33.675561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:f11e1668b34f5399a72a546fd70e1f0cbcd5e81f775a44635dfa75bc2c0ae5d5","observation_id":"dc8993eb-df65-4539-8b6b-4bd24028e0e2","resolution":{"observed_at":"2026-05-23T17:33:15.706077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2412.02930","last_updated":"2026-04-19T04:24:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-04T00:50:33Z","title":"TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T08:08:01.889675Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.02930"},"observation_digest":"sha256:b46539f0cff69767aba22fe527c600f9643df94a9158ece074e14064047084bf","observation_id":"8f5e0e6f-f569-4ead-809a-2a3b4e6d6d3e","resolution":{"observed_at":"2026-05-23T08:12:43.870984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-08T20:06:35.158259Z","title":"Maaz, M., Rasheed, H., Khan, S., and Khan, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-08T19:58:39.444110Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.158259Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:00eb55ecde427586abff6841be600a61b334b028551e58e1ef8b752ea3031494","observation_id":"0e1d8574-032b-4117-ab75-eb7050bd2c38","resolution":{"observed_at":"2026-08-08T20:06:35.158259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:85a7dbb3b2afcce7411cdd3a62f95059458a40c17d650b3329ac7e9995eb9f4a","observation_id":"08271f24-be62-4741-8711-197e91098711","resolution":{"observed_at":"2026-05-23T00:22:18.746828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T15:22:51.754421Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17110","last_updated":"2025-05-21T12:40:07Z","snapshot_observed_at":"2026-08-08T23:15:34.725731Z","submitted_at":"2025-05-21T12:40:07Z","title":"Multi-Modality Expansion and Retention for LLMs through Parameter Merging and Decoupling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:22:51.754421Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.17110"},"observation_digest":"sha256:8857c90fdee9ac1975402149f741de55c2cba3fe6bb6d81d3ab758e07528def9","observation_id":"b589f826-7aa3-4d32-9b16-895eee05959f","resolution":{"observed_at":"2026-08-07T15:22:51.754421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T15:19:13.167183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:13.167183Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:f53a8f9a36a90b82f3e4e6a9edfe8d9c2e96007e94db983dbd12b7e0358773dc","observation_id":"13fc8891-7b8a-4efc-b6b5-fc1689b8a69c","resolution":{"observed_at":"2026-08-07T15:19:13.167183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T12:32:52.929275Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-09T06:10:22.489105Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.929275Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ffcd344ead88e950e59de834a115c2005a865fb87a8cf8762a048d3e1007fb27","observation_id":"c1b43079-4c42-428b-a47a-aff1f18e0f89","resolution":{"observed_at":"2026-08-07T12:32:52.929275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T12:26:38.671225Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24476","last_updated":"2025-05-30T11:23:21Z","snapshot_observed_at":"2026-08-09T05:31:37.592410Z","submitted_at":"2025-05-30T11:23:21Z","title":"Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:38.671225Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.24476"},"observation_digest":"sha256:9b077921dd69e9b8b6584a28d1d37e1b85cd891b21bf91afc10991226f1d7ef3","observation_id":"1646c9f3-a123-4005-9125-201509576e94","resolution":{"observed_at":"2026-08-07T12:26:38.671225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T23:29:29.648522Z","title":"V ALLEY: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-08T12:15:56.187844Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:29:29.648522Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:797a93749cf2233434e57e9d5e9c997ae92e10e348ff386d22c7bf90ff06c6b8","observation_id":"cf23a219-89bd-4daf-9ae1-0fcb6e0aa809","resolution":{"observed_at":"2026-08-06T23:29:29.648522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2506.18962","last_updated":"2026-05-11T09:01:24Z","snapshot_observed_at":"2026-08-06T06:40:03.304790Z","submitted_at":"2025-06-23T17:58:17Z","title":"UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T07:43:26.736409Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.18962"},"observation_digest":"sha256:f66870e8bd63413f1c611872c421e34c7663875dcb4d3732f3b95cb8002c7443","observation_id":"c4229669-f0ae-4e90-a50f-ac08f48c9807","resolution":{"observed_at":"2026-05-19T07:47:10.369499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T22:37:37.503819Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:37.503819Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:61e6d681ca9d67d3aff27195ecdc8a796b5c0f10bbb88ad280dc9211d42401c6","observation_id":"d25c8878-8950-4f13-a1ec-3ad356218ae2","resolution":{"observed_at":"2026-08-06T22:37:37.503819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T22:36:38.176899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.176899Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:553fe743d5a108bd543e545ee5ffb3dbd51b8e0d535a381b929ff93cafad6259","observation_id":"a50540c1-0041-4ace-8dd5-f98bb031f217","resolution":{"observed_at":"2026-08-06T22:36:38.176899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T05:30:35.652829Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.652829Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b0bcc8e1ad22d89598a5e250efb486b13b0238d078f17d7b6148ddd45fb4082c","observation_id":"f21d3b11-8dd8-4f2a-8183-1df5bf4165df","resolution":{"observed_at":"2026-08-06T05:30:35.652829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-05T13:05:54.875262Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.875262Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:90423649ff6fb7bdf0b832a7f1d50c4c0f2b376fee3166234f33e9fdbf04d290","observation_id":"a6630497-dc85-42bc-83c5-efaa1c28942c","resolution":{"observed_at":"2026-08-05T13:05:54.875262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-04T19:37:42.248728Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-08T05:57:49.794416Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":248,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:42.248728Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:8647bb4b8f7b2b75592449744ad6d6a124665e6d188631cd27bb70620cfbcdf7","observation_id":"34b2886f-ccd6-447f-b1c7-55ef0e380930","resolution":{"observed_at":"2026-08-04T19:37:42.248728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-03T21:42:47.855446Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-06T18:33:53.894178Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:47.855446Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:347b2669d458f9c43853b1435e6ac3949f3617d4b0d493d8b98c934fc0864218","observation_id":"d5431206-c977-4ddb-9a17-869ded7abf2b","resolution":{"observed_at":"2026-08-03T21:42:47.855446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-03T20:57:30.906964Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:30.906964Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:8e6992ab4cf61a689a90b6799a743976408d4d4e7c8494f47af6ab045b30f9a7","observation_id":"0536ee5a-5b72-4bb6-b5f3-d8f5ecdfcc87","resolution":{"observed_at":"2026-08-03T20:57:30.906964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2512.06673","last_updated":"2026-05-09T07:46:05Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T06:11:15Z","title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T00:54:53.789523Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2512.06673"},"observation_digest":"sha256:b0c9a7f4b0e446d51176877bd141141b31e4a7a347d62fde05562b23e6d03583","observation_id":"3780dad6-ab2a-414b-8f9d-9e81fe75ccdc","resolution":{"observed_at":"2026-05-17T00:58:46.556812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.05079","last_updated":"2026-04-06T18:30:50Z","snapshot_observed_at":"2026-08-02T23:48:40.440218Z","submitted_at":"2026-04-06T18:30:50Z","title":"SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T20:20:08.590407Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.05079"},"observation_digest":"sha256:7ff9d5902b27b508eb39b507f6841e416e9cde6338d2de9143d6f704487ac499","observation_id":"89f4997e-db72-495e-a46d-391c9c729afc","resolution":{"observed_at":"2026-05-10T22:00:49.044127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:806df942f7e7e11cae2f912e660e4fcbdd74bf50ef6c0a1ed8f9e8e63bc9bcb1","observation_id":"053cc833-2807-415b-b9d3-2620cdc741e8","resolution":{"observed_at":"2026-05-11T08:30:56.924293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ec0727b2d1dc204678f84c14c7d2e1306e193750ca6e1f3dfd846e22cda05fde","observation_id":"6d2e3842-bbb3-4e92-84ad-800e932d1c89","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:a951703eeb88fd16f0268d7ec2c79d57c9d913ccf0fd8683579138777d6625d5","observation_id":"6ef3b4ba-347d-4592-8f41-d38510568d4b","resolution":{"observed_at":"2026-05-10T13:30:26.566195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.27968","last_updated":"2026-04-30T15:00:52Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:00:52Z","title":"ClimateVID -- Social Media Videos Analysis and Challenges Involved","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T05:25:05.760276Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.27968"},"observation_digest":"sha256:419612988349a8acd5ac063f01bc3a7f4a0f1034eebb26fd8bae84dce2be68ab","observation_id":"9a223249-f3da-42a3-af03-839e912aeace","resolution":{"observed_at":"2026-05-12T10:36:30.448614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2605.18904","last_updated":"2026-05-17T13:36:53Z","snapshot_observed_at":"2026-07-31T21:47:41.038897Z","submitted_at":"2026-05-17T13:36:53Z","title":"Dynamic Model Merging Made Slim","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T15:16:24.651868Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2605.18904"},"observation_digest":"sha256:36adec28c4f044eb34b297a738a2952bd8b98f594cd8ae7fc63a5bc0739f162d","observation_id":"696d60da-b03f-4d11-a459-80b296cf68c3","resolution":{"observed_at":"2026-05-20T15:18:25.408077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:292d282b536cf673174eca3060bafa200099b5a27017294da5e69ec7b0c14f5b","observation_id":"54e5d202-bf23-46d1-98fb-d3bd45514b1f","resolution":{"observed_at":"2026-07-02T16:27:09.379995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.10533","last_updated":"2026-06-09T08:04:06Z","snapshot_observed_at":"2026-08-05T15:31:34.855440Z","submitted_at":"2026-06-09T08:04:06Z","title":"Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:53:53.520545Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.10533"},"observation_digest":"sha256:5dafbe6015b53be155b5c762674c6f80b3ed352a01accb0f4b6c140359c2afbb","observation_id":"3b7dfae4-d4b9-41b7-8a07-ff1bc762f762","resolution":{"observed_at":"2026-07-03T04:27:36.879950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:aad71be0658c2ff0cc58ca12a4da2ed0d7776adf8e77dbb5e171e3309edec2e8","observation_id":"c2a7f144-34cd-4dad-9773-a3100e589982","resolution":{"observed_at":"2026-07-03T10:48:02.979640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.22352","last_updated":"2026-06-21T06:20:55Z","snapshot_observed_at":"2026-08-06T05:50:18.958153Z","submitted_at":"2026-06-21T06:20:55Z","title":"On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T11:13:49.266859Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.22352"},"observation_digest":"sha256:d17dc4820d7f7021e10fc7cd99d1ab45de2202093483a8a4290f60db43fdc2b1","observation_id":"0b1ceda6-c948-4963-b7a4-e89a65659738","resolution":{"observed_at":"2026-07-04T08:39:42.125759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:c6760f93a8b4cf90da627df90a37a0f997fa881d87843f82ec7af45ee4b09e05","observation_id":"2bf24e0f-0851-454d-97e7-f1d6c87a3583","resolution":{"observed_at":"2026-07-04T19:20:06.411854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2607.01117","last_updated":"2026-07-01T16:04:24Z","snapshot_observed_at":"2026-08-01T19:51:36.300993Z","submitted_at":"2026-07-01T16:04:24Z","title":"MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T13:44:48.250838Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2607.01117"},"observation_digest":"sha256:89e06d93fa3d3bd9b6bc06c6f74e9ff3a9261059079e4d794a86ac6d07cb1a53","observation_id":"c1801018-9997-4953-8a27-fcc10b024224","resolution":{"observed_at":"2026-07-02T13:46:58.685914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.07207/citation-record","integrity":"/paper/2306.07207/integrity","json":"/paper/2306.07207/citation-record.json","paper":"/paper/2306.07207"},"outbound":[],"paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2306.07207."}