{"as_of":"2026-08-12T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:049c3a7baef695aefe1c3259cd7d2b0e942ac5a66906b80e3376452d4c833f0f","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:48:07.259130Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.14965/citation-record","integrity":"/paper/2412.14965/integrity","json":"/paper/2412.14965/citation-record.json","paper":"/paper/2412.14965"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T11:48:07.102344Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.102344Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:19b2e95d44b840c6b0cebc06f39bb4fe36f9321ec876dd2f9bd1dcfff111b47c","observation_id":"cd9a2d0f-4f81-454b-86d7-ca7e8b50d817","resolution":{"observed_at":"2026-08-11T11:48:07.102344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T11:48:07.106481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.106481Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:11516d3630abcd787dcea541129ba573448521984a66f3702914ef5c35a8a522","observation_id":"6629e209-1133-4450-b9eb-37a1247dfd21","resolution":{"observed_at":"2026-08-11T11:48:07.106481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00874","last_updated":"2022-02-02T04:49:14Z","snapshot_observed_at":"2026-08-07T00:04:27.412290Z","submitted_at":"2022-02-02T04:49:14Z","title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00874","snapshot_observed_at":"2026-08-11T11:48:07.109873Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.109873Z"},"links":{"cited_paper":"/paper/2202.00874","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:8a98b0be2899fe4d30bc2275cfd5ea641c4e6b7ce8d95f058db791f4ceeae1af","observation_id":"665c0f6b-3883-4577-8704-1dba32b7c9c1","resolution":{"observed_at":"2026-08-11T11:48:07.109873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-11T11:48:07.113036Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.113036Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:6f6f348cfe2393fe07571d837c2c36abd57918d99f80e9785ec82ed637972cd8","observation_id":"5ddfea5d-024b-46a4-b01a-fb5db9d6ef34","resolution":{"observed_at":"2026-08-11T11:48:07.113036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T11:48:07.116192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.116192Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2a78a9cfdbda1e1d30c8866e121fe4871d4338c9023792e778a23cecf7d5ca72","observation_id":"b93bcddd-58ff-49db-b644-c6af165c04fe","resolution":{"observed_at":"2026-08-11T11:48:07.116192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T11:48:07.119559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.119559Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:d43c2768e7e300c03e6f3086d291427ee068f47129528cd9657c3cd8d7115ea3","observation_id":"d7e4111d-1e26-4fea-a0c8-528596a46b7a","resolution":{"observed_at":"2026-08-11T11:48:07.119559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T11:48:07.122823Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.122823Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:e2a45873eb0ed2adbd0f71215c741e5576b3dd8de1738f10590a21db4dd48e21","observation_id":"f96e29d8-7ca7-4892-82c4-dc466d4740d6","resolution":{"observed_at":"2026-08-11T11:48:07.122823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T11:48:07.125832Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.125832Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:e5f3b0a20258188ec1ada88e09129bda93cf19ad12b90b04dafcfdc342869cd3","observation_id":"ef7a6140-d6ea-41cd-84e2-b95b63334213","resolution":{"observed_at":"2026-08-11T11:48:07.125832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T11:48:07.128749Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.128749Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c8c043d454c03b9eccf34ca016cac8d8f0568d2bb8fd44d5bd7421eb4da297b5","observation_id":"de6d5932-b665-4bb6-92a6-5f3642cdbeba","resolution":{"observed_at":"2026-08-11T11:48:07.128749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:48:07.131658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.131658Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:6393b60ba8b266a2df085d05836bf398ef767cb11a75ac5e6d0e8b2472d917c2","observation_id":"7ed0f38a-da12-4fa4-9290-714370f0ffd6","resolution":{"observed_at":"2026-08-11T11:48:07.131658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T11:48:07.133826Z","title":"Jiang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.133826Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:30f3b85b172ed11c8cd933a6c949896aa56bb718d8ecab5433f73c14ddbcb5a2","observation_id":"e19bf70a-4876-4679-aec0-124eb466a99b","resolution":{"observed_at":"2026-08-11T11:48:07.133826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T11:48:07.136034Z","title":"Hu et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.136034Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:1bfcfd9583e073be2493eaad34b09dd33171b7c6b5176d2fa6d2e17140729eac","observation_id":"3f4e0708-b829-4151-9a3b-7db13f38056a","resolution":{"observed_at":"2026-08-11T11:48:07.136034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01255","last_updated":"2019-11-04T14:46:31Z","snapshot_observed_at":"2026-08-08T01:40:47.328408Z","submitted_at":"2019-11-04T14:46:31Z","title":"pyannote.audio: neural building blocks for speaker diarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01255","snapshot_observed_at":"2026-08-11T11:48:07.138051Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.138051Z"},"links":{"cited_paper":"/paper/1911.01255","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:8009a2a3752747bdf3abc9aae09ccb1331ee37bb2190ad554008342e6efb3d6e","observation_id":"2c77b2f8-6403-4a6f-8bcc-1d2915e1130e","resolution":{"observed_at":"2026-08-11T11:48:07.138051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T11:48:07.140182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.140182Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:643d520af408a121259e14e99460f04e6ecd0ecf7ebe3f286ae357a6c3a172ee","observation_id":"9533073b-bed7-41ba-8f87-3d69b11d8777","resolution":{"observed_at":"2026-08-11T11:48:07.140182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T11:48:07.142835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.142835Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:3e09e1969fd5d9d16f5e3acff8bffc9de1347f230008a3b982316f16ef3e28dd","observation_id":"918f1167-b37f-4b81-88a2-be8fba7523a2","resolution":{"observed_at":"2026-08-11T11:48:07.142835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-10T23:36:01.623927Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-11T11:48:07.145680Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.145680Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:ab4fdaaae2811fb51bc2fd193258d6719d295ed8a079018eecda9954d56163fb","observation_id":"e7f9a7a9-556d-458a-bfbb-362be4585dec","resolution":{"observed_at":"2026-08-11T11:48:07.145680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.915741Z","title":null,"venue":null,"work_id":"f9ef9ce0-4670-475a-a8ed-59254c58ebd0","year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.148685Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:e3a0e31f8b985d275c2ad0006cb2a1ceaffcff4def7e8f450564d33346d7fb8d","observation_id":"1587efce-0860-4235-a2f9-c4753eca11b1","resolution":{"observed_at":"2026-08-11T11:48:07.919248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T11:48:07.152211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.152211Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:22c4bd42fbbe889de9a13fd5095b20f54f092eeb0e50339006e7ec1cc3be4889","observation_id":"918c887c-7417-4ee4-8c50-3483b9cf65c3","resolution":{"observed_at":"2026-08-11T11:48:07.152211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-11T11:48:07.155335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.155335Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:6560eb09dd8e118742535477c9cfd5ba92ffc4b8e204a3a5ccd4a0cd93f6d754","observation_id":"0d037024-1051-4a3c-a188-cd172d282873","resolution":{"observed_at":"2026-08-11T11:48:07.155335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05665","last_updated":"2023-05-31T04:57:12Z","snapshot_observed_at":"2026-08-09T09:38:35.454027Z","submitted_at":"2023-05-09T17:59:07Z","title":"ImageBind: One Embedding Space To Bind Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05665","snapshot_observed_at":"2026-08-11T11:48:07.158316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.158316Z"},"links":{"cited_paper":"/paper/2305.05665","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:6ee84fd72e22afff4474bc175061fc8fb8a2862855d44f14f7d4a82c435b3a23","observation_id":"b37fe7cd-2232-484e-bdc8-a2fada3b1a5d","resolution":{"observed_at":"2026-08-11T11:48:07.158316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04261","last_updated":"2017-06-15T21:15:13Z","snapshot_observed_at":"2026-08-12T13:33:06.386813Z","submitted_at":"2017-06-13T21:26:19Z","title":"The \"something something\" video database for learning and evaluating visual common sense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04261","snapshot_observed_at":"2026-08-11T11:48:07.161317Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.161317Z"},"links":{"cited_paper":"/paper/1706.04261","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:851fbc949725e9ec92c8a1ef1a96e1eeb8c31507a7f24655523612b5d5c782ee","observation_id":"6f95db44-06c5-461b-b93d-2fb0f6537abb","resolution":{"observed_at":"2026-08-11T11:48:07.161317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-08-11T11:48:07.164357Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.164357Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:74de0f4ef5b4f019d56d838d2b72c147043f9f9a166504ba9f53190ecb52c1fc","observation_id":"89da694d-c378-4495-bbaf-48d4a02e93df","resolution":{"observed_at":"2026-08-11T11:48:07.164357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T11:48:07.167213Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.167213Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:28e0f3433a39f6e85cf56407f13f3b0e539520998e252ad347cae95eaa1a24b5","observation_id":"2ed91dd6-bca6-42cd-a65d-adfc38ce79bd","resolution":{"observed_at":"2026-08-11T11:48:07.167213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.169934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.169934Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:58a2ee2a8d68a6ddf2eb2d271e607cceff63fa8f5101a4531e8b8c7f2c73acd8","observation_id":"2507dc6f-705b-48cd-8927-98653dea6df3","resolution":{"observed_at":"2026-08-11T11:48:07.169934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10002","last_updated":"2024-12-13T09:40:37Z","snapshot_observed_at":"2026-08-12T12:02:30.449464Z","submitted_at":"2024-12-13T09:40:37Z","title":"NowYouSee Me: Context-Aware Automatic Audio Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10002","snapshot_observed_at":"2026-08-11T11:48:07.172477Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.172477Z"},"links":{"cited_paper":"/paper/2412.10002","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:d49f016e109d63828459d0a318c14e1915e3da9c45e69a2fdef81f47f1221ec3","observation_id":"57a20458-e932-4b76-93c1-4b894ad55745","resolution":{"observed_at":"2026-08-11T11:48:07.172477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T11:48:07.175428Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.175428Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:425d90c5abe806035c124e91115d271e3d47e14057c607d338a7d711e224a8e2","observation_id":"0d52e13b-9464-4109-8aff-0babfde8d622","resolution":{"observed_at":"2026-08-11T11:48:07.175428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.178368Z","title":"Kankanhalli","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.178368Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2e80643fdb69b849e03a36de9502decb1d202dd37655b0738c820ba13d0310ca","observation_id":"ddbc04f6-4c79-4f35-b983-679adfe59a15","resolution":{"observed_at":"2026-08-11T11:48:07.178368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T11:48:07.180993Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.180993Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:a248c30b1d047db60a3ade036118a85d1ab62e7f4ea9eb04b799771f985aa5dd","observation_id":"fa077860-7905-48e7-87c5-3891165760c8","resolution":{"observed_at":"2026-08-11T11:48:07.180993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-11T11:48:07.183821Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.183821Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:e0faa0bed6b6f2c3af289c89bacdfb13c3c9e629b58cf9ff9ccbda766e9edceb","observation_id":"e5eb1154-0f5e-4f3b-97a6-4c520c7c4bb5","resolution":{"observed_at":"2026-08-11T11:48:07.183821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T11:48:07.186559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.186559Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2e33a1405287544ba73a448f79ed5b0606dd3d109ba57bbb392ed7fb1f163ef3","observation_id":"234b8113-a46c-43d2-a947-c42230ea32d9","resolution":{"observed_at":"2026-08-11T11:48:07.186559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.189316Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.189316Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:797c687b56c9f4513a1f60937be639ee9fa794150cb5403d409268a35aac0ce0","observation_id":"8279db1b-2f6a-461b-b949-46621b2e2bb9","resolution":{"observed_at":"2026-08-11T11:48:07.189316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T11:48:07.191264Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.191264Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:dd0e3fa59264c73a041323648fd98bf67ece7010f9a56870b0418081e4f83a27","observation_id":"c7417c79-a758-4d7a-af3d-68c16309da6b","resolution":{"observed_at":"2026-08-11T11:48:07.191264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T11:48:07.193389Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.193389Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:a5f017ca38ee0ef5175e0ec294a8b258f91bcac8648e395bcc4cd7c08c82954e","observation_id":"cef6858c-35bc-46f4-8f41-19f74e14c841","resolution":{"observed_at":"2026-08-11T11:48:07.193389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T11:48:07.195569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.195569Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c5431e0da91d338e0219371ff96f615981af2bc84e281fdad41f4108b9448e77","observation_id":"96e9d748-0816-492a-909a-bb559c1a83cb","resolution":{"observed_at":"2026-08-11T11:48:07.195569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T11:48:07.197598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.197598Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c6db47972edffafd94028383de749e2097f1364577e8524e6843ce002068bcb4","observation_id":"6ec3c927-8318-4f6e-9ceb-87ba9fa6ae6d","resolution":{"observed_at":"2026-08-11T11:48:07.197598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.901690Z","title":null,"venue":null,"work_id":"6efe48b5-c8bf-4c2d-a4d0-b6d534ba1c11","year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.199634Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:df85a90f7775f09c7b0a89d7561bda87443fb8cfe40f0ce5742b7963bacfc118","observation_id":"caed6f36-bebe-43b8-9854-1642dccd3482","resolution":{"observed_at":"2026-08-11T11:48:07.904681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.201536Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.201536Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:311d92c5c49712ba02492bb11bcc560eb8669ef7856413e31d0eed94d91fd996","observation_id":"c9274df6-1dd0-4f2f-ab4c-c2e9eca1e918","resolution":{"observed_at":"2026-08-11T11:48:07.201536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-11T11:48:07.204032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.204032Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c5c7ee6038f4389744c1a184e2c7370f4442ed98e7d2cb14246233a50e7c008e","observation_id":"a9b6ac0b-271d-4707-9b02-efa9b456f11e","resolution":{"observed_at":"2026-08-11T11:48:07.204032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-11T11:48:07.207064Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.207064Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:aee5504bd2eee27d482ee719cfb1c9c8f359be900150d40ae63608cceea884bf","observation_id":"ea0ada39-3cd6-43c0-a629-3b7cd5c75c09","resolution":{"observed_at":"2026-08-11T11:48:07.207064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.468647Z","title":null,"venue":null,"work_id":"1af581bd-3775-4af7-9c08-78a292b1fd2a","year":2015},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.209868Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c927e2ea5266caaec54082c639fba8fa897fee883edc6bb53158be09193209b7","observation_id":"d6ecd06f-889b-4095-9958-d7e4bc40c222","resolution":{"observed_at":"2026-08-11T11:48:07.471391Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T11:48:07.212367Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.212367Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:e9be05b0bbf3942f2c3877e0d2ac987b9706f6fda4563a1fe4f9232b0e1f66f5","observation_id":"556e9dc9-89ad-4f62-bd1a-07b39e84537f","resolution":{"observed_at":"2026-08-11T11:48:07.212367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10787","last_updated":"2024-03-19T08:51:51Z","snapshot_observed_at":"2026-07-06T16:20:40.674175Z","submitted_at":"2023-09-19T17:35:16Z","title":"AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models","version":2},"cited_work":{"arxiv_id":"2309.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10787","snapshot_observed_at":"2026-08-11T11:48:07.362951Z","title":"AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models","venue":"eess.AS","work_id":"96be9e9b-1a1a-40b4-b3d8-54e8d81f7734","year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.215478Z"},"links":{"cited_paper":"/paper/2309.10787","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:1f45c4e26ddd3c7a3dbbc6c6af816a4d7deb9454619f5ccd67aa342acbbb8045","observation_id":"7d677305-df6c-43d0-a5ed-c76897f128eb","resolution":{"observed_at":"2026-08-11T11:48:07.367997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-10T11:36:03.411225Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-11T11:48:07.218794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.218794Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:6a1ef7a99c6688344325a85cebe06e39c7dbdfc3c87a6b8afc1ded0237dc781d","observation_id":"9cfbe0f1-63d6-407a-8981-1ef078e0e4a7","resolution":{"observed_at":"2026-08-11T11:48:07.218794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T11:48:07.222604Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.222604Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:15280e670ba91ee11b0d12a24bab29d86c7ad5e241e757cf67c0d44ece5133d9","observation_id":"0ce6ac81-ac32-4b5c-ac18-878f9ed0616d","resolution":{"observed_at":"2026-08-11T11:48:07.222604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08276","last_updated":"2021-05-23T09:37:24Z","snapshot_observed_at":"2026-08-11T08:00:04.375430Z","submitted_at":"2021-05-18T04:56:46Z","title":"NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08276","snapshot_observed_at":"2026-08-11T11:48:07.225318Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.225318Z"},"links":{"cited_paper":"/paper/2105.08276","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:27ca4a976e28c3a3b0934d1546788cc326892d92b6d284a694250a2a43f50a5d","observation_id":"a182f44f-cc8e-4c4e-b4c9-72f1d94c21d1","resolution":{"observed_at":"2026-08-11T11:48:07.225318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14899","last_updated":"2024-03-22T13:24:35Z","snapshot_observed_at":"2026-08-12T13:08:43.737014Z","submitted_at":"2023-06-26T17:59:55Z","title":"FunQA: Towards Surprising Video Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14899","snapshot_observed_at":"2026-08-11T11:48:07.228234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.228234Z"},"links":{"cited_paper":"/paper/2306.14899","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:8a1b4ee0e8d66dbe4bcfdc2677e7e33b38fd0e614191346b499da8c4f8b4c369","observation_id":"cebcaa12-1d22-47e2-9e6b-74f8d28985bb","resolution":{"observed_at":"2026-08-11T11:48:07.228234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.892799Z","title":null,"venue":null,"work_id":"2a7bba77-cc2b-478b-bd38-0b7455233ea7","year":2017},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.231041Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:7b88632ea8b6123d114b23397f2a4722e14a2966398e586863cc8ff0befd6aa6","observation_id":"22177569-1448-45b4-a04e-406c37531f4a","resolution":{"observed_at":"2026-08-11T11:48:07.895738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.233568Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.233568Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:a8bd6fe1d8b6141684cfa2e7bbddf4248749c595b217e86793e4e3ddf633f50e","observation_id":"543570b2-49ae-4006-8152-d932ba4c8155","resolution":{"observed_at":"2026-08-11T11:48:07.233568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-11T11:48:07.236231Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.236231Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:fa7993458ec343c2305879c5a892e3f2444df95eabae1dfcef2ccddaf7642d24","observation_id":"0e2f40d3-0671-4b39-95d9-7cfe102ba48b","resolution":{"observed_at":"2026-08-11T11:48:07.236231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14040","last_updated":"2024-12-30T09:02:53Z","snapshot_observed_at":"2026-08-12T08:01:43.221760Z","submitted_at":"2024-05-22T22:22:26Z","title":"Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14040","snapshot_observed_at":"2026-08-11T11:48:07.238929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.238929Z"},"links":{"cited_paper":"/paper/2405.14040","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:254af636c5bf15c3e9f56ac35ba599da69449726f14490d39a49abe0680f3d35","observation_id":"0db9eb1f-fce8-40db-ab3f-3c67398d39fb","resolution":{"observed_at":"2026-08-11T11:48:07.238929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15857","last_updated":"2024-08-28T15:18:46Z","snapshot_observed_at":"2026-07-06T19:07:11.892165Z","submitted_at":"2024-08-28T15:18:46Z","title":"What is YOLOv8: An In-Depth Exploration of the Internal Features of the Next-Generation Object Detector","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15857","snapshot_observed_at":"2026-08-11T11:48:07.241651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.241651Z"},"links":{"cited_paper":"/paper/2408.15857","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:4fa31af68e90efeb46270b7c737c89147d52c564a144e1bce8aec3bf3840b320","observation_id":"ee578662-6381-4d09-a55b-038b0767eb72","resolution":{"observed_at":"2026-08-11T11:48:07.241651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T11:48:07.244506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.244506Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:702b58d363a467379987363117b5d3f6fd227367e639539dbdbe4a7367c77e3f","observation_id":"3856e7d6-087c-4f6f-99e5-df0dc02fc371","resolution":{"observed_at":"2026-08-11T11:48:07.244506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.883839Z","title":null,"venue":null,"work_id":"030e12f8-e1fb-4b82-899a-e77a6a350292","year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.247202Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:8e199c90b58e402fae60653ac58e47fae4ef8b784b151d033ab8c4be31bad864","observation_id":"260020f6-a8cf-48d9-98b7-faa274e780c4","resolution":{"observed_at":"2026-08-11T11:48:07.887203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T11:48:07.249685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.249685Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:35411c84a02a7c396c7c97b04caa1ae475fa9096e763ba1c291ee4e633142bba","observation_id":"5325b058-cfc7-444b-8ad9-06d1bc24f3c1","resolution":{"observed_at":"2026-08-11T11:48:07.249685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06129","last_updated":"2024-04-15T21:10:37Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:59:53Z","title":"Distilling Vision-Language Models on Millions of Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06129","snapshot_observed_at":"2026-08-11T11:48:07.251910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.251910Z"},"links":{"cited_paper":"/paper/2401.06129","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:b2aa40626040ac62865c6598daa0ec573a9838456f6c6c891da40fbab6cc16f0","observation_id":"98f1a2a0-8a7a-4c6e-8f91-c50e1ee5aad4","resolution":{"observed_at":"2026-08-11T11:48:07.251910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T11:48:07.254058Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.254058Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:759001f2f33b1611a100f514263de068355e08c79e5090041aa10ddfd942edef","observation_id":"9afde8d9-d360-4f23-b161-c02b8ba82897","resolution":{"observed_at":"2026-08-11T11:48:07.254058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.256287Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.256287Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:382fed5afc913d35ed856b1401cab7fb203bd5b91aa932017d09b7ff5ea99763","observation_id":"e4705e8a-b71d-4bba-a84e-73e898a89bb1","resolution":{"observed_at":"2026-08-11T11:48:07.256287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.259130Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.259130Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:7308d5fd7bc1ec4d8926104991340b1dda1212178d4edbc59b5c453563bdc913","observation_id":"ce3b0de5-1f1a-4ee4-8842-fb92cebbe38d","resolution":{"observed_at":"2026-08-11T11:48:07.259130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:08:49.792642Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2412.14965."}