{"as_of":"2026-08-21T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b08ea3ecca5ce38424e8c44802d702c7858523d3245414014e7d2ae313c16805","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:59:13.619204Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.06182/citation-record","integrity":"/paper/2412.06182/integrity","json":"/paper/2412.06182/citation-record.json","paper":"/paper/2412.06182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.299656Z","title":"Intermediary-guided bidi- rectional spatial-temporal aggregation network for video-based visible- infrared person re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.299656Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:aa0c2108cf424a5ba1f84b7fc9e34e35da7a6ea5d2bd65867246e42971c48d0f","observation_id":"b76aa785-a8f7-40b9-9d24-9b0847fe086a","resolution":{"observed_at":"2026-08-11T19:59:13.299656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.304058Z","title":"Video moment re- trieval via comprehensive relation-aware network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.304058Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:157791dca67cb3613809bade96191b42a9cda4cca9ebcaf9a6fa3998417852be","observation_id":"03b84715-37a0-4f07-9597-baef3232868b","resolution":{"observed_at":"2026-08-11T19:59:13.304058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.308146Z","title":"Self-supervised adversarial video summarizer with context latent sequence learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.308146Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9fff49b7dedbadc4381663829e490a8951ba7e0cd976fad8cbcf442a96418390","observation_id":"3c3e072d-7723-4ee6-b14c-14fd0680d94e","resolution":{"observed_at":"2026-08-11T19:59:13.308146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.312043Z","title":"Complementarity- aware space learning for video-text retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.312043Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:60109be7c1dcde168b0f46d49c7a632c440985ada08a334591e898fefb681089","observation_id":"2c88bb87-0543-4ad9-8de1-7925763f3a63","resolution":{"observed_at":"2026-08-11T19:59:13.312043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.315626Z","title":"Moma-lrg: Language-refined graphs for multi-object multi-actor activity parsing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.315626Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:88c1d2963dd18dbb147e098ef8da983992c17ba6b3e44577beb6cc05031f16f9","observation_id":"157f858f-1c4c-4644-9cf2-07453d74dfcb","resolution":{"observed_at":"2026-08-11T19:59:13.315626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.319397Z","title":"Videoclip: Contrastive pre- training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.319397Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1bf2f29251822aaff9584cc671852f2f8e868e65e6959bc5d6b7e3c07fb34dad","observation_id":"3c5484a6-9cf2-4b62-8e17-7f1bf7c1b273","resolution":{"observed_at":"2026-08-11T19:59:13.319397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.323074Z","title":"Graph convolutional module for temporal action localization in videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.323074Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:36625bd537b5792e975900da9b5e28acf65611bc0d8fd16229e826eb8a2c4750","observation_id":"6ddc86b7-04cf-4c20-a1b1-d33e8b7c07ea","resolution":{"observed_at":"2026-08-11T19:59:13.323074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.326324Z","title":"Evcap: Element- aware video captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.326324Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:fdfaa94f885078dab43b6d97e7d31b14601cf3ed85e514356a724a5f349f9757","observation_id":"304fefc4-3b33-4afd-a4bb-1de82d73b17c","resolution":{"observed_at":"2026-08-11T19:59:13.326324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.329312Z","title":"Multi-granularity interaction and integration network for video question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.329312Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:74103629c3bb2dad49f2ebd7fa984ce8ac9e56bc11dc891f2e0b6ba72439f091","observation_id":"246b13d7-365c-4a74-bc4c-c0679c3f3802","resolution":{"observed_at":"2026-08-11T19:59:13.329312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.332350Z","title":"Video question answering with semantic disentanglement and reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.332350Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:4fd7984f5476fb02216772e1b2855881ad817ed8535cfec4a49bb1bf2f6dc909","observation_id":"106cebde-0324-45a0-808f-ff7265d0a44d","resolution":{"observed_at":"2026-08-11T19:59:13.332350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.335894Z","title":"Multilevel semantic interaction alignment for video–text cross-modal retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.335894Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:bb3b26b2c779acf98770fef218992e058a392a43a385082785d86082753af43e","observation_id":"548d2b2a-2e8e-473e-85f3-74925b113941","resolution":{"observed_at":"2026-08-11T19:59:13.335894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T19:59:13.339068Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.339068Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a578c139f93ac923a078db6f93cff4ac93f89b07654825230e6766083c3c2041","observation_id":"37202589-7b99-4879-8fac-b0d933076c10","resolution":{"observed_at":"2026-08-11T19:59:13.339068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.342311Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.342311Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9554fb2d3a6b77e25de61c6abdc83b2d2762e501925d8c34956f87c3da93a32f","observation_id":"bc909dc9-ba3a-4750-bbe9-39769e529306","resolution":{"observed_at":"2026-08-11T19:59:13.342311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-21T02:55:30.654002Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-11T19:59:13.345138Z","title":"Moviechat: From dense token to sparse memory for long video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.345138Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:974167d224614a1f3ac998148a874085b7db6a3beb31d94be5dc0e3f073e8f4f","observation_id":"f77b4e5e-7d18-4849-a028-b1c48563771f","resolution":{"observed_at":"2026-08-11T19:59:13.345138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T19:59:13.348682Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.348682Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ab84476a15e098d7d9035509fee3bdd27aedd33ebc767b9e26129b4640668807","observation_id":"831d8942-a346-4f40-9a3b-25cb57a1004c","resolution":{"observed_at":"2026-08-11T19:59:13.348682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.352109Z","title":"Language models with image descriptors are strong few-shot video-language learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.352109Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:541ec9ebd0562002df93611dfe1c6f5d17ae47ac0b04f14f4fc8445282f642e7","observation_id":"89fee407-103d-46cb-831e-8e19fb6d605f","resolution":{"observed_at":"2026-08-11T19:59:13.352109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.355176Z","title":"Compressed video action recognition with dual-stream and dual-modal transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.355176Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:330e1d2a72a6e4bb07a7af5df0a9132109ea4ce7e0cfc082c5090b7f13de7ffd","observation_id":"68e75ac0-42de-4cbc-8e57-69a8d3917f5a","resolution":{"observed_at":"2026-08-11T19:59:13.355176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.358243Z","title":"Dynamic spatial focus for efficient compressed video action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.358243Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:f837e25574d59aa955013250e539e0644864e8f5331cfcabd39150e8ce368ac4","observation_id":"ccab0104-9ecf-4506-8be1-da3f20434797","resolution":{"observed_at":"2026-08-11T19:59:13.358243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.361520Z","title":"Alignment-guided temporal atten- tion for video action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.361520Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7789dda1eddbb4b940e4c0eaaf4311781428261ecfc88658180b8c369602dbd5","observation_id":"5f1d5e46-a24d-44ee-88fa-eee4f7a9d064","resolution":{"observed_at":"2026-08-11T19:59:13.361520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.364500Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.364500Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:428f125e7b34eb01bd8bd3832232d3f8269129e7cb9593d0d39411bca3188ec0","observation_id":"787aab86-06d4-43a0-befd-c74f18c3aa3b","resolution":{"observed_at":"2026-08-11T19:59:13.364500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.367934Z","title":"Temporal distinct representation learning for action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.367934Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:fa33936e0692f73ec5beab740cf3c499d103f8e3941ab624b1b4942923671562","observation_id":"2071a66f-0e0e-4850-9335-33bc33a806d5","resolution":{"observed_at":"2026-08-11T19:59:13.367934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.371085Z","title":"Truncate-split-contrast: a framework for learning from mislabeled videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.371085Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:20dc04d37f5d99f9ccc88a743a9af65109b95a3fa94b341aa58275ffc2ac966c","observation_id":"3d99e65b-f375-4487-aafe-5d7a2e96741b","resolution":{"observed_at":"2026-08-11T19:59:13.371085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.374125Z","title":"Reading-strategy inspired visual representation learning for text-to- video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.374125Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c1a96f6dd9582f7c7e2e16b101137870505c1e5e72702f4768c5b72062723a80","observation_id":"de6591e7-2ab0-41c1-a586-ed130cdf71c1","resolution":{"observed_at":"2026-08-11T19:59:13.374125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.377335Z","title":"Use what you have: Video retrieval using representations from collaborative experts,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.377335Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:aeb77b7e1a95459bff2adbd8ebb2a4463ac9b7a397491ba0f2dd93c645dc2f65","observation_id":"903fe238-f9d2-46cb-89ec-7c40649e1aff","resolution":{"observed_at":"2026-08-11T19:59:13.377335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.380823Z","title":"Dual encoding for zero-example video retrieval,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.380823Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:34a5032b28c2ea9b6eb25cc52efae7f5a4180f2679e02818038155bfe846e4f6","observation_id":"881de220-95ef-413a-8ee8-773a53b9718a","resolution":{"observed_at":"2026-08-11T19:59:13.380823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.383984Z","title":"Locvtp: Video-text pre-training for temporal localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.383984Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:bb1cdec8b1566ddc186333a9d87ccf382fdacfcb60a2cba7dc0003a6d1d56c23","observation_id":"61a2a580-296b-4df4-bf20-aff3036720a2","resolution":{"observed_at":"2026-08-11T19:59:13.383984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.387374Z","title":"Breaking winner-takes-all: Iterative-winners-out networks for weakly supervised temporal action localization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.387374Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:f0339b4db20ea3d3a2d2635b6a23b910faafab04cc3228a230f5012f65ecbdae","observation_id":"adad5951-16a8-4bfb-83c9-20e48977a0a0","resolution":{"observed_at":"2026-08-11T19:59:13.387374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.390767Z","title":"Cross time-frequency transformer for temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.390767Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:bc7682dd147864bc82b9499fb32419a56127875f202c8bfef068a6905fbb52b4","observation_id":"8c562c82-db62-4be2-bd76-c3c12052f130","resolution":{"observed_at":"2026-08-11T19:59:13.390767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.394100Z","title":"Slow motion matters: A slow motion enhanced network for weakly supervised temporal action localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.394100Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a0f48984b39335e98520fe41d8d66df44ec5247e30697dd42eea35b4856425bd","observation_id":"1740bebf-8852-4dcf-87ce-0ac1d1bf3b23","resolution":{"observed_at":"2026-08-11T19:59:13.394100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.397280Z","title":"Long-form video- language pre-training with multimodal temporal contrastive learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.397280Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8e7ffbeb1a979275e1ae0ce2949652646c234128f1adb14fdc18f4df785fcc8e","observation_id":"ce42a0f6-b6d2-4169-a8d3-cbee63e055e4","resolution":{"observed_at":"2026-08-11T19:59:13.397280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05143","last_updated":"2019-10-13T09:44:11Z","snapshot_observed_at":"2026-08-18T09:03:53.826419Z","submitted_at":"2019-05-13T16:57:40Z","title":"VideoGraph: Recognizing Minutes-Long Human Activities in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05143","snapshot_observed_at":"2026-08-11T19:59:13.400389Z","title":"Videograph: Rec- ognizing minutes-long human activities in videos,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.400389Z"},"links":{"cited_paper":"/paper/1905.05143","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c15c1f49eeaac30d5a4377beba28de944bf69219bb76237ffec78df3ef66e2d0","observation_id":"4320506b-7c55-417b-ad3d-d9a5b657c202","resolution":{"observed_at":"2026-08-11T19:59:13.400389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.404329Z","title":"Supervoxel attention graphs for long-range video modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.404329Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:11c0a2c0e34de9eb093435bce98bb28f837ea47c4cdc52c91872cf2b925c453d","observation_id":"be66552c-aac9-465d-a353-7201b08941d3","resolution":{"observed_at":"2026-08-11T19:59:13.404329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.535884Z","title":"Long movie clip classification with state-space video models,","venue":null,"work_id":"8ff9628b-e955-4481-ae17-e9170c15fba8","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.407515Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8c1e1fbb0bd60a620131772edc5c3dda3b8e842ae7ebe5e2f958d7883a019a8f","observation_id":"0c772c00-a4df-49fe-a93a-02cc99cf828f","resolution":{"observed_at":"2026-08-11T19:59:14.539583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.524986Z","title":"S4nd: Modeling images and videos as multidimensional signals with state spaces,","venue":null,"work_id":"717780ae-d961-412a-a941-2728c5ad36e5","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.410492Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:38afe331c501da66c7024f40602e061e7ea680b8805d984329222f0953c306cf","observation_id":"be7e0557-c7f6-41d0-93a9-e7b5db8f2549","resolution":{"observed_at":"2026-08-11T19:59:14.528911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.514059Z","title":"Selective structured state-spaces for long-form video understanding,","venue":null,"work_id":"1d19c1f2-0403-4839-a579-af0859461ee4","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.413725Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:d0138cfc8b9c257bd96ba8df2afd8e12af6467ecbb38c74c479b0c1a0b04642d","observation_id":"6a883042-e723-4ce8-8dba-bfb316fce0f6","resolution":{"observed_at":"2026-08-11T19:59:14.518072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.503428Z","title":"Efficiently modeling long sequences with structured state spaces,","venue":null,"work_id":"4294919c-575d-4b8c-a377-dc33be95735e","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.416851Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9fd6bbbb1488fa3d2989c43c17a2809d859f07467afb3592a13024c0dbd0f355","observation_id":"3c55eb5c-84ae-440d-ba0d-78efe043e69b","resolution":{"observed_at":"2026-08-11T19:59:14.507046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.491590Z","title":"Mgsampler: An explainable sampling strategy for video action recognition,","venue":null,"work_id":"e8b14dcf-157e-49de-a512-15a6e12198d5","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.419845Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2139c57776bd7a5748da1446293ca1ceda0edfd4113e5b5d5d809a79b9c07b4a","observation_id":"b707d111-080e-4719-841a-d0e10ae281ac","resolution":{"observed_at":"2026-08-11T19:59:14.495316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.481133Z","title":"Adaframe: Adaptive frame selection for fast video recognition,","venue":null,"work_id":"b254373f-2e48-436f-8787-b99342eac264","year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.422737Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c4c2bf2530b725df77c714cfa6fdf3e7d9543bc71de58a667b72a856d8d5a908","observation_id":"ec1f12c2-12fd-4792-8e34-5910efa98bbd","resolution":{"observed_at":"2026-08-11T19:59:14.484590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.470887Z","title":"Localizing moments in long video via multimodal guidance,","venue":null,"work_id":"9837551b-222d-4240-ac26-ddaf0abbe9e1","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.425583Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3cf994bc703f2f77502d49a6aeb41d7e20f07839130b8f179dbd73d8a8aff9fb","observation_id":"7e4b57c6-eef4-4842-883e-935ad5c79ac4","resolution":{"observed_at":"2026-08-11T19:59:14.474385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.459878Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions,","venue":null,"work_id":"21fae1ea-9528-4a5d-8a5e-8ada889a302b","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.428711Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:49720ec1a87d9123e6b43517ddb3669b76aed24f2c535a7e49abffd15d1300f8","observation_id":"00a45254-eb61-4d1d-bec5-d4f60dcc6e25","resolution":{"observed_at":"2026-08-11T19:59:14.463310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.448651Z","title":"End-to-end learning of visual representations from uncurated instructional videos,","venue":null,"work_id":"ae9797e6-ac6a-4a74-bbf2-b0c7579aaa2e","year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.431718Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:0a46ce25632c79c1b4df333ac1aa9274de6be452f0bdd18f131438afbbbd6c43","observation_id":"97ae6fcd-5ebe-4097-9584-57e18ee9b50e","resolution":{"observed_at":"2026-08-11T19:59:14.452622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.438111Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":"e4fe6a5d-0416-4293-8243-9e47fad6a580","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.434656Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ecc186f542913371121f0eb686f9ca0d4fed74057913554b5ed121396ac7d9d1","observation_id":"bf90c54e-8f4c-4c1e-81b9-45c03751ff83","resolution":{"observed_at":"2026-08-11T19:59:14.441521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.428101Z","title":"Scaling up vision-language pre-training for image captioning,","venue":null,"work_id":"af8ec1f3-31c9-473a-934e-18529a69a8c0","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.437890Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:774f493c20778775c6ff933ad29c21baa39d8671134e293fb354633b339165cc","observation_id":"8a745a5d-ad95-4236-9c48-2f872ed5b492","resolution":{"observed_at":"2026-08-11T19:59:14.431524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.416683Z","title":"Gbc: Guided alignment and adaptive boosting clip bridging vision and language for robust action recognition,","venue":null,"work_id":"407cdacc-f444-4fde-8be4-cc4fd871b0bc","year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.440965Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2994b934485e37b0e880e7eec924df53ad7ea19284b4697836a546beb5841481","observation_id":"6ded8614-ee68-4727-827a-9f20bc76284e","resolution":{"observed_at":"2026-08-11T19:59:14.420598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.405491Z","title":"Unsu- pervised pre-training for temporal action localization tasks,","venue":null,"work_id":"c0b93cf1-74d2-45a7-a545-3282c20d14f0","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.444160Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:04b952f9fa08a17291d17bbd7f34595d21d3062a4dcc1d3ab52db7844f4b932e","observation_id":"8170842f-9f6f-46c9-b9a9-151258bcb288","resolution":{"observed_at":"2026-08-11T19:59:14.409107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.393789Z","title":"Clip4clip: An empirical study of CLIP for end to end video clip retrieval and captioning,","venue":null,"work_id":"37f80063-e074-48bb-aa6b-6717cbc0738e","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.447486Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1d885a5f174feb99046d02bcf87a1fc1212e1344090b32f59a44b1395d17fcb9","observation_id":"548090d7-eebb-48e5-8077-948385896a68","resolution":{"observed_at":"2026-08-11T19:59:14.397729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.450578Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.450578Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:6e207b4a64555051d1dca2da3c2200ddf1959c0b6df907960460586e582ef0cc","observation_id":"7d6a0576-d691-432a-9b02-92d48310de48","resolution":{"observed_at":"2026-08-11T19:59:13.450578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.375808Z","title":"A survey on video-based human action recognition: recent updates, datasets, challenges, and applications,","venue":null,"work_id":"e33f4669-16ef-4bd2-845b-0715eeb5b213","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.453369Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:547c15c696f5a7d59bbe2e9ccd59867389b0874cd3189831c79c57063c864cd5","observation_id":"986671f5-f4f9-4321-aa71-3a98f247ffa4","resolution":{"observed_at":"2026-08-11T19:59:14.379512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.365112Z","title":"Lavender: Unifying video-language understanding as masked lan- guage modeling,","venue":null,"work_id":"927c0c8d-a903-4d89-9655-548c13ecb24d","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.456277Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7f5236555cee21e88e0f943f69f11041fe5927e10ad59b1d4591a951a44788eb","observation_id":"2081cbe2-ef2e-4b4b-80e2-26cf5f84a614","resolution":{"observed_at":"2026-08-11T19:59:14.368806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.354658Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre- training,","venue":null,"work_id":"e5ee7018-d778-4df1-9ea9-58597c9d0d96","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.459592Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8a6240cf7f7cc08f0ba4889d2cc2cb353cb1ef26b589a350ce650d915eb324b7","observation_id":"be59d67c-e8a0-4cc3-b078-0cf00140ee16","resolution":{"observed_at":"2026-08-11T19:59:14.358415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.344228Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":"884c3d84-7ec8-49fe-962e-8953ff7a24ed","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.463104Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a8f3582781da5f0a8c87dc804e3c4289eef331140903c717d76e939236374c58","observation_id":"a6411d7e-81c2-46b2-9290-6155fde763eb","resolution":{"observed_at":"2026-08-11T19:59:14.347902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-19T08:26:21.316086Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-11T19:59:13.466341Z","title":"Violet: End-to-end video-language transformers with masked visual- token modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.466341Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2a282270e80f867204bc9dff6c792d6897b20fe22dc8d431838e0dfe9a5039e7","observation_id":"a7316983-e468-4d51-9030-b1592160bf1b","resolution":{"observed_at":"2026-08-11T19:59:13.466341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.332723Z","title":"All in one: Exploring unified video-language pre-training,","venue":null,"work_id":"873686c4-020a-4d63-ac40-9b83f2c960b6","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.470172Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:53fb18067c8cbb0a6dae65cdd06d030e62bceb72f53d406de71b6fa3d65d33b9","observation_id":"ba31b6c5-0eb5-4468-a395-30e98376d61e","resolution":{"observed_at":"2026-08-11T19:59:14.336103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T19:59:13.473248Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.473248Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7f37676552fcaad3f3cbbc01f95d4d8f4e102ce4ee54f400ce7f218d65ab9eb3","observation_id":"69b91bbb-8d7a-4fc6-9e55-b0d424f983e9","resolution":{"observed_at":"2026-08-11T19:59:13.473248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.322579Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":"70352bf4-0379-40e1-904e-77060e6dd63b","year":1901},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.476828Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:237f4490ef52b9002523a1f0e594e6e4d65e37ef8bbd854e7b07a5f3c6ed00a1","observation_id":"03d1f286-a7fd-485c-9b5e-b3d8dbeb4c64","resolution":{"observed_at":"2026-08-11T19:59:14.325979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.311479Z","title":"GLM: general language model pretraining with autoregressive blank infilling,","venue":null,"work_id":"a6d30782-2ca3-4650-a265-ad7c59493b5f","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.480137Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a40eff8b8c101b8ea32712fa150b18eba513b15b3d54058d2cb265ab91ceac5d","observation_id":"98458942-a666-484f-8f2d-3d651a394c1b","resolution":{"observed_at":"2026-08-11T19:59:14.315557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T19:59:13.483476Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.483476Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:cb110111774bae8a754ff7aaeec2629f67a5a033c67c0eafc7c96be7b687ae11","observation_id":"c8db19b9-f461-438d-9453-3f5b81894773","resolution":{"observed_at":"2026-08-11T19:59:13.483476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.299786Z","title":"MIST : Multi-modal iterative spatial-temporal transformer for long-form video question answering,","venue":null,"work_id":"b0986fba-b14d-48a1-8000-f5aaa54fbf29","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.487191Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e7d104c2c64ed63383f14881caee5a3a9cb481e9bad80f67cc9040ca239894e4","observation_id":"b41f2851-7240-4be8-bf5a-73bca0b77d97","resolution":{"observed_at":"2026-08-11T19:59:14.303595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.287132Z","title":"A joint sequence fusion model for video question answering and retrieval,","venue":null,"work_id":"a5c322cf-50f3-4e22-b324-49cd0b54ea47","year":2018},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.490546Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:709e2ee9bc2e63c1a9dca3faffca7607938754b7be6a138c1a18b32bd88e0398","observation_id":"cd159143-971a-4beb-bada-fac3eb9a60c5","resolution":{"observed_at":"2026-08-11T19:59:14.291561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.275670Z","title":"Video question answering via gradually refined attention over appear- ance and motion,","venue":null,"work_id":"e292e685-9512-45de-8dde-97f75e03c1dd","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.493599Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:962fb028d4c3e4466f7eab465c59d5f8834439f289c2a03efd52d7ea9650f936","observation_id":"d2387de6-656c-40f1-ab0f-432ba582b063","resolution":{"observed_at":"2026-08-11T19:59:14.279595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.264691Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":"d46bce87-ab37-45d0-973e-b90286b8e856","year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.496737Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7f98e1d2cc9d62b91e10d1bb8814044cb453d2df1bd08be159bbcc979845b1ac","observation_id":"bff493ec-b099-46b2-b64f-2e3d8539f224","resolution":{"observed_at":"2026-08-11T19:59:14.268566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.253064Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning,","venue":null,"work_id":"dfa11f9d-794a-4b85-8f13-5cadc4a3a78a","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.499776Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1138e407a6a6b36fa3514b7aa4e2c01c9e524034212da017e232a6b39838ec68","observation_id":"522cb6ed-6d9f-4a78-8400-76f8bf6ab18e","resolution":{"observed_at":"2026-08-11T19:59:14.256936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.241214Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":"56175a85-afdf-467b-8a99-0b8a4d3d7e47","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.502597Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ea83d34d1ab4ded0d1ac860b7ee6343b112221f716153ae646ec3183265af691","observation_id":"08ad18dd-0240-4738-ae53-f7bf796daec9","resolution":{"observed_at":"2026-08-11T19:59:14.245299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.229610Z","title":"Dense- captioning events in videos,","venue":null,"work_id":"eb58649e-fec4-4f2a-b2b0-407a87c042b7","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.506128Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ea79f7673480649c572e49a80d57d92182ba6ada99d929cc523499a0a0720f7c","observation_id":"7cadfdc3-52c4-4d92-8868-78f9cb26701b","resolution":{"observed_at":"2026-08-11T19:59:14.233671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.217928Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"0be9bf47-e660-41a5-b0c9-8c5859cdd459","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.509171Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:43ca02dc7c998460f3a9985e953f258cf861c5740320445e3e854078915cd530","observation_id":"df2e5754-c242-4eb4-9377-621b106bdf0f","resolution":{"observed_at":"2026-08-11T19:59:14.221672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T19:59:13.512195Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.512195Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c56ec08884bcab57d1bd377486741c34a49c1956d6d99698254b90f37a327dc8","observation_id":"0f9707f9-ad5b-47f5-9be7-fc6146ad7ac3","resolution":{"observed_at":"2026-08-11T19:59:13.512195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T19:59:13.516220Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.516220Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1182f21c3c49b729ce10908beb0416110032d116b68d88b4596e1307261b88b6","observation_id":"447ac7d9-1ccd-48aa-8c0b-d5ab82159b1f","resolution":{"observed_at":"2026-08-11T19:59:13.516220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.206314Z","title":"Pyscenedetect,","venue":null,"work_id":"825b4b29-d20a-42aa-90a2-b0014895f323","year":null},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.519600Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:48abfddc7e8f984ae465f3a0fcdb03cce69299db2f471e633bcb952bd05ba5d4","observation_id":"ebac29eb-40df-406a-84f7-88fdeb1499aa","resolution":{"observed_at":"2026-08-11T19:59:14.209964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.193811Z","title":"Decord: An efficient video loader for deep learning,","venue":null,"work_id":"9a4c2a4a-5413-44f9-9a24-45bd38d56a65","year":null},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.522639Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2373143c23206b98ee987a124ca1f740c65330b84604b54e6066bdb787d1a0d8","observation_id":"4b1ddd92-00f5-44b7-9f41-36cc95970907","resolution":{"observed_at":"2026-08-11T19:59:14.197450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.525872Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.525872Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:162decec77f48afefa9d5a254d29f780983c5bfc467206c4e778d9fd095c11f4","observation_id":"f11bf45d-6f12-488f-b4fd-81bd7de680d8","resolution":{"observed_at":"2026-08-11T19:59:13.525872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.175717Z","title":"DINO: DETR with improved denoising anchor boxes for end-to-end object detection,","venue":null,"work_id":"18cdab89-cef4-474b-bba9-b05c5da89479","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.529027Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:5f6dd75afb358c8a2d8d2e83a6e19d2c5a43ff86c050fe8f43864501b9e53ba0","observation_id":"d5849239-8def-49a6-a4c3-cd867a0ed0b8","resolution":{"observed_at":"2026-08-11T19:59:14.179339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.165004Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":"1619cceb-c3a8-449c-83a0-6f1ccdf21f90","year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.532056Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:beafc23e3d737535d9574dcbafacca238f6ee6519c3d85c2182bdc9c343c3c91","observation_id":"ee5186e6-8829-4917-80a0-799e771344e1","resolution":{"observed_at":"2026-08-11T19:59:14.168721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.154991Z","title":"Partially relevant video retrieval,","venue":null,"work_id":"44d35440-f869-4804-be74-934f13c44e83","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.535135Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e228c5a5276aad2457da043549deaf0ef364c2d393ddde6b8618c11ac57eca16","observation_id":"11655f67-fe3d-4ae2-a455-a70c149ca17b","resolution":{"observed_at":"2026-08-11T19:59:14.158363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.143713Z","title":"Joint searching and grounding: Multi-granularity video content retrieval,","venue":null,"work_id":"8ca65093-f6f3-43c8-8054-8580d35c8f20","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.538757Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:953d39ffd89016e7b0cc26d7e8623fa6e0dd58fbedcacd0d9c9d7b75b97bc27c","observation_id":"5a466a5f-d901-4c80-88a4-acaad7416c99","resolution":{"observed_at":"2026-08-11T19:59:14.147009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.133030Z","title":"Hit: Hierar- chical transformer with momentum contrast for video-text retrieval,","venue":null,"work_id":"0aa99d95-e06a-47cb-9e8e-e0fcdfe61c45","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.542232Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:73806e7eeb216daaaca63d5794f7f5c72354d5660515f0898c11b1241bc3fc7b","observation_id":"bef96942-deb3-4b17-ad8e-b537412a17ba","resolution":{"observed_at":"2026-08-11T19:59:14.136686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.122845Z","title":"Multi-modal trans- former for video retrieval,","venue":null,"work_id":"384d36ff-ed58-4d50-922a-428e394f95eb","year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.545156Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:305074ef83ec36d0c5bf05afdf088b21d262b389e57070e5e0bced50740af2b5","observation_id":"619faa62-256d-4b58-b41f-2d23bc20fbff","resolution":{"observed_at":"2026-08-11T19:59:14.126362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.112357Z","title":"Cross-modal and hierarchical modeling of video and text,","venue":null,"work_id":"afab3826-4d2a-4315-9e37-6ab789d1301f","year":2018},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.548293Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:69de350e9bba02265316bd6a1a29cd78ee59c9113113433ccc9fcd9f98003df2","observation_id":"818e37cf-5c0d-4737-b57a-81c6e1766cc0","resolution":{"observed_at":"2026-08-11T19:59:14.115696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.102293Z","title":"Eclipse: Efficient long- range video retrieval using sight and sound,","venue":null,"work_id":"071f21ff-5751-4d67-952d-d97d9e98af98","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.551159Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ad57fc72d1dec500e0c65d4e755837857688d37005d627924047463a85fab7d3","observation_id":"05a59bbb-5df8-486d-91ba-046535002610","resolution":{"observed_at":"2026-08-11T19:59:14.105621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.092528Z","title":"TALL: temporal activity localization via language query,","venue":null,"work_id":"1cea8595-f0d6-48a1-ac44-671373b0fa10","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.554216Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e884a4b821d8f55d9d3f8c5bbd060df5a9556a1e2548cc1ba8943cfc39ba9c6a","observation_id":"7750a39d-77a5-481a-9aa4-1712f209efa4","resolution":{"observed_at":"2026-08-11T19:59:14.095823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.082707Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding,","venue":null,"work_id":"c06a94a6-88fa-469e-ad92-f035aec76e99","year":2016},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.557624Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:205e057101c47f7369eb5c7c7c535cbbac67da46473b788eee9399b6d6c331ba","observation_id":"f586d4ae-e6cc-47e5-8c52-ee0c3c2a2acb","resolution":{"observed_at":"2026-08-11T19:59:14.085989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.072616Z","title":"MSR-VTT: A large video descrip- tion dataset for bridging video and language,","venue":null,"work_id":"50f6b602-0a0d-40c0-bba1-f83d116e7b35","year":2016},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.560460Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8a9295014688eb926205a915739e6ad41769651ecd18f0fcfca775a2bec31db1","observation_id":"2c271b89-00d5-48d8-ad34-618c428d11a8","resolution":{"observed_at":"2026-08-11T19:59:14.076134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.062789Z","title":"Question generation via overgenerating transformations and ranking,","venue":null,"work_id":"acc79760-d064-40e7-96f9-7cc096c28014","year":2009},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.563116Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:fc44441465e6d8683fa1e35e093ce6d13cdd8d112889ea4a5ad5164d8ac428d7","observation_id":"f42f821b-3b50-472a-875e-c61b44477382","resolution":{"observed_at":"2026-08-11T19:59:14.065916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.053628Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":"da6d04c1-a76a-4e62-8a1f-eefa7e7d6d16","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.566380Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:d52ab80451a6f5c9f407eb2f3f9d5174516d002f79f5ee809d15c104ba54c145","observation_id":"b12f594c-664e-4e6a-b75c-8f8707ec5244","resolution":{"observed_at":"2026-08-11T19:59:14.056879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.043815Z","title":"Ego4d: Around the world in 3, 000 hours of egocentric video,","venue":null,"work_id":"cc5136f1-fcaa-4f76-addc-5d78801daf43","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.569192Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:876358cc4748cb6904c534dfa7dc8e8240a4b66ac2d983f7ec5fb21c37c42c87","observation_id":"4a7c3694-66ff-4de1-bb2f-002d1f1b1d72","resolution":{"observed_at":"2026-08-11T19:59:14.047172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.032995Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"62687e87-1cd3-4b30-93bf-321991198d5f","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.572112Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:36772cce6e734d0e5420350ddd08a8416e2cbd9f8ad6e744ba47ff04e6ae280f","observation_id":"884ac27b-36fd-4ab8-9bcd-0063a955b8f8","resolution":{"observed_at":"2026-08-11T19:59:14.036272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.023586Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"1e8a2ab2-867c-43c2-9e36-5a498877b8b3","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.574991Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8fc8ee16762eb5f2dcefa2175312e38ffbe4c7f7d8b5a8ad15108858e1f1e4fd","observation_id":"22780f74-4a8e-43b9-8b2e-19825e63da4e","resolution":{"observed_at":"2026-08-11T19:59:14.026777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-11T19:59:13.578033Z","title":"Judging llm-as-a-judge with mt- bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.578033Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ba6aa9464201a7b65f1231f9c00eea8bbe37fc8e00314d030a2e504f95844f69","observation_id":"de50226d-8903-4b14-bd41-818fd009af55","resolution":{"observed_at":"2026-08-11T19:59:13.578033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.013742Z","title":"Sharegpt: Share your wildest chatgpt conversations with one click,","venue":null,"work_id":"df73e5f3-a629-435e-9214-540f5e7bd0b2","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.581465Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:247d0543dd305ec2202b1782a3c4ff8bebd71693454f8fda95f145e3550bf18b","observation_id":"3b77bdc2-774f-4302-b3fb-3a29b29d2bd5","resolution":{"observed_at":"2026-08-11T19:59:14.017304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12871","last_updated":"2024-12-31T07:56:13Z","snapshot_observed_at":"2026-08-19T11:03:33.971184Z","submitted_at":"2023-09-22T13:52:42Z","title":"AnglE-optimized Text Embeddings","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12871","snapshot_observed_at":"2026-08-11T19:59:13.585145Z","title":"Angle-optimized text embeddings,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.585145Z"},"links":{"cited_paper":"/paper/2309.12871","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:99e164d12df3d4480216d02147d1b1f26508957d3d39a13fd28af7cceed100a5","observation_id":"4e65467a-9dc8-4212-b7e0-f05e6b940993","resolution":{"observed_at":"2026-08-11T19:59:13.585145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.003850Z","title":"Video corpus moment retrieval with contrastive learning,","venue":null,"work_id":"09719421-5afa-4d30-b696-2fd449058c18","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.588390Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3964e20177a1708966538b0b1cc364b1f15fc2f9b6efbd6ea4f7f380c2fb7593","observation_id":"7be46fc4-02ac-4d22-af5d-02c447adc113","resolution":{"observed_at":"2026-08-11T19:59:14.007278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.993692Z","title":"TVR: A large-scale dataset for video-subtitle moment retrieval,","venue":null,"work_id":"ea957618-d54f-42a2-8ea2-4543e10e4255","year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.591759Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:215c296bfd93d775465f1ec2c2668e9b5e408103910130f1e0a0b764b737f617","observation_id":"8875e9a0-e7ed-4f2b-9067-a3ebc767d51c","resolution":{"observed_at":"2026-08-11T19:59:13.997127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.983474Z","title":"Dual learning with dynamic knowledge distillation for partially relevant video retrieval,","venue":null,"work_id":"bd72c90c-5908-4dd9-9343-33c3cb36e829","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.594774Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:20f0b8012a3479e49e692ccaa7f49892b89805c5ddea1f3ae245de8dd599d80d","observation_id":"3aeba3ae-12b5-4ea8-96d3-233932ff55b5","resolution":{"observed_at":"2026-08-11T19:59:13.986868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T19:59:13.597852Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.597852Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:493d9c3f6e5f082a163354bdd49208f8ee2ae98d9e2fa9a737477530867ef947","observation_id":"f92a385a-4186-4f2f-af3c-81ae0c0f3a94","resolution":{"observed_at":"2026-08-11T19:59:13.597852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.973213Z","title":"Just ask: Learning to answer questions from millions of narrated videos,","venue":null,"work_id":"f4841f0f-f34a-46bb-99ac-f6c66040aa8c","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.601448Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:ea76f0d056b55d6dcdfdec4de5b5102b91459f47bfb39e4e3fb1e20972e78993","observation_id":"ab79c81a-42d1-4f97-aa46-be999033b701","resolution":{"observed_at":"2026-08-11T19:59:13.976799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.962522Z","title":"MERLOT RESERVE: neural script knowledge through vision and language and sound,","venue":null,"work_id":"dac5bd75-dce6-495f-9563-9f9eb45e08e4","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.604459Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:6f0458b5547fb83cc567388e86c7850643d3c3c38634359767f9d47953b8d664","observation_id":"2528ebbc-87f5-4143-8735-33589eb2ea56","resolution":{"observed_at":"2026-08-11T19:59:13.965769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.952274Z","title":"Zero-shot video question answering via frozen bidirectional language models,","venue":null,"work_id":"cc3b17ec-c2cb-41e3-8af6-121af92d3d7f","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.607548Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7aa634bf8614588f7c401d4a8a6a4989c33e2f3dacc95dae8b6e7e0f1ccb929f","observation_id":"cf7169bb-7386-4afe-a9d6-dd790f1767c7","resolution":{"observed_at":"2026-08-11T19:59:13.955780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.940626Z","title":"Hitea: Hierarchical temporal-aware video-language pre-training,","venue":null,"work_id":"a14efe9b-137c-47f9-8a48-456f9db39635","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.610461Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e9cd2cae66cd36ef7e0812dc42773af2e2d8f3e3ee519872ba3feabbe3350270","observation_id":"921d8ba2-5ff9-4525-8263-44a3a5f22613","resolution":{"observed_at":"2026-08-11T19:59:13.944568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.929228Z","title":"Self-chained image-language model for video localization and question answering,","venue":null,"work_id":"d544c7b1-c8ee-4a7b-a2a0-82ba13537547","year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.613053Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:225bd1e1e335fcf30debe846f3e071a8fdc63ff6c23021aed0e9e719ad4866c5","observation_id":"0e4515bd-6b0e-47f2-80a4-eff5f7432f4b","resolution":{"observed_at":"2026-08-11T19:59:13.933048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.918676Z","title":"Memory consolidation enables long-context video understanding,","venue":null,"work_id":"50ef2c66-0bd8-422a-bced-97ec8f5d593d","year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.616348Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e3e3d7bb84d60de0420547ba44da6fb0ff7846d1b00b99dc050c16bd763d9bda","observation_id":"22431014-9daa-4649-902f-4214ea607eb1","resolution":{"observed_at":"2026-08-11T19:59:13.922071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T19:59:13.619204Z","title":"mplug-owl: Modularization empowers large language models with multimodality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.619204Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7c650a2c65b2ecfea61318e511c72388ae4f3892712ac05b1be80be5ee8e7a10","observation_id":"8f5f7710-bbd0-4204-ab66-f4012eaf31af","resolution":{"observed_at":"2026-08-11T19:59:13.619204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T18:30:42.925096Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":57},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 0 inbound Pith citation observations for arXiv:2412.06182."}