{"as_of":"2026-08-18T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c96877a5d4d218306bbf8e2fc57197215d9a807bdb26f1863fc4648220cd4963","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:44:54.926584Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10720/citation-record","integrity":"/paper/2412.10720/integrity","json":"/paper/2412.10720/citation-record.json","paper":"/paper/2412.10720"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.753530Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.753530Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:e8a90c750ea1cbfde329a7f0424c158ea26a1074a1cd60a66ec7449616067d42","observation_id":"ee7622d1-5dfa-46c8-9bb8-a4d93a8bba3e","resolution":{"observed_at":"2026-08-11T15:44:54.753530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.766203Z","title":"Triple sequence generativ e adversarial nets for unsupervised image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.766203Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:80f94631203a4b2baf96cbcf846b9a61ccd94a6eb5f63e62fd15e090fb4b7d5f","observation_id":"7a630dca-16d1-4102-86e9-6628a724d1ca","resolution":{"observed_at":"2026-08-11T15:44:54.766203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.778107Z","title":"Sketch storytelling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.778107Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:9574bc9f3cb7ed69a9ddc753eaa3031af63adf0e07432d77c6ff2187ea95a31c","observation_id":"1f7f8107-574d-4ca9-9461-74136da45bf9","resolution":{"observed_at":"2026-08-11T15:44:54.778107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06499","last_updated":"2025-02-15T10:01:13Z","snapshot_observed_at":"2026-08-16T13:44:27.529222Z","submitted_at":"2024-06-10T17:34:24Z","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06499","snapshot_observed_at":"2026-08-11T15:44:54.791036Z","title":"Narrativebridge: Enhancing video caption ing with causal-temporal narrative,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.791036Z"},"links":{"cited_paper":"/paper/2406.06499","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:82259b15a3756e84b1a7dbfbe22ddea7ca8f4c1f59cd86624977f92ba6a09389","observation_id":"4b1fbd5f-e1eb-4d48-860b-c6adca70a371","resolution":{"observed_at":"2026-08-11T15:44:54.791036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-16T23:35:13.699991Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-11T15:44:54.799390Z","title":"Rethinking visual de pendency in long-context reasoning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.799390Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:3ca73ca95e9daf8cdcb85e23943d07d5c46a217bf8fa015b0ae89297d71e71cf","observation_id":"1b0f9cdd-c751-4ab1-b6cc-6445be56d32c","resolution":{"observed_at":"2026-08-11T15:44:54.799390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.803663Z","title":"Visual in-context le arning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.803663Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:e3853bbec7c491324a025ea781e8a66941215d102ebb12c2ae1a0c577521361b","observation_id":"e0fda45c-3af6-47f4-b2b8-6419469532d0","resolution":{"observed_at":"2026-08-11T15:44:54.803663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:44:54.809836Z","title":"Are we on the right way fo r evaluating large vision-language models?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.809836Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:d25337ec5bf5df25064155a544cb604bbb3bb36e278d1542a47d68e309cf0992","observation_id":"421e803c-170a-4b62-bd17-366913b0296d","resolution":{"observed_at":"2026-08-11T15:44:54.809836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-16T13:43:39.938123Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T15:44:54.831133Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.831133Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:7833baa37156a17d9c8d804edf923649b8286c8cf79ad6bb16b40b486b28c9da","observation_id":"4e582af8-2a10-421e-bb8c-385d906994b7","resolution":{"observed_at":"2026-08-11T15:44:54.831133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:56.023363Z","title":"A su rvey on multimodal large language models,","venue":null,"work_id":"a1f8e340-2dd8-465e-8aca-ef141556a803","year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.838345Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:da18d2fc4eb708b755e914f4bcf72e8fb2850e046fbeb430439a3bb538a20572","observation_id":"fc0a0539-7834-4bc9-850e-c2416b0f0f81","resolution":{"observed_at":"2026-08-11T15:44:56.029034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.842939Z","title":"Multimodal event transformer for i mage-guided story ending generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.842939Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:032571520885a16af862838d1a99dbf3cb43da0279dd5cb9141a31932b69ebf7","observation_id":"34f69918-805c-4277-9c18-291ad00a3b46","resolution":{"observed_at":"2026-08-11T15:44:54.842939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-16T13:52:04.740660Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-11T15:44:54.848987Z","title":"Fine-tuning large vision-language models as decision-making agents via rein forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.848987Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:2f59e005c3da2d8d7676f794d90bba1f4de6da32e54c67079aed1b6ddb812f66","observation_id":"81961021-753c-4c11-b087-7455143f4495","resolution":{"observed_at":"2026-08-11T15:44:54.848987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.855522Z","title":"Style-aware contrastive learning for multi-style image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.855522Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:94addf242603d0888b0327063d4df581a1213d4511d35483bc55e4faf6a8b1be","observation_id":"c9795afb-6b79-4556-a418-6a729a2bbd57","resolution":{"observed_at":"2026-08-11T15:44:54.855522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:55.976262Z","title":"Improving cross-modal alignment for text-guided image inpaint- ing,","venue":null,"work_id":"3ef789d8-7fa4-412e-abdd-8e1d92d00aa0","year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.861556Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:6eb03db877f45d5c4fd26353fa12e623b70e7d98ab29f54f963a15e67e09eb09","observation_id":"332e282d-e0f1-4489-8562-954c63e89838","resolution":{"observed_at":"2026-08-11T15:44:55.981517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-11T15:44:54.869813Z","title":"Internlm-xcomposer-2. 5: A versatile large vision language model supporting long-con textual input and output,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.869813Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:75fb01429acab6e9c9e644ee52642b234a4b456f2677d1c129da4118850fffe2","observation_id":"4f0ddb9d-d718-4827-bd03-1fc2844c8e8c","resolution":{"observed_at":"2026-08-11T15:44:54.869813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-16T14:43:11.499242Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-11T15:44:54.875118Z","title":"Thread of thought unraveling chaotic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.875118Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:9e14bf82e4c3653bdd2a8b89e8d7de3456505fad38572cf657cd76c09ee142f5","observation_id":"38fb7a67-f1d4-430b-9953-5a35a52b049c","resolution":{"observed_at":"2026-08-11T15:44:54.875118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.883452Z","title":"Streaming dense video captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.883452Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:04187bf90550752d60fd394e309e86ae81bf2bf119b3cda7986059ddfc5e4844","observation_id":"3681400b-2e88-4dc2-9723-10bb43ceb208","resolution":{"observed_at":"2026-08-11T15:44:54.883452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.888620Z","title":"Livecap: Live video captioning wit h sequential encoding network,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.888620Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:5cc5ec69c3c9bc54eb397b1cfb81ccbbeaf3fdbd580ac4e05e25212e7f1a6f34","observation_id":"46227d4c-2f77-4c3c-a2c2-594de139b5e4","resolution":{"observed_at":"2026-08-11T15:44:54.888620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.07046","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:55.545815Z","title":"Ret rieval enhanced zero-shot video captioning,","venue":null,"work_id":"663da85b-1044-4c10-bbc1-ef7a018fc514","year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.893937Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:8f218eca45a4e1bf6eb709ac7767c62ffad7b9916699c701c72f7c2c87b4bdc0","observation_id":"48aa3127-6575-4f59-8bc3-bbb94c45feb0","resolution":{"observed_at":"2026-08-11T15:44:55.563935Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.911301Z","title":"Accura te and fast compressed video captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.911301Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:434aaaf6ab5378350896b9ecbbc2089d7493a733f59e057ba725789b254bb611","observation_id":"d7fb0076-51c6-4b82-8ee5-05e8022df916","resolution":{"observed_at":"2026-08-11T15:44:54.911301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2405.07046","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:55.143108Z","title":"Available: https://doi.org/10.48550/ar Xiv.2405.07046","venue":null,"work_id":"ac2ec7ed-f4bd-48d6-a23b-380e0111e522","year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.901405Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:9ac0829eb064136d74bbe3bb84811c40c73cea179c24f2816602a7d0d0733f21","observation_id":"a6c4e297-062b-4f96-8d31-97a676d7646b","resolution":{"observed_at":"2026-08-11T15:44:55.151058Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06685","last_updated":"2023-08-13T05:18:08Z","snapshot_observed_at":"2026-08-16T15:08:52.681723Z","submitted_at":"2023-08-13T05:18:08Z","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06685","snapshot_observed_at":"2026-08-11T15:44:54.916642Z","title":"Video captioning with aggre gated features based on dual graphs and gated fusion,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.916642Z"},"links":{"cited_paper":"/paper/2308.06685","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:29a9659df08c0da1cd06c534ff8b95ab298c877f0033edb7248bdae43db8c610","observation_id":"c9161954-b612-47f5-9f4e-5d78b07a56b0","resolution":{"observed_at":"2026-08-11T15:44:54.916642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06685","last_updated":"2023-08-13T05:18:08Z","snapshot_observed_at":"2026-08-16T15:08:52.681723Z","submitted_at":"2023-08-13T05:18:08Z","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","version":1},"cited_work":{"arxiv_id":"2308.06685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06685","snapshot_observed_at":"2026-08-11T15:44:54.979838Z","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","venue":"cs.CV","work_id":"58f26e0a-5812-4983-8516-b4ca0c8c537e","year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.926584Z"},"links":{"cited_paper":"/paper/2308.06685","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:e227bcf75bc0f556d24a0d5f3bbe8e5d59582fae0b701c1671df7e3c14782d08","observation_id":"8d5e2da0-b6e7-48f7-8378-34e76cb4a432","resolution":{"observed_at":"2026-08-11T15:44:54.992595Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:44:54.816312Z","title":"Available: https://doi.org/10.48550/ar Xiv.2403.20330","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.816312Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:2ed2d389f496636921d1ccf7dbab2de37b5ea69778d1fc9941c28b94f619ebe7","observation_id":"d1daa596-d7c4-4448-8d5a-9e83036f87b1","resolution":{"observed_at":"2026-08-11T15:44:54.816312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T15:44:27.931878Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2412.10720."}