{"as_of":"2026-08-09T17:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97d17c6d30faaf716787884e940c048e3faa08e3a1c072ae4ac02c1bc2494671","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:24:30.507687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.158751Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:523c3efacc6bfb798c7bbe08ace7a1c5f0b510ee5f055173f1bb10a7169ef0a3","observation_id":"b7ee496c-307a-44e6-8f8c-40193d70a00c","resolution":{"observed_at":"2026-05-23T05:45:28.412684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-07T05:24:30.507687Z","title":"Short film dataset (SFD): A benchmark for story-level video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.507687Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:9ca91cc1792bc7d80aecbb6a2d126ec01599801f34f5c7d1a772eda9168391c4","observation_id":"8e73c803-64ed-40bb-a691-b58d78a20ef3","resolution":{"observed_at":"2026-08-07T05:24:30.507687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2508.20765","last_updated":"2026-04-08T02:55:23Z","snapshot_observed_at":"2026-08-02T23:26:21.127911Z","submitted_at":"2025-08-28T13:19:49Z","title":"Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-18T20:26:16.133860Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2508.20765"},"observation_digest":"sha256:dd35d999d582fe5971005f634e02666a75335b218a1672629d732e55416d8bc1","observation_id":"3acff9a8-de2f-4358-aa47-e10ddb3e13ee","resolution":{"observed_at":"2026-05-18T20:26:51.230528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-04T20:20:36.720168Z","title":"Short film dataset (SFD): A benchmark for story- level video understanding.CoRR, abs/2406.10221, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-09T06:09:37.758584Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.720168Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:25872ef0b6d2cdd6f652d0647c2d4f79a3f2cc570e53c68b11fdc18654897b48","observation_id":"d3f21b02-50e6-4e04-80d3-31a1a0dff288","resolution":{"observed_at":"2026-08-04T20:20:36.720168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2512.10571","last_updated":"2026-05-02T11:27:08Z","snapshot_observed_at":"2026-07-31T11:34:00.884185Z","submitted_at":"2025-12-11T11:58:53Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T23:26:21.855485Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2512.10571"},"observation_digest":"sha256:a763641b2e38d772083f0ca143ef9f72ddfeb1ba95a873a3ddb3cbdeed390c11","observation_id":"2685d3f7-0258-4eaf-a1a7-d7580f6b2bb0","resolution":{"observed_at":"2026-05-16T23:28:40.860847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:32.558440Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2605.18467"},"observation_digest":"sha256:3eaaf8ca56d34d2274b918865f5ca1dad60a0c2daaf5459e01b1ac176a2f0271","observation_id":"78eb26ea-c384-4588-bbbf-a646a07d6d9d","resolution":{"observed_at":"2026-05-20T11:38:14.766651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2605.31069","last_updated":"2026-05-29T09:38:43Z","snapshot_observed_at":"2026-08-07T07:32:37.435310Z","submitted_at":"2026-05-29T09:38:43Z","title":"Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:42.001361Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2605.31069"},"observation_digest":"sha256:efd64a1e3b1997ce25a663408847cd27cdd587c657321bd65304651b813d891f","observation_id":"34787311-7470-4e90-88e8-8a6aba37de24","resolution":{"observed_at":"2026-06-29T00:02:50.355832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":277,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:cd89a78d8570499d687f8b05fd160df18d37eb63fbd73bb07328ecfd4b86d991","observation_id":"b8748d69-e048-45e0-8ca8-82e8ffcb0d2b","resolution":{"observed_at":"2026-07-02T17:27:15.160322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T07:18:20.501369Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:d7e5aedca51b4a667b2b084ce4ff530e7c716c908b5705732793e0d0e484a644","observation_id":"df246eb0-095b-4120-9d99-a7e1391930c8","resolution":{"observed_at":"2026-06-30T07:24:21.527026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-14T17:03:01.432145Z","title":"arXiv preprint arXiv:2406.10221 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T17:03:01.432145Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:6796849a85ade9f81b9ec45c946978a1d764b543b4edf7e1ca63a5e427a6f787","observation_id":"0396d090-764d-463a-a956-0ca4d8f4f1ab","resolution":{"observed_at":"2026-07-14T17:03:01.432145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10221/citation-record","integrity":"/paper/2406.10221/integrity","json":"/paper/2406.10221/citation-record.json","paper":"/paper/2406.10221"},"outbound":[],"paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:49:29.979338Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2406.10221."}