{"as_of":"2026-08-16T20:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de590d70be722c8a924c8b88b091577981728018861b03fced1883c9b4dfbaec","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:41:59.785064Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:30:42.570671Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:35.541046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-12T10:09:30.704015Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19548","last_updated":"2024-11-29T08:47:46Z","snapshot_observed_at":"2026-08-15T17:12:37.171263Z","submitted_at":"2024-11-29T08:47:46Z","title":"ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:09:30.704015Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2411.19548"},"observation_digest":"sha256:3fb3084628cbc538442069b27ef598301f882a22223de20ed9538a12c71983db","observation_id":"f7aaf33b-9987-4e4e-aaa1-a13eb1713491","resolution":{"observed_at":"2026-08-12T10:09:30.704015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-11T21:45:10.136640Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.136640Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:379cf92938b9cab4817bd81c2b08a4884cd9344b2efe4ae78db44a638819ac27","observation_id":"6f5f1db1-2755-4779-a441-58553b189d1e","resolution":{"observed_at":"2026-08-11T21:45:10.136640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-15T22:30:42.570671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07057","last_updated":"2025-05-11T17:08:50Z","snapshot_observed_at":"2026-08-16T07:35:06.901891Z","submitted_at":"2025-05-11T17:08:50Z","title":"DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:30:42.570671Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2505.07057"},"observation_digest":"sha256:eabc5c6c75dc661cfbadbe674294c89b01e896e95f76dc3e98c97853bd2f096c","observation_id":"1b605e66-2194-46b2-b065-0ed2a0f6d052","resolution":{"observed_at":"2026-08-15T22:30:42.570671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-07T14:56:40.227298Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation.arXiv preprint arXiv:2411.08380, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-15T13:12:58.704577Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.227298Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:5aeae92fc7804d269ceec2fb5c091f7fce11f27d5eb873a96db19b7c6199f998","observation_id":"eba3de72-db0f-477b-ac34-c9d316dc5fd1","resolution":{"observed_at":"2026-08-07T14:56:40.227298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-07T10:50:51.168830Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04224","last_updated":"2025-06-04T17:59:02Z","snapshot_observed_at":"2026-08-14T01:07:42.775177Z","submitted_at":"2025-06-04T17:59:02Z","title":"Seeing in the Dark: Benchmarking Egocentric 3D Vision with the Oxford Day-and-Night Dataset","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:51.168830Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2506.04224"},"observation_digest":"sha256:5fa16998a94fe0dcca34a527f851cfd7ce26b4fee7aea7878d35b14164988d7b","observation_id":"259f6f08-efe0-4d4b-ac2c-913566405df4","resolution":{"observed_at":"2026-08-07T10:50:51.168830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-07T05:31:42.617889Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-16T19:05:28.602105Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.617889Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:70eeaea8a34c1a7ee88b0731d52659827a43208f51174e6310fe61daa1dfe9c4","observation_id":"d96b73dd-335a-4a97-8689-3d79f91c0368","resolution":{"observed_at":"2026-08-07T05:31:42.617889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-06T21:28:17.840081Z","title":"Egovid-5m: A large-scale video- action dataset for egocentric video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-16T18:58:53.286701Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:28:17.840081Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2507.00162"},"observation_digest":"sha256:69aa880b58e01410c7a20f6755edc04d7349bc3e29b1e52b68951e3232d045c7","observation_id":"e2e62075-90b9-442d-8a0f-54f627e3b7a1","resolution":{"observed_at":"2026-08-06T21:28:17.840081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":228,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:8ea3310e4ca936b2de94324a018dfb3bbafba954f7d88f5584f02d49dc07d7a5","observation_id":"ec597a67-6a35-4e64-a58c-56dfcbe03a3f","resolution":{"observed_at":"2026-05-17T20:28:16.373183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-05T19:15:34.292314Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-08T21:34:53.802326Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:34.292314Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:328a7c75109f20342863a376551bab9e4db9239d0272c42ce41412b806a16b2c","observation_id":"8d4ee067-2a01-470c-a0e8-d8cbe31222ec","resolution":{"observed_at":"2026-08-05T19:15:34.292314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2511.18127","last_updated":"2026-05-15T06:06:57Z","snapshot_observed_at":"2026-08-15T07:23:00.843942Z","submitted_at":"2025-11-22T17:22:24Z","title":"SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T17:53:19.002603Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2511.18127"},"observation_digest":"sha256:cc79278e8c5b63a6eb9a48fd65c1ceac601b98b19cc996b813ff38a63774307a","observation_id":"be883004-0e67-4bd2-a90c-745b6dfc6a8e","resolution":{"observed_at":"2026-05-21T17:54:18.270974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-13T14:40:24.818842Z","title":"arXiv preprint arXiv:2411.08380 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01001","last_updated":"2026-07-01T11:45:08Z","snapshot_observed_at":"2026-08-14T09:05:46.723245Z","submitted_at":"2026-04-01T15:00:46Z","title":"EgoSim: Egocentric World Simulator for Embodied Interaction Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T14:40:24.818842Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2604.01001"},"observation_digest":"sha256:0b5d31eb7c84d97c06fce251cd1c6a4039d3e756d0742ed3beea710b9117a313","observation_id":"67625f16-802b-41f8-acc7-3a7e45e13f3c","resolution":{"observed_at":"2026-07-13T14:40:24.818842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2604.09535","last_updated":"2026-04-10T17:53:55Z","snapshot_observed_at":"2026-08-13T17:37:12.058706Z","submitted_at":"2026-04-10T17:53:55Z","title":"EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:10:36.209152Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2604.09535"},"observation_digest":"sha256:9dadb21e0aacd59c118ed6974c83fa2d6575e09040b129c933936df0928ad4e4","observation_id":"ff58e91a-20bb-474b-8274-95c618a83ef0","resolution":{"observed_at":"2026-05-11T07:26:02.978634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2604.27621","last_updated":"2026-04-30T09:11:25Z","snapshot_observed_at":"2026-08-16T13:03:46.974839Z","submitted_at":"2026-04-30T09:11:25Z","title":"Robot Learning from Human Videos: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T04:55:44.273643Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2604.27621"},"observation_digest":"sha256:a48ab2243c27dae80a937687abb8fb925d0a8d53e214d48ac275f6b2ce9fa6a0","observation_id":"57fcf62c-8edd-4aee-8b9b-a8a04ea19581","resolution":{"observed_at":"2026-05-12T10:41:29.720260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-02T14:24:57.896385Z","title":"helpfulness_score","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10579","last_updated":"2026-07-30T05:06:10Z","snapshot_observed_at":"2026-08-13T12:52:16.715157Z","submitted_at":"2026-05-11T13:50:47Z","title":"VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:24:57.896385Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2605.10579"},"observation_digest":"sha256:cf7ec3a14368f9141259fddadc0efd7a3a5fee391b0283e9cf3a13d2ec6f047c","observation_id":"f066cf9c-ec7e-4459-8a22-426517529e66","resolution":{"observed_at":"2026-08-02T14:24:57.896385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:f455bec5359f2c4f381d983fd503b926a54752d79ba13ccfdef6d1d13c37a9c8","observation_id":"9a614153-e28a-419a-b3dc-dbd1de4d3215","resolution":{"observed_at":"2026-05-13T05:07:18.085461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2605.26316","last_updated":"2026-05-25T20:13:16Z","snapshot_observed_at":"2026-08-01T03:37:55.526828Z","submitted_at":"2026-05-25T20:13:16Z","title":"E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T22:24:38.389294Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2605.26316"},"observation_digest":"sha256:861d48ce9e8eade5c0d6ce9e4e05cdafe874a63ef564a9727599a6688d4afb4e","observation_id":"03223971-dea8-4844-936a-34fb0f43d6ea","resolution":{"observed_at":"2026-06-29T22:34:02.491593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-13T05:52:18.238364Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:306615a2aa37cc17a17a85e86babeee0d3b44a02ad5d051ba46874a89395fc2d","observation_id":"f7401e87-89f8-4008-8fab-a9f396fbf08a","resolution":{"observed_at":"2026-07-04T04:09:35.543085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":"2411.08380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-04T04:09:35.541046Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":"9385c471-7a88-43fb-99d9-fd117dabd96d","year":2024},"citing_paper":{"arxiv_id":"2607.02075","last_updated":"2026-08-13T13:31:50Z","snapshot_observed_at":"2026-08-16T20:11:22.028961Z","submitted_at":"2026-07-02T12:14:02Z","title":"HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-03T15:52:18.371702Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2607.02075"},"observation_digest":"sha256:96267f885d725797729e5b6c91ce7c776dfc9823efad010f347d2b250d128e65","observation_id":"2d0fbbc3-546e-4783-98f4-cc931057e2bc","resolution":{"observed_at":"2026-07-03T15:58:37.380383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-16T01:53:28.715691Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:0aa9a17e5facf7271429ffed9ec98dcc5c8cce6ec64a0e2a3cc75667bc0f68b0","observation_id":"58d28c96-4fad-4bb4-b6a7-adabeebe6cf0","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-01T14:08:29.408596Z","title":"arXiv preprint arXiv:2411.08380 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-16T09:10:48.892137Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.408596Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:b4d804878f6c2fae08c9c28a7cc03671e04aefb52e8a0f85a96463869b8a12c6","observation_id":"3f261905-45cb-4fb0-b2d3-10ff1f52fe30","resolution":{"observed_at":"2026-08-01T14:08:29.408596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.08380/citation-record","integrity":"/paper/2411.08380/integrity","json":"/paper/2411.08380/citation-record.json","paper":"/paper/2411.08380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.378302Z","title":"Self-supervised object detection from egocentric videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.378302Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:3eb91534bd824867f3e4def1c5dd4446b8dafdc1048bc0f8f211f481298fd496","observation_id":"ade03dd6-589d-4841-93ba-acd5d7f4c032","resolution":{"observed_at":"2026-08-12T21:41:59.378302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.384225Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.384225Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:f7e6a0f34f2fffa19c16fcae86a3614911afb98bf8754c3e84888ff11e901bc1","observation_id":"1fbcac96-1f07-4511-a0ad-251ac8bc8c6e","resolution":{"observed_at":"2026-08-12T21:41:59.384225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-16T12:52:49.101262Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T21:41:59.389473Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.389473Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:5ec5f2c018daa598a282e203168f0092186ec290c4c1fe185a0b2f09b32b46f4","observation_id":"84e4c6b2-ee04-44c5-9037-1d6f79041a67","resolution":{"observed_at":"2026-08-12T21:41:59.389473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.394717Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.394717Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:693ecad24cf965b176a044fdeb8ff62e0cd23fd4abec449f821851f9aa906d9e","observation_id":"4a4716cb-4e37-4f7b-911b-08734f530412","resolution":{"observed_at":"2026-08-12T21:41:59.394717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15391","last_updated":"2024-02-23T15:47:26Z","snapshot_observed_at":"2026-08-16T14:15:52.387663Z","submitted_at":"2024-02-23T15:47:26Z","title":"Genie: Generative Interactive Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15391","snapshot_observed_at":"2026-08-12T21:41:59.399286Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.399286Z"},"links":{"cited_paper":"/paper/2402.15391","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:4d9f2fa0eed92fa372e11b50c99b5e7e90434913995373cdbcbd3da80eaab708","observation_id":"36cfff75-c6d4-4b27-8297-afa889c274b0","resolution":{"observed_at":"2026-08-12T21:41:59.399286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.404250Z","title":"Videocrafter1: Open diffusion models for high-quality video generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.404250Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:f50bbd306fd9bf079d9c2ddc1b0358ef337e28f451d5dad9c7fbd3625115d071","observation_id":"05cd4cc0-50fc-422d-96c5-b9fb3bdc9608","resolution":{"observed_at":"2026-08-12T21:41:59.404250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.409263Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.409263Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:0156b25dab72d6707144be7928152627b568e66e2aeed898428f13efb06d5c5e","observation_id":"123aa0ef-6344-476d-af7d-a4b7d42cc2e3","resolution":{"observed_at":"2026-08-12T21:41:59.409263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.414184Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.414184Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:7e050c4d8cdfa6c2ddc514d6e36ce3e81235ed24759918778a11cf65a492cdbb","observation_id":"e4b3653b-3b9c-4bc2-8806-031e7a5238df","resolution":{"observed_at":"2026-08-12T21:41:59.414184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.418013Z","title":"Improved-aesthetic-predictor, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.418013Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:fa448e83cabdd94b2a4ddd7efdf0ce4cfaf2955e92ab541b78e825ce10782d7f","observation_id":"ccedbfd6-f54b-4d3e-af78-37f014cc304d","resolution":{"observed_at":"2026-08-12T21:41:59.418013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.422044Z","title":"Lillicrap and Mohammad Norouzi and Jimmy Ba","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.422044Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:9b2c6de0754c500aa5a02aa67c83ffad83ebc88d42cf631faa1dc15bf3cfcbe0","observation_id":"8413f425-2ee0-4fa5-984f-99e9fc524e72","resolution":{"observed_at":"2026-08-12T21:41:59.422044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.425825Z","title":"Aigcbench: Comprehensive evaluation of image-to-video content generated by ai","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.425825Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:539aeb94aef79648ffbb11c43bd70ca8d96d0afa536144548f9ee95bb8144224","observation_id":"ac0927ea-dfe4-4f37-bd0f-5fffbce5b5a1","resolution":{"observed_at":"2026-08-12T21:41:59.425825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:01.078620Z","title":"On the content bias in fr ´echet video distance","venue":null,"work_id":"9eb70989-9443-49fd-b047-ad84eaee15ac","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.429463Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:9ad549361b7483b45c039616a2a51baac356e30e099724b4ee86ca6a25c48302","observation_id":"c07df424-656f-44f6-b37a-2cad4fc5c67c","resolution":{"observed_at":"2026-08-12T21:42:01.082838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:01.064133Z","title":"Introducing general world models","venue":null,"work_id":"f4ef82da-d783-4236-8d11-bd2f1a0c095f","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.433433Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:6a6d9a66fd95da17264f8b722b5f094768a96291c51d956905223f26672dbd96","observation_id":"fc0951f0-d238-4965-9c6f-d3e473a06871","resolution":{"observed_at":"2026-08-12T21:42:01.069093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:01.048843Z","title":"Introducing gen-3 alpha","venue":null,"work_id":"5135366b-4289-452f-b5dc-dfc773f400ef","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.437282Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:73c408d91268e37768686f8b88233b9afe17bea26085131653dc5fcad42abef5","observation_id":"c8c93335-39cd-4581-bf2d-ea0dc6e54544","resolution":{"observed_at":"2026-08-12T21:42:01.053640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:01.033515Z","title":"Mmg-ego4d: Multimodal generalization in egocentric action recognition","venue":null,"work_id":"46084db8-48e3-47d4-9c68-f7e6789b949a","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.440913Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:f7beacf8aee74bcc73f343ba268dde086750b3484db684fc598165a73b90f8fa","observation_id":"183e3ab4-627a-4d8d-acfd-64859e3cc218","resolution":{"observed_at":"2026-08-12T21:42:01.038444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:01.017311Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"7a96d386-641a-49ae-bd29-b0bbc2976a07","year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.444397Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:71990c60347c6f59ca9eda443e1351e8a01807660d843f7d5fd83e1cf8de1da3","observation_id":"d29a241b-1037-499b-b1fa-4c8f34aa4ad3","resolution":{"observed_at":"2026-08-12T21:42:01.022455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:01.001301Z","title":"Jawahar, Richard Newcombe, Hyun Soo Park, James M","venue":null,"work_id":"bab16de6-feb9-4c86-9fb7-e49777b5865f","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.448690Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:90913578746ea98fde673404c7cd791695e239392c6274efe7cb3946aca95514","observation_id":"1c6268db-3cf8-4873-a733-39c88a8ff679","resolution":{"observed_at":"2026-08-12T21:42:01.006220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.986666Z","title":"Lillicrap, Jimmy Ba, and Mo- hammad Norouzi","venue":null,"work_id":"767679d4-df63-4cbb-94f9-a146745145f9","year":2020},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.453600Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:4145d53ff6e160d167fb3b50446b479fb65d24c29c4274308ba755312e787054","observation_id":"dacf5b83-bf9d-4037-9716-bca80310ecbb","resolution":{"observed_at":"2026-08-12T21:42:00.991474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-12T21:41:59.458026Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.458026Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:9687e9ab751f20ffaad8d76ee8cd3974e79f90b725c782bf4cb95c0b8133bb47","observation_id":"eb6a4b20-239b-44ea-b928-c8311a6533f0","resolution":{"observed_at":"2026-08-12T21:41:59.458026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-12T21:41:59.462862Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.462862Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:e814a6308080fce2a035d72994b4fbbddbc2d812fd727043b95d7a6df3ff9421","observation_id":"8fb2c236-5511-46e3-b6a8-31a99feddbc1","resolution":{"observed_at":"2026-08-12T21:41:59.462862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-12T21:41:59.467532Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.467532Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:4f644b54414ff0c3279a1d7623471d37e38125ca5c67a1dfae7c8c3109ec232f","observation_id":"1d1d25a0-074c-4190-b504-2bd867c214a5","resolution":{"observed_at":"2026-08-12T21:41:59.467532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.971518Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"56a493f8-e53a-4f00-8e5e-cd47200bbf96","year":2020},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.472384Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:0e7282445fcf6375dc3e9d90c54076a1ae8e55a5a2a80b3bbec542afbe8f379d","observation_id":"910d8d6e-f0a7-4124-b177-87e34b881a04","resolution":{"observed_at":"2026-08-12T21:42:00.976388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-12T21:41:59.476861Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.476861Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:35a6830ea7240ef52d79ab0d984c1fc2f089eea6f4121a6b8c401eb0500cba6d","observation_id":"a5e1147f-8905-47aa-89e1-2b43ba144cf1","resolution":{"observed_at":"2026-08-12T21:41:59.476861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10126","last_updated":"2025-02-25T00:32:29Z","snapshot_observed_at":"2026-08-16T13:42:54.369415Z","submitted_at":"2024-06-14T15:33:00Z","title":"Training-free Camera Control for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10126","snapshot_observed_at":"2026-08-12T21:41:59.481577Z","title":"Training-free camera control for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.481577Z"},"links":{"cited_paper":"/paper/2406.10126","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:54e840451073d3ee0591147e0037d01439ed215b60a63ca72ef569ffe737d94d","observation_id":"27443513-f220-4fa7-a8c5-ca5d190e8a70","resolution":{"observed_at":"2026-08-12T21:41:59.481577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-12T21:41:59.486124Z","title":"Gaia-1: A generative world model for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.486124Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:a78ebaa731d69f11897e497ee70c1f6972cb0ac2538ac1dfa959582e9fa63723","observation_id":"0c75d9d3-a3f2-4cee-b3cf-b0492833142e","resolution":{"observed_at":"2026-08-12T21:41:59.486124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15789","last_updated":"2024-05-01T02:37:18Z","snapshot_observed_at":"2026-08-16T13:58:15.220232Z","submitted_at":"2024-04-24T10:28:54Z","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15789","snapshot_observed_at":"2026-08-12T21:41:59.490941Z","title":"Mo- tionmaster: Training-free camera motion transfer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.490941Z"},"links":{"cited_paper":"/paper/2404.15789","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:ba4b61dd77879b8b842eacb854ec44ce9f7677c60437f3b4ab70d05581c36270","observation_id":"e31e0c5f-7777-4b70-9dc5-0fff524309aa","resolution":{"observed_at":"2026-08-12T21:41:59.490941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-08-16T15:13:10.800063Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-08-12T21:41:59.495588Z","title":"Videocontrolnet: A motion-guided video-to-video translation framework by using diffusion model with controlnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.495588Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:223e1470d704322a75a59b04bb73a0b149e90291967774a2f5b63f95d380caec","observation_id":"719501f7-84b7-415b-832c-be6a1ecf5eb7","resolution":{"observed_at":"2026-08-12T21:41:59.495588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.956097Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"2b461f72-ac81-4e8d-ad6f-a7f5dfea9229","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.500458Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:91d30e921396fb791dbda80ba76bdefd4a22d1d6c7e5e3ca93fe85d3ba01eaad","observation_id":"bfb2d091-9eda-4778-a294-1e41161649b1","resolution":{"observed_at":"2026-08-12T21:42:00.961046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.941081Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"f683faac-0bb4-46d4-891b-fb605fa314f1","year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.504909Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:eafcdf5a432868654f22cbc60cc03bba50a05c1a6189457f67fe4e8428ab3c8a","observation_id":"b0485c69-e397-4d95-a64e-cf6017a16aa4","resolution":{"observed_at":"2026-08-12T21:42:00.946079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.509265Z","title":"Open-sora-plan, Apr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.509265Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:9f3b20c6b28af324980cbe8d4a1faf9f93ffde0abd159738214c9c837547d9cd","observation_id":"f9c34f5c-1692-48ed-b8d0-9b708ec2b10c","resolution":{"observed_at":"2026-08-12T21:41:59.509265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.915809Z","title":"11 EgoGen: An Egocentric Synthetic Data Generator","venue":null,"work_id":"71b85635-581b-4ba7-88d5-4cd36707ca77","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.513761Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:7973c053fd6701f4cf0ee53fbef82c86f30b329f61c1096d01d4f9016e51510c","observation_id":"57e1d6c8-5d99-47e4-acd6-92b480a9afb3","resolution":{"observed_at":"2026-08-12T21:42:00.920695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.901685Z","title":"Ego-exo: Transferring visual representations from third-person to first-person videos","venue":null,"work_id":"81db862c-f256-4520-abdd-1e86fbbbc371","year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.518969Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:b35f55e1e9ed920b732f13c3bb0a8750ef11dfcb30e3f47828e513a1300afa98","observation_id":"320e9458-4d98-422c-9e83-10693c84488f","resolution":{"observed_at":"2026-08-12T21:42:00.905826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.888078Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"1ff0278c-3c75-4ae1-8bee-54604b793c04","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.523831Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:eade091c48accb5ca2845f6cc078efde11e6530cacdbcbf9bdd3ea128d1c7cff","observation_id":"46819068-aaff-4a7e-9cce-5c4e8549afb4","resolution":{"observed_at":"2026-08-12T21:42:00.892507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.874356Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"46f558f4-92bd-403d-8480-0a202139f380","year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.528528Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:c556fa1314f9427f8a12a9af02d64a11cf1303cdccf4b9018c47fccc67358b53","observation_id":"54fa81b0-b3a8-48be-b171-a6c860ae9f41","resolution":{"observed_at":"2026-08-12T21:42:00.879016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-12T21:41:59.532830Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.532830Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:01833029c5ac1dcd129d2a04d8fffadc9a4bc29e2330e7647500312a0d859091","observation_id":"f9b67bc0-73f0-4b3d-8406-ef7f45e9e842","resolution":{"observed_at":"2026-08-12T21:41:59.532830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.859916Z","title":"Cross-view exocentric to egocentric video synthe- sis","venue":null,"work_id":"8126bd1e-5090-437d-a98c-d492d9fab48f","year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.536606Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:3971a0e692d499455af79eab27b504e71f15ac49c828f3417bb5d56d828c2bec","observation_id":"623918a3-585b-466f-8193-1f19b5926de8","resolution":{"observed_at":"2026-08-12T21:42:00.864579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.844674Z","title":"A hybrid egocentric activ- ity anticipation framework via memory-augmented recurrent and one-shot representation forecasting","venue":null,"work_id":"622c9c9f-8052-4290-bc59-e5969dda178f","year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.541337Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:8ae1b7d689e500fa93b78118b68e75d5a0526ec0b0c19d63835fa8c314aafbf8","observation_id":"0ffe1a77-c4c8-428b-a7d8-3e5f3f53d9c9","resolution":{"observed_at":"2026-08-12T21:42:00.849577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-12T21:41:59.545797Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.545797Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:48a7a9d990f67290f30910fc9016bb7bc3de9ffc91e5a83d9eada4d151a26d2a","observation_id":"92840d04-770b-4ae9-882c-4d70f0df9046","resolution":{"observed_at":"2026-08-12T21:41:59.545797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09194","last_updated":"2024-03-17T13:28:32Z","snapshot_observed_at":"2026-08-16T14:09:54.739067Z","submitted_at":"2024-03-14T09:07:31Z","title":"Intention-driven Ego-to-Exo Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09194","snapshot_observed_at":"2026-08-12T21:41:59.551366Z","title":"Intention-driven ego-to-exo video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.551366Z"},"links":{"cited_paper":"/paper/2403.09194","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:85637ecec0e85040fb826c163b8a3913f0a6b4440bd5fd95a6e47ab7314423be","observation_id":"c3860403-d1fd-4fc6-8bdc-c3776ec7ba94","resolution":{"observed_at":"2026-08-12T21:41:59.551366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00896","last_updated":"2024-04-08T18:40:31Z","snapshot_observed_at":"2026-08-16T14:30:39.441629Z","submitted_at":"2023-12-31T10:51:52Z","title":"TrailBlazer: Trajectory Control for Diffusion-Based Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00896","snapshot_observed_at":"2026-08-12T21:41:59.556092Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.556092Z"},"links":{"cited_paper":"/paper/2401.00896","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:b8750936e17861845ac01eefa241c501202266eaa18ad262b48fde1d03e68248","observation_id":"7c301cfa-db54-4652-bab8-2a0e570abf70","resolution":{"observed_at":"2026-08-12T21:41:59.556092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-12T21:41:59.561766Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.561766Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:00b6e0af32322e5df6dd579f3f6eca4ad0c3e97647173594d9e21c9655d12be2","observation_id":"42418197-1469-432b-8cfd-b4d8cd92c076","resolution":{"observed_at":"2026-08-12T21:41:59.561766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.567046Z","title":"Egoloc: Revisiting 3d object local- ization from egocentric videos with visual queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.567046Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:46abd40f477653a185de5b194fa9f35d267a9b14007e42b8dd8860f3765f5f22","observation_id":"57033659-e889-403c-82ce-e2dfabf40dfe","resolution":{"observed_at":"2026-08-12T21:41:59.567046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.820237Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"33f3e698-27b1-49ea-a3b6-8f0fd3f16a86","year":2019},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.571520Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:034528145e3d50b5bfe4f1092f9bed9d69e381cffbe8f5458b808ad553a00edc","observation_id":"8cb6329e-c68b-4e37-add0-c0a56f8c9314","resolution":{"observed_at":"2026-08-12T21:42:00.825333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-12T21:41:59.576134Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.576134Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:83c484a36aa834aeb8c63a734b2d85ba8877d0e14af0855c46bbe9b3925d7c91","observation_id":"7a6661c6-1f97-465f-9f55-8a19caa9b4b9","resolution":{"observed_at":"2026-08-12T21:41:59.576134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-16T13:39:33.398967Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-12T21:41:59.581876Z","title":"Egovideo: Exploring egocentric founda- tion model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.581876Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:f389a15f5e8edeca8a0d08e0b4bc2feaf840d9fd0b0687d5dd5a2e45b0f780ca","observation_id":"872f3483-2661-4ef0-b60b-8471c6c9549c","resolution":{"observed_at":"2026-08-12T21:41:59.581876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-08-16T13:27:03.453194Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-12T21:41:59.586749Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.586749Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:d16c306e81b03ddbae8dc247093c0e0e9542fc60c6ae07e9819807f344bca1f3","observation_id":"4021565f-fab1-414a-abf4-bbfa8952e7e5","resolution":{"observed_at":"2026-08-12T21:41:59.586749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.805280Z","title":"What can a cook in italy teach a mechanic in in- dia? action recognition generalisation over scenarios and lo- cations","venue":null,"work_id":"025489e2-38b9-4921-b270-6c85a877d898","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.591400Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:9030d5303a1893145e6784c0e7bc1cda9c4fc02b511c7aa6cc96f251cbd73b53","observation_id":"ac3526ff-b076-4a63-9513-2f4dc5142331","resolution":{"observed_at":"2026-08-12T21:42:00.810193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.790880Z","title":"Multimodal distillation for egocentric action recognition","venue":null,"work_id":"c5c312e8-1795-47d6-84d4-0be17633b4f6","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.595211Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:c7889fea927194a5fec6c5b7bb67cec61fd3c045e4e991fff07f5f01fe20bf52","observation_id":"5f8ac5b4-7494-411a-9e10-01e0716c6b3f","resolution":{"observed_at":"2026-08-12T21:42:00.795666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.776055Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"c0bbb8d0-4969-43ee-b543-5ab6d391919e","year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.599578Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:49c60d8481766f6e0877c44c7ce670d5ddd809698bab2906db51fe18f2416fbc","observation_id":"5732c4e1-772c-4555-acb6-b4e04cc4cc55","resolution":{"observed_at":"2026-08-12T21:42:00.781177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.761125Z","title":"A dataset for movie description","venue":null,"work_id":"b92f0ace-2797-42b4-9afe-7f3de984712b","year":2015},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.603830Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:a6cabece6518509b36da9fcddefcd3301ca06afa039224d21b6e94c8b2080017","observation_id":"faa03250-f214-463b-a9e4-9f59b0323ed2","resolution":{"observed_at":"2026-08-12T21:42:00.766236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.746967Z","title":"First order motion model for image animation","venue":null,"work_id":"919ab5ff-2fec-42ea-8efd-1545f7d55b65","year":2019},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.608221Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:2b6bf20ed1bec81fe02a7df3f3311ce0fd210199a0a5dff0fb1f384601c2384c","observation_id":"18334e94-1057-4092-ba8c-79b76be18b43","resolution":{"observed_at":"2026-08-12T21:42:00.751554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.731058Z","title":"Light field networks: Neu- ral scene representations with single-evaluation rendering","venue":null,"work_id":"5bf24907-1959-465c-afd0-1bdb28dac9a3","year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.612979Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:53bcf69752c91b8b5eb04ff741bc6b36bfdfeeec843177f6d2d6bbd9e363f877","observation_id":"e733c57b-0751-45e0-a041-78141c6389b4","resolution":{"observed_at":"2026-08-12T21:42:00.735854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-15T13:34:03.745436Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T21:41:59.617554Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.617554Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:87bc2d64951bb49d34c1a5ce064b7262d8295f58dc63d382eacc6559d63a47ad","observation_id":"f2625ca3-5d7a-48d8-b08d-73909418bac7","resolution":{"observed_at":"2026-08-12T21:41:59.617554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-12T21:41:59.622397Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.622397Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:4427c64c5c6961abc274f57c0bd18f5ae2ca553af52d42ba2aa2e0169f35252a","observation_id":"66ee06a8-3fa8-41df-86a8-25744596c3b0","resolution":{"observed_at":"2026-08-12T21:41:59.622397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-16T13:28:24.668849Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-12T21:41:59.627308Z","title":"Vidgen-1m: A large-scale dataset for text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.627308Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:852ad9a55fc9cc3d5deb4b0330534545a51e8bc339dda2878704930ebdddd18c","observation_id":"d3c18b2b-2818-4fc1-9ad7-c5af5c13b606","resolution":{"observed_at":"2026-08-12T21:41:59.627308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.716332Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"46685823-c777-4979-971a-931a616bd618","year":2020},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.632680Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:b06975e608680109445bbdf05395490ad5f8d030fa0ee0b375a5779765185e26","observation_id":"9daa2966-bb37-4ece-b5f3-a1c1ee307771","resolution":{"observed_at":"2026-08-12T21:42:00.721210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-12T21:41:59.637155Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.637155Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:998bc9ad5c6fd967e052bf4b7eaf5cb618b76a13159c68e59bee9c08d12bb546","observation_id":"e819fe0c-9a0a-4103-ad1a-0568953f6d81","resolution":{"observed_at":"2026-08-12T21:41:59.637155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09777","last_updated":"2023-11-27T05:09:29Z","snapshot_observed_at":"2026-08-16T14:59:48.218608Z","submitted_at":"2023-09-18T13:58:42Z","title":"DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09777","snapshot_observed_at":"2026-08-12T21:41:59.642313Z","title":"Drivedreamer: Towards real-world-driven world models for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.642313Z"},"links":{"cited_paper":"/paper/2309.09777","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:adaec3a8d078645a9eab80e06ebd561c0bce2b839f84b69d04cc6404f4839df8","observation_id":"87282600-96f5-4e13-a76c-78c11be100f9","resolution":{"observed_at":"2026-08-12T21:41:59.642313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-16T14:26:27.599253Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-12T21:41:59.648070Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked to- kens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.648070Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:90e4cc77f0e503f6b7aa15ecbe7a1dd24206023441093a07bc39ddbaa2e9000b","observation_id":"f5a9d4a4-8530-45b9-abf1-1edf48125159","resolution":{"observed_at":"2026-08-12T21:41:59.648070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17918","last_updated":"2023-11-29T18:59:47Z","snapshot_observed_at":"2026-08-16T14:39:07.336302Z","submitted_at":"2023-11-29T18:59:47Z","title":"Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17918","snapshot_observed_at":"2026-08-12T21:41:59.651962Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.651962Z"},"links":{"cited_paper":"/paper/2311.17918","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:49eabb99ded06c5c67dfd99b30140d2a2f8de22d7bbe7f7d96825fb835547ce9","observation_id":"96f50292-a182-42d3-872f-949ad6711854","resolution":{"observed_at":"2026-08-12T21:41:59.651962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-12T21:41:59.655925Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.655925Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:77ece31da80f3330bc2ad246dca53d8866b6f7243aeab9012e25a290a14efbcb","observation_id":"bb62d593-214e-43ab-b791-82a51b4ba356","resolution":{"observed_at":"2026-08-12T21:41:59.655925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.701094Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"4db34de9-79b8-48b6-848c-080d28da1193","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.659934Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:2ad0f623234f61394850ef9a58b0c4f71408b65c160503ad263340dd35692479","observation_id":"c926186f-4ff1-4e77-8587-0340bf85850e","resolution":{"observed_at":"2026-08-12T21:42:00.706112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.686337Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"94b8cef0-925a-4aa8-960a-2111653d60e8","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.664268Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:456f2d9dcc35f2041d439adc64fc43a3ece6c894c32cb580875a238f6780ee1c","observation_id":"781232c7-fa68-47de-a26d-92673ca7d1fc","resolution":{"observed_at":"2026-08-12T21:42:00.691076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.671936Z","title":"Daydreamer: World models for physical robot learning","venue":null,"work_id":"4962797a-3345-49bc-b336-cd21fcd3ff91","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.669034Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:38c03a3f01e6f001539fd1f2533fcb49b7e5f1e33200c1879b6993bc38cb8481","observation_id":"35eb08b1-90d0-47cc-9424-3d45f01780a8","resolution":{"observed_at":"2026-08-12T21:42:00.676667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.674276Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.674276Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:f7a4637305bacaf6723629a574f8a7ce5823d18c350112a48792afc08e8d3692","observation_id":"f356bd31-2fda-4f24-b69e-dbf695baa145","resolution":{"observed_at":"2026-08-12T21:41:59.674276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-12T21:41:59.683353Z","title":"Camco: Camera- controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.683353Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:7cc7cd2617daf4cbf3e16c56b5a6ac9ef17115dee72fcee26a0d66afdbdf0de1","observation_id":"4cd277c3-c34e-41be-b3f4-83dcb4496ca9","resolution":{"observed_at":"2026-08-12T21:41:59.683353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.633677Z","title":"Egopca: A new framework for egocentric hand-object interaction under- standing","venue":null,"work_id":"1e4a8360-5e6e-4339-8453-8e81e144e881","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.688070Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:2e6bbc69721042f7f27a4932ae16a31d5df385816dde76b367a69801d12ccc41","observation_id":"6a0df8b5-548a-40f7-8ebf-8e79720ee127","resolution":{"observed_at":"2026-08-12T21:42:00.638485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.692480Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.692480Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:c1e9daf4ff4e18ff3f94ead6c482aa14a5c4e601d7ece65f5cddee06fb63a1ea","observation_id":"24eebc82-7aa2-4325-a416-6734eb8969fa","resolution":{"observed_at":"2026-08-12T21:41:59.692480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-12T21:41:59.696931Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.696931Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:dc96027ebbae8a6cdd83ad088ca8924e8d4661403b234996002572de4e6bce5d","observation_id":"d6e83ca7-25a2-4bcb-9ffd-f219405cf2e6","resolution":{"observed_at":"2026-08-12T21:41:59.696931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T21:41:59.701806Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.701806Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:cafdee96dab7431296027072c60351a6ac1dfd687da2a67e9dca668a529a7a62","observation_id":"f07a7966-7fb3-4260-ac2b-5b0abbc2471f","resolution":{"observed_at":"2026-08-12T21:41:59.701806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.609155Z","title":"Generalized predictive model for autonomous driving","venue":null,"work_id":"d7ed54bc-1188-418d-a5c0-ae9c86812cee","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.706587Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:ac0757fac75cce8b685999f41d89c361891081f04be9c4eb78d1669f72f1dd0e","observation_id":"a103f838-3238-4796-9f92-8e624ba607a7","resolution":{"observed_at":"2026-08-12T21:42:00.614000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.594113Z","title":"Learning interactive real-world simulators","venue":null,"work_id":"4662672b-bf93-42fa-9e89-ea50fe4a1339","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.711373Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:d3626adf46577dfbfac14219f9d1eab4eef7028e4c6c1ee5bf9165f1c78697dc","observation_id":"1d0e4ce7-9a03-472f-a774-a975cfc89d1e","resolution":{"observed_at":"2026-08-12T21:42:00.598987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.577921Z","title":"Direct-a-video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"702f609c-cbde-4f14-aa48-7a748d408dfb","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.716103Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:0fb2ae0c585797081b1f2979314c92621e15bf9c4439da476ef047cd7ff0a152","observation_id":"64b15505-9498-4089-b6ed-831b50ab1613","resolution":{"observed_at":"2026-08-12T21:42:00.583132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.563646Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"5c4e4b7b-710c-410d-a4e9-69595862a8ce","year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.720571Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:4e70b927465ec40122572c1f4c4428578754903a9af8b906750c25441dc9098a","observation_id":"11e9ebcb-76c3-4628-acfe-df96849c5ce2","resolution":{"observed_at":"2026-08-12T21:42:00.567936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-12T21:41:59.725143Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.725143Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:d54352579794febcbb78679e1949c610974655e4a3dfb9225592169c53d7c66c","observation_id":"8e8dd9a6-fccd-4359-b451-d3ccfdec33b6","resolution":{"observed_at":"2026-08-12T21:41:59.725143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.730832Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.730832Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:2a53188728df4580072d2daccae2bce816d7d54ab16d70ef4151668b3b0366be","observation_id":"0ca08549-2058-478e-b5f1-b14b3b459368","resolution":{"observed_at":"2026-08-12T21:41:59.730832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.539427Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"5be1cf5c-54e4-4fe7-aea0-f585b58af42e","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.735082Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:575fd5c858dee9bcc34bf8238e24137789602b9eaf065e1ef4b2565f0f99ce7b","observation_id":"ce36ee1b-fab0-494e-a6ef-a8b747ba24e3","resolution":{"observed_at":"2026-08-12T21:42:00.543823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13571","last_updated":"2024-11-25T07:02:47Z","snapshot_observed_at":"2026-08-16T13:08:24.793819Z","submitted_at":"2024-10-17T14:07:46Z","title":"DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13571","snapshot_observed_at":"2026-08-12T21:41:59.739668Z","title":"Drivedreamer4d: World models are effective data machines for 4d driving scene rep- resentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.739668Z"},"links":{"cited_paper":"/paper/2410.13571","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:16b10240ef64f3069a590d440a818ace0f6b59a72cb613bdd53529f801c2aec2","observation_id":"83226228-51d0-480c-a068-0a527c51e990","resolution":{"observed_at":"2026-08-12T21:41:59.739668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06845","last_updated":"2024-04-11T04:17:13Z","snapshot_observed_at":"2026-08-16T14:10:55.463304Z","submitted_at":"2024-03-11T16:03:35Z","title":"DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06845","snapshot_observed_at":"2026-08-12T21:41:59.744181Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.744181Z"},"links":{"cited_paper":"/paper/2403.06845","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:601fa4c1920b489bab084fd359d7eb0ef2788ea3efe325dcda94a0cea12e54c3","observation_id":"65d23f81-0508-43a2-948f-b971f4c16946","resolution":{"observed_at":"2026-08-12T21:41:59.744181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.748069Z","title":"Particlesfm: Exploiting dense point trajecto- ries for localizing moving cameras in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.748069Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:a16da035a642a96f4e6c339607fa6753de8740271e9cdf2675260e5cdb1e9ec8","observation_id":"01f957f4-392d-4161-92a3-6d3224185e36","resolution":{"observed_at":"2026-08-12T21:41:59.748069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.514891Z","title":"Open-sora: Democratizing efficient video production for all, March 2024","venue":null,"work_id":"293e6551-9349-41bf-ac65-82533b7b6354","year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.752458Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:ca8bbc3d847122a31efa6e1241ca05597921c633125c2407bf2bb3ca7aaf11b6","observation_id":"013c6124-70d7-4abf-af8c-c117d933b248","resolution":{"observed_at":"2026-08-12T21:42:00.520079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-12T22:44:50.325579Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-12T21:41:59.757007Z","title":"Robodreamer: Learning compo- sitional world models for robot imagination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.757007Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:bc7c7283df7097a0561c9d614e1820230683b5e1638e75318ecb6cc44f83b0ba","observation_id":"0de8bfae-f254-4e5a-a28e-40276a54ea21","resolution":{"observed_at":"2026-08-12T21:41:59.757007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:41:59.761872Z","title":"Is sora a world simulator? a comprehensive survey on general world models and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.761872Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:d0e542936e79563969176f4ed752a7dca1c6c39bbf25baf0bf36c13a7d43ba93","observation_id":"f50bfe22-6945-4882-b889-a14139ef7987","resolution":{"observed_at":"2026-08-12T21:41:59.761872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.498844Z","title":"Kinematic Annotation Details To enhance kinematic annotation accuracy, we fuse cam- era poses from IMU and ParticleSfM [80], utilizing the Kalman filter","venue":null,"work_id":"03ade66b-03a8-46d2-86cb-2a72c73a7540","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.766300Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:3c0a0d56ac7397a41309df88f2f548eac3fee9b24e935414ec1b67c277474e5d","observation_id":"dd89e2f8-0b6f-43c3-af69-480c6f6ce5d4","resolution":{"observed_at":"2026-08-12T21:42:00.503662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.482681Z","title":"Videos cleaned from the five-point optical flow strategy (average optical flow below 3, and the proportion of optical flow (≥12 pixels) is greater than 3%)","venue":null,"work_id":"49598298-da37-485f-8281-984fc1a30be4","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.771109Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:285a1d8bf3a03b73f89a7019578eef59fff8352134327d8196370a6b9148149e","observation_id":"5d259be6-9489-4875-bbdb-1672d24aa502","resolution":{"observed_at":"2026-08-12T21:42:00.488053Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.467334Z","title":null,"venue":null,"work_id":"add1841e-9d83-4ebe-a931-b06a71ad8b74","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.775784Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:8a5987c82b32e2dc3a3fafea1be7b4b046b42b5646c2ef27406a8c8b0d5f2c8c","observation_id":"96d271da-81ed-456a-a36b-98d58c82f283","resolution":{"observed_at":"2026-08-12T21:42:00.472007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.451440Z","title":"These met- rics are as follows: Overall Quality","venue":null,"work_id":"b79d68a3-80f2-4c9e-9eb4-9705d901dc1f","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.780245Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:10c9e383b9fadf8352a5c595f002316fae0c7143c2494107a2e58ff56c6774fd","observation_id":"c15cfd60-00ce-4e2c-813b-49e7c21f3cee","resolution":{"observed_at":"2026-08-12T21:42:00.457058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.435596Z","title":"As shown in Fig","venue":null,"work_id":"245969b6-20c8-4568-adc1-006f47ff1a48","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.785064Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:320a343f64bc334b4720283539022bd557124cc4d9d1c8ef9b9ca7ed8ba247a0","observation_id":"2748e6ca-4b9b-427d-8b0f-02089335ae08","resolution":{"observed_at":"2026-08-12T21:42:00.441201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:42:00.648253Z","title":null,"venue":null,"work_id":"7a5c6bfe-97ec-444a-b6d3-8b314cd2565f","year":null},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.678863Z"},"links":{"citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:7babb030f58b9184d0b1d2c4e5427497eb493efdb23913746ffe1cb85147aa58","observation_id":"627e89fb-d820-4ead-9c7f-7c84e23ec34b","resolution":{"observed_at":"2026-08-12T21:42:00.652797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 20 inbound Pith citation observations for arXiv:2411.08380."}