{"as_of":"2026-08-24T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbfc5eeda39f00b84c0c402f9e8aab11cca68993fd183f0502073f2175beb94d","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:31:56.629967Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:01:32.165361Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:40:00.919006Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-08-07T15:01:32.165361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16665","last_updated":"2025-05-22T13:28:55Z","snapshot_observed_at":"2026-08-22T15:30:44.849549Z","submitted_at":"2025-05-22T13:28:55Z","title":"MDVT: Enhancing Multimodal Recommendation with Model-Agnostic Multimodal-Driven Virtual Triplets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:32.165361Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2505.16665"},"observation_digest":"sha256:3ae86b449c6c742aee272a8ca0e568b2e9daa22d5a800f0748f32708337174cd","observation_id":"127364a5-59da-42e0-910c-65fda40ffce6","resolution":{"observed_at":"2026-08-07T15:01:32.165361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-08-06T23:53:49.976023Z","title":"Towards understanding camera motions in any video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16047","last_updated":"2025-06-19T05:59:48Z","snapshot_observed_at":"2026-08-16T18:46:04.785363Z","submitted_at":"2025-06-19T05:59:48Z","title":"Leveraging Optimal Transport for Distributed Two-Sample Testing: An Integrated Transportation Distance-based Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:49.976023Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2506.16047"},"observation_digest":"sha256:c5b0a32849ea1e868ebad4dade63cf359a375b0ae7cca6f0db80a07ec6a4954f","observation_id":"6e78c1f2-76d4-4f05-9d49-5a51a5a27c98","resolution":{"observed_at":"2026-08-06T23:53:49.976023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-08-14T06:25:22.731553Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T16:41:08.620285Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2508.10934"},"observation_digest":"sha256:58b0787faea745741bc6564739c2f8b35d74544ab389a5b53a0089baa10ec832","observation_id":"580e7ed0-d1f7-4435-968c-c454c2334b5e","resolution":{"observed_at":"2026-05-16T16:41:08.740824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-16T00:44:08.264820Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:244f6849acf0bb78edc9980a96e66645c70b23bff33339321ecf62941e502d03","observation_id":"25a997bb-2a43-4045-b099-9f931125154c","resolution":{"observed_at":"2026-05-16T04:21:29.685627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-08-15T21:28:05.921564Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:e3cc18edb86811f99a3358f316db9ebf7dcfd910b483be4ff14ed8618cb8c1b6","observation_id":"711ea883-a30c-4f23-9442-4316bc0f85f9","resolution":{"observed_at":"2026-05-16T10:02:42.471377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2604.20157","last_updated":"2026-04-22T03:51:19Z","snapshot_observed_at":"2026-08-13T03:25:52.592184Z","submitted_at":"2026-04-22T03:51:19Z","title":"HumanScore: Benchmarking Human Motions in Generated Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:16.513512Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2604.20157"},"observation_digest":"sha256:888a77d94969a82ddfa1d9202857b38e53399433ab306650fcc55064c3d83449","observation_id":"220a4362-b9a8-4aaf-9cc7-53c8e9864681","resolution":{"observed_at":"2026-05-11T13:41:04.336350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2604.24762","last_updated":"2026-04-27T17:59:19Z","snapshot_observed_at":"2026-08-14T07:28:50.148508Z","submitted_at":"2026-04-27T17:59:19Z","title":"OmniShotCut: Holistic Relational Shot Boundary Detection with Shot-Query Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T04:15:20.045060Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2604.24762"},"observation_digest":"sha256:1e7bc13430de21e790a7955794bc10b2a46e80bf5c8489c75306f812f91f39e8","observation_id":"fc14d044-fdaf-4d48-9efb-2c47221a3f00","resolution":{"observed_at":"2026-05-11T21:46:49.149459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2605.03877","last_updated":"2026-05-05T15:37:50Z","snapshot_observed_at":"2026-08-11T09:40:51.763729Z","submitted_at":"2026-05-05T15:37:50Z","title":"DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T17:42:00.634333Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2605.03877"},"observation_digest":"sha256:e9a4d290845a26ac76a04d45b572cbf5c65591cf4703764368c5aa7b326ef021","observation_id":"245941f5-f87c-4279-a090-4c45357dd2de","resolution":{"observed_at":"2026-05-11T23:16:30.177543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2605.09433","last_updated":"2026-05-10T09:13:40Z","snapshot_observed_at":"2026-08-13T13:45:00.284853Z","submitted_at":"2026-05-10T09:13:40Z","title":"Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T02:10:27.595446Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2605.09433"},"observation_digest":"sha256:3e3bbc9862b1214395dccc014c32e8be22e10fa6c397b163aff4fcc780ecae03","observation_id":"1d7bdf41-e112-4a18-aecf-9514926b0aa0","resolution":{"observed_at":"2026-05-12T02:11:15.446378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2605.14815","last_updated":"2026-05-14T13:27:33Z","snapshot_observed_at":"2026-08-15T07:53:45.957853Z","submitted_at":"2026-05-14T13:27:33Z","title":"Probing into Camera Control of Video Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T21:11:19.441408Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2605.14815"},"observation_digest":"sha256:a820f1b39290a8c933eedb72a2bbb823e5c940ac45084518092fdc6c8e2b228c","observation_id":"f2102e95-3756-42a1-8188-7d646072807c","resolution":{"observed_at":"2026-06-30T21:15:04.352310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-08-15T00:00:35.968759Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:42ff21b9c62b7b6c2c67e790f3e55cd81c0133448bbada32fbf22eae0d0cde1a","observation_id":"b6df5c30-0758-4b1f-a8b9-e4a030b805ea","resolution":{"observed_at":"2026-05-20T05:28:04.580227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-08-07T23:34:44.066451Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:9110c28be2ba5b728aa558661eb09d3f77cf2a87f39e24138f987f32e961b6c1","observation_id":"309e9f1b-23d3-45b4-adf1-cce801da9589","resolution":{"observed_at":"2026-07-04T17:40:00.920422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2606.26964","last_updated":"2026-06-26T09:10:44Z","snapshot_observed_at":"2026-08-14T15:25:10.169406Z","submitted_at":"2026-06-25T12:38:39Z","title":"Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:38.355857Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2606.26964"},"observation_digest":"sha256:34c9e3bab3bea958273bb52bb338d4add484504ed293f69729dd91c3a701d436","observation_id":"4f0f49a4-5bcf-435d-8d7f-30686c822220","resolution":{"observed_at":"2026-07-04T13:49:52.340383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":"2504.15376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-04T17:40:00.919006Z","title":"arXiv preprint arXiv:2504.15376 , year=","venue":null,"work_id":"02d0d7d7-77ca-4683-b667-97635c707650","year":2025},"citing_paper":{"arxiv_id":"2606.26964","last_updated":"2026-06-26T09:10:44Z","snapshot_observed_at":"2026-08-14T15:25:10.169406Z","submitted_at":"2026-06-25T12:38:39Z","title":"Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T04:55:32.982338Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2606.26964"},"observation_digest":"sha256:9c954a3503e40df74146a11b74b700125abd3f5743a4383e5e5c052c3de4e7d4","observation_id":"ed033391-79e8-45d1-a3d5-dfdef1130468","resolution":{"observed_at":"2026-06-29T19:13:52.839672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2504.15376 (2025) Natural Language Camera Movement Understanding 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-15T00:54:13.958555Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:3547b186a451aee352a5825f30db6929ff0c3190a3fea3e5febdb21b8ac9f77a","observation_id":"91c0c318-7fc0-4dc1-a37a-11ee04506787","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-08-01T07:14:42.446756Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21522","last_updated":"2026-07-23T17:04:36Z","snapshot_observed_at":"2026-08-07T01:35:32.908201Z","submitted_at":"2026-07-23T17:04:36Z","title":"GS-Agent: Creating 4D Physical Worlds With Generative Simulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:14:42.446756Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2607.21522"},"observation_digest":"sha256:d51ecbebf67e8964cf546164b5a3be0fba011f1992dead109f5739ab2f02c883","observation_id":"18e482bd-c9b6-4f99-8506-30cf03e0c49c","resolution":{"observed_at":"2026-08-01T07:14:42.446756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-08-01T07:07:43.948987Z","title":"Towards understanding camera motions in any video.arXiv preprint arXiv:2504.15376, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21576","last_updated":"2026-07-23T17:55:07Z","snapshot_observed_at":"2026-08-16T17:56:04.130282Z","submitted_at":"2026-07-23T17:55:07Z","title":"Self-Supervised Learning of Structured Dynamics from Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:07:43.948987Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2607.21576"},"observation_digest":"sha256:1d73382ae8b5680d27687c19e4aa1fa1532f6d092c82ef053e8d1fed1325454a","observation_id":"28d0b606-de80-41da-bdf2-c07efc56d5bc","resolution":{"observed_at":"2026-08-01T07:07:43.948987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15376","snapshot_observed_at":"2026-07-31T11:10:41.548774Z","title":"CoRRabs/2504.15376(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24591","last_updated":"2026-07-27T15:55:08Z","snapshot_observed_at":"2026-08-14T08:22:39.737484Z","submitted_at":"2026-07-27T15:55:08Z","title":"CameraAnything: Refilming Videos with Arbitrary Camera Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T11:10:41.548774Z"},"links":{"cited_paper":"/paper/2504.15376","citing_paper":"/paper/2607.24591"},"observation_digest":"sha256:f811fc0cc9c429e665f250bd4173422820f75ca8c4ae3338fff579656bb3b20b","observation_id":"a29f6672-bca4-4dc4-97d7-1e24f41ee6f1","resolution":{"observed_at":"2026-07-31T11:10:41.548774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15376/citation-record","integrity":"/paper/2504.15376/integrity","json":"/paper/2504.15376/citation-record.json","paper":"/paper/2504.15376"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.884095Z","title":"The anatomy of video editing: A dataset and benchmark suite for ai-assisted video editing","venue":null,"work_id":"96b97955-4727-4163-b596-57b02a043023","year":2022},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.252069Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:9bdfe78e7cae3cc2a54dad470e5c7ee8aa3f2bfb4e9d5e60ec4fcc981df06b95","observation_id":"c54bb016-e98f-4b83-8775-f0af14e55556","resolution":{"observed_at":"2026-08-16T11:31:57.889056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18673","last_updated":"2025-05-06T13:11:14Z","snapshot_observed_at":"2026-08-16T08:18:45.331169Z","submitted_at":"2024-11-27T18:49:13Z","title":"AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18673","snapshot_observed_at":"2026-08-16T11:31:56.258440Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.258440Z"},"links":{"cited_paper":"/paper/2411.18673","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:f3f05dde4f27d05a5edee4e0983a10241e951bd7d09c04bd76930b1f3023f928","observation_id":"f81330bf-6c70-45e6-862b-517b081a15ad","resolution":{"observed_at":"2026-08-16T11:31:56.258440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12781","last_updated":"2025-03-22T15:40:42Z","snapshot_observed_at":"2026-08-19T14:50:19.016025Z","submitted_at":"2024-07-17T17:59:05Z","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12781","snapshot_observed_at":"2026-08-16T11:31:56.264019Z","title":"Vd3d: Taming large video diffusion transformers for 3d camera control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.264019Z"},"links":{"cited_paper":"/paper/2407.12781","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:b8089d2caef4eb2004f8ecd2f35171cffd77e2628f5322e1269e7196a8b745ae","observation_id":"a7717c8b-0f33-455f-912e-4372ebbf1651","resolution":{"observed_at":"2026-08-16T11:31:56.264019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-16T11:31:56.269418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.269418Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:8a3dadd4b2a43d3efbe455b813920f639c21a35d464b483581dd26467d779919","observation_id":"fdb7c8e7-ee6c-4f90-9ab7-1f46c709a41d","resolution":{"observed_at":"2026-08-16T11:31:56.269418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-16T13:12:45.748381Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-16T11:31:56.274698Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.274698Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:7349da51fdea9b7b095c60ef8c038bda5e23e462226e5dbd2f008dc36ae59c56","observation_id":"accaba5b-d68a-491b-9d1f-baec2974b67c","resolution":{"observed_at":"2026-08-16T11:31:56.274698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-08-20T10:21:54.278311Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-16T11:31:56.279937Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.279937Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:8280b2cbb07b4b809e9ea48fac41f7b3665ae53b53fc9fd7e116099ccb1a9321","observation_id":"c2004e56-598b-46ed-974f-df4c2b89c741","resolution":{"observed_at":"2026-08-16T11:31:56.279937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-15T10:28:42.385124Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-16T11:31:56.285275Z","title":"Goku: Flow based video generative foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.285275Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:51dc46b967272e78407434c558770b5ae78b1df806d2aa25b77ac8ea26696e0c","observation_id":"8e191f2c-bb0b-42af-894f-7019a1eb7067","resolution":{"observed_at":"2026-08-16T11:31:56.285275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10802","last_updated":"2024-10-14T17:58:07Z","snapshot_observed_at":"2026-08-18T12:56:43.699225Z","submitted_at":"2024-10-14T17:58:07Z","title":"Boosting Camera Motion Control for Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10802","snapshot_observed_at":"2026-08-16T11:31:56.290615Z","title":"Boosting camera motion control for video diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.290615Z"},"links":{"cited_paper":"/paper/2410.10802","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:d1ea8f92b0a6a238036852b139aff1e9f80f421b0b4d47d4d648253d2fa197c6","observation_id":"194de423-8b6b-4acf-94fb-c7fa89165f39","resolution":{"observed_at":"2026-08-16T11:31:56.290615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.869727Z","title":"Optimal structure from motion: Local ambiguities and global estimates","venue":null,"work_id":"3669fd4e-237d-483c-af0e-38707993612b","year":2000},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.295078Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:ba07fab99773612f0dbe453311a56c8bba7bdadba1f92a88e3f87f5306c827f9","observation_id":"0cdbb948-919d-40b4-acd8-d76b40151c35","resolution":{"observed_at":"2026-08-16T11:31:57.874327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.855106Z","title":"Et the exceptional trajectories: Text-to-camera-trajectory generation with character awareness","venue":null,"work_id":"9bd0b377-a9d5-49e9-bb99-71b2926e5ae8","year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.299791Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:d6b8e95e08f846f0fc6d6c5d7be7352a2acf5457bad0fb0413aca046c841ff8c","observation_id":"bc8485f0-ba4a-4194-ba59-721496c639f7","resolution":{"observed_at":"2026-08-16T11:31:57.859637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.840437Z","title":"Understanding noise sensitivity in structure from motion","venue":null,"work_id":"0022c310-52b6-4b8f-953d-9a39bbe7a11b","year":2013},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.304159Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:b77274f0b3cceaaa3251e7b523c944b453eba75dfbdfda8591f9b75070d46144","observation_id":"05e04c7e-d9af-4f9a-8802-59a1ab559042","resolution":{"observed_at":"2026-08-16T11:31:57.844861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.308530Z","title":"Monoslam: Real-time single camera slam","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.308530Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:5d3e50fff108ab4dbe334ca6b19ec7f3217d587363b862c7228c5c984aa5a041","observation_id":"a44c2f2d-ed5b-41e9-82f1-53c6640bc6a3","resolution":{"observed_at":"2026-08-16T11:31:56.308530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.816344Z","title":"Types of camera movements in film explained: Definitive guide, 2020","venue":null,"work_id":"ab00f88d-b0d3-4c87-8c5c-8ad769e79761","year":2020},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.313096Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:a28852d421f74abbc8772df1d86d9c1e2ffddb3daa085a2d10cfa1b34847c85b","observation_id":"beed10a5-b494-403d-909a-37bcdae994f4","resolution":{"observed_at":"2026-08-16T11:31:57.821017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19152","last_updated":"2024-09-27T21:29:58Z","snapshot_observed_at":"2026-08-16T13:14:37.730891Z","submitted_at":"2024-09-27T21:29:58Z","title":"MASt3R-SfM: a Fully-Integrated Solution for Unconstrained Structure-from-Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19152","snapshot_observed_at":"2026-08-16T11:31:56.317723Z","title":"Mast3r-sfm: a fully-integrated solution for unconstrained structure-from-motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.317723Z"},"links":{"cited_paper":"/paper/2409.19152","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:cb0a427d28d873279d79cbcd182881e156440113f9d5b91605c7411fed3ea083","observation_id":"545c363a-3ed7-4e3f-8229-cec04c572bdd","resolution":{"observed_at":"2026-08-16T11:31:56.317723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.801209Z","title":"Cinematic journeys: Film and movement","venue":null,"work_id":"6b05e56a-7f2b-4073-a55c-5f795ea2780b","year":2010},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.322432Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:9131d5bbf02f3c45893d98b50d96b7ac6fdf29a12eb07344d52c995628583245","observation_id":"39d37a5e-1ef6-42e8-a58c-bc8ffcdc7009","resolution":{"observed_at":"2026-08-16T11:31:57.805875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.326706Z","title":"Lsd-slam: Large-scale direct monocular slam","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.326706Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:5707ecc9ddc8df94c36d799270aa5ca472476f19f8ec86c0d7f49c7604c0e911","observation_id":"b2e3959d-9749-4199-a70c-7150ab5a1047","resolution":{"observed_at":"2026-08-16T11:31:56.326706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.777820Z","title":"Ambiguity in structure from motion: Sphere versus plane","venue":null,"work_id":"c5cbaad7-e71e-44ea-b2f8-d107f8e16521","year":1998},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.331335Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:b011eda2db285bd252d8d727ea70f7ea80cd7ef7c648aaf0f50968866cb28e57","observation_id":"0ac2ce22-0e9d-4171-b651-a5333cfa160a","resolution":{"observed_at":"2026-08-16T11:31:57.782580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.762583Z","title":"Motion parallax and absolute distance","venue":null,"work_id":"87446b56-d147-45b9-8e00-eb61230732b9","year":1972},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.335953Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:24844cbb15ab38bd11a6bea9de0868cb64a6b4aba4a75f3026d606bf89d252d0","observation_id":"2ddb2f6d-1772-402d-b384-4ca8c33c6df4","resolution":{"observed_at":"2026-08-16T11:31:57.767325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.746833Z","title":"The ecological approach to visual perception","venue":null,"work_id":"fba63b88-448d-40f5-8da3-b0528b281657","year":2003},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.340442Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:c8dcbee8ce3bb26191337a4bf4afaf12a2f91d1f048321493db15885c557ac83","observation_id":"a540214e-40af-4634-8f5c-3869f94607cb","resolution":{"observed_at":"2026-08-16T11:31:57.751836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.345091Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.345091Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:615da30730a43a5e285433193d5b8fac3ae4cb6630c073c3bd9ca17f26a06e28","observation_id":"430c5e9d-989a-4db9-aeb5-e003df86707e","resolution":{"observed_at":"2026-08-16T11:31:56.345091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.349754Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.349754Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:0bbb49fc85edbf372970e3268ca41e190f4c291b50cbba6f7d9e519195c54e21","observation_id":"2a24dbd7-63d1-4f24-9b47-f851edfb3b64","resolution":{"observed_at":"2026-08-16T11:31:56.349754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:31:56.354373Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.354373Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:91f437ef275feba2ad68e87bdfe66c73e6aa1e13d617ca3a47a885c472d47e95","observation_id":"2f9c43d9-b117-4825-96a8-3cf6a98ca19a","resolution":{"observed_at":"2026-08-16T11:31:56.354373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-16T11:31:56.359376Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.359376Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:b3be53e02726f000611c1464014b7b5a6a09a7a18123a8bb95fd288b3e5bc5eb","observation_id":"98a39f6a-1f83-4ca4-b286-686804300c6b","resolution":{"observed_at":"2026-08-16T11:31:56.359376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T11:31:56.364098Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.364098Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:3f5c4d94b9db7e072a440102e124de8c8d54f705b22ba0f912d0174469b1c154","observation_id":"d463f054-8252-4d31-8bdf-5061e46b5dde","resolution":{"observed_at":"2026-08-16T11:31:56.364098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-08-19T19:37:42.868002Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02955","snapshot_observed_at":"2026-08-16T11:31:56.369178Z","title":"Motionbench: Benchmarking and improving fine-grained video motion understanding for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.369178Z"},"links":{"cited_paper":"/paper/2501.02955","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:8d3312883f8f03f551a49623b050122a4c76d65297da2a705c80f6144bfaa098","observation_id":"d8f146aa-1697-494e-8a8c-d57fcf873e06","resolution":{"observed_at":"2026-08-16T11:31:56.369178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09620","last_updated":"2024-12-12T18:59:54Z","snapshot_observed_at":"2026-08-18T20:53:57.084236Z","submitted_at":"2024-12-12T18:59:54Z","title":"Learning Camera Movement Control from Real-World Drone Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09620","snapshot_observed_at":"2026-08-16T11:31:56.373996Z","title":"Learning camera movement control from real-world drone videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.373996Z"},"links":{"cited_paper":"/paper/2412.09620","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:0329b86ded0dde008312b6feb75ec9a66421f1a770e097756587f14b06d73f4b","observation_id":"b88b164a-1527-47b1-bd16-db773aba8bca","resolution":{"observed_at":"2026-08-16T11:31:56.373996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.711217Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"e4443b58-4462-4d61-811d-255d54ed50b1","year":2020},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.379122Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:8488fa44d00e1dd643e30e7465ec0f6c52ae22adf8c8c37fbf19df3ff85e715d","observation_id":"5691f187-d59f-4c7f-8bb0-ce620a8a1016","resolution":{"observed_at":"2026-08-16T11:31:57.716321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.695488Z","title":"Cinematographic camera diffusion model","venue":null,"work_id":"a4ae5128-fffd-4ce4-b961-86b6bfcb01e7","year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.383477Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:402549ae016b59b25df4770f21367917bdaaa78b65883dd9bcf4bd1c608e10bb","observation_id":"1b56008b-6a2b-4696-9f28-ed128c074d76","resolution":{"observed_at":"2026-08-16T11:31:57.700062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09621","last_updated":"2025-04-30T17:59:59Z","snapshot_observed_at":"2026-08-23T13:52:43.532822Z","submitted_at":"2024-12-12T18:59:54Z","title":"Stereo4D: Learning How Things Move in 3D from Internet Stereo Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09621","snapshot_observed_at":"2026-08-16T11:31:56.387923Z","title":"Stereo4d: Learning how things move in 3d from internet stereo videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.387923Z"},"links":{"cited_paper":"/paper/2412.09621","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:5d213fc1bbdf69920f4da96fa5fcac4c2d2895210930cba723b0764fac11cea7","observation_id":"6dc3cf78-ab73-43a5-a23b-714df86e6745","resolution":{"observed_at":"2026-08-16T11:31:56.387923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10836","last_updated":"2024-11-16T16:36:49Z","snapshot_observed_at":"2026-08-16T04:13:56.232586Z","submitted_at":"2024-11-16T16:36:49Z","title":"AnimateAnything: Consistent and Controllable Animation for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10836","snapshot_observed_at":"2026-08-16T11:31:56.392654Z","title":"Animateanything: Consistent and controllable animation for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.392654Z"},"links":{"cited_paper":"/paper/2411.10836","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:960e8a6b0c15977c587bdb157db9a7ad61e26f4dc02191ca389ca274317ff6c7","observation_id":"92eed851-c879-4518-a321-f88129306833","resolution":{"observed_at":"2026-08-16T11:31:56.392654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.680902Z","title":"Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":"834dfbc9-4bd8-4a3e-9804-ca3a6d72f0a7","year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.397771Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:cb6b76469c94e32566a5c504e2e5a7bf442b177541a9ea9d03db4928843d3eec","observation_id":"c2db6ad2-4d91-42cb-b98e-2f293c0bf4a8","resolution":{"observed_at":"2026-08-16T11:31:57.685508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.665865Z","title":"Naturalbench: Evaluating vision-language models on natural adversarial samples","venue":null,"work_id":"3d66d43e-49e9-4d17-a42e-67b6cb1dfd75","year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.402293Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:19a9d6b5f08c6b0e75effe2d390c744be2c48caa4be979286efb45fccbe59b49","observation_id":"713c1d77-b5a0-4ca7-96e9-2a1700735e90","resolution":{"observed_at":"2026-08-16T11:31:57.670981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T11:31:56.406857Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.406857Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:f968dbe0f56c609de269991d67631b0582cf664dd641c563dbbf708386cbad8f","observation_id":"d723d971-3cd1-4517-bcec-fbb382390815","resolution":{"observed_at":"2026-08-16T11:31:56.406857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-16T11:31:56.411838Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.411838Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:a8d9cc4128e1e37ee4a99042538f3a390ca5fc61689b823e83394ad978e867f3","observation_id":"49e4444d-50fc-4f7b-bab0-a6694352bbe1","resolution":{"observed_at":"2026-08-16T11:31:56.411838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.650789Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"22fa05f5-e86e-4c4c-87a7-d6e16993195b","year":2023},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.416716Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:d367ded66179b2eded121c98db5511beee5c6a2d15bdb32e756c4f913dab915c","observation_id":"40f5637a-9e6d-45a8-83a0-0d1725b13853","resolution":{"observed_at":"2026-08-16T11:31:57.655657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-17T20:10:03.387661Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-16T11:31:56.421465Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.421465Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:9505bc81d9c4666d518b5b811a9be462d62a4b7a9de1db32b9668f543b83bf7e","observation_id":"0d0b4cfa-6c03-4f3d-b303-e9884970246f","resolution":{"observed_at":"2026-08-16T11:31:56.421465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12223","last_updated":"2025-03-28T03:50:25Z","snapshot_observed_at":"2026-08-14T03:18:45.580820Z","submitted_at":"2024-12-16T09:02:24Z","title":"Can video generation replace cinematographers? Research on the cinematic language of generated video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12223","snapshot_observed_at":"2026-08-16T11:31:56.426125Z","title":"Can video generation replace cinematographers? research on the cinematic language of generated video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.426125Z"},"links":{"cited_paper":"/paper/2412.12223","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:b05373afc4d7bec46444e0dafe1d956ae6a796ee8200176d1ec2f19069464afa","observation_id":"da734167-211c-4d1c-a33b-8ed90ab449ab","resolution":{"observed_at":"2026-08-16T11:31:56.426125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04463","last_updated":"2024-12-06T19:15:46Z","snapshot_observed_at":"2026-08-15T16:21:22.848209Z","submitted_at":"2024-12-05T18:59:42Z","title":"MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04463","snapshot_observed_at":"2026-08-16T11:31:56.430839Z","title":"Megasam: Accurate, fast, and robust structure and motion from casual dynamic videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.430839Z"},"links":{"cited_paper":"/paper/2412.04463","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:042a1cae45a1aca93091e07a887073862cdbabdca50e7345d563d7df3e6bb812","observation_id":"6c57dced-b6bd-4e26-8913-07409ef61ca6","resolution":{"observed_at":"2026-08-16T11:31:56.430839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.635378Z","title":"Multimodality helps unimodality: Cross-modal few-shot learning with multimodal models, 2023","venue":null,"work_id":"ca379b6d-6ba7-4684-b089-a0966179b1d5","year":2023},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.435524Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:1e380f58d1583a7a2a5e570388a375d310b281486a458f12d5c906f15792b874","observation_id":"cd01364b-fee4-4072-929c-885a395e1243","resolution":{"observed_at":"2026-08-16T11:31:57.640371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-08-16T15:27:00.450500Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-16T11:31:56.440129Z","title":"Revisiting the role of language priors in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.440129Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:55f6695e37ec42995a1e77007fb6bfde6bccec52476a3418a2c8ba8144455b1f","observation_id":"4e3b89c1-6997-4504-8905-d1072be5caae","resolution":{"observed_at":"2026-08-16T11:31:56.440129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-08-20T13:19:38.099097Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-16T11:31:56.444840Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.444840Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:3ff30ac30678473331f24272f18af5d5072dbc67a552a61f3d744db13f9b7499","observation_id":"958bfd97-f328-49b7-b1d3-4b08c20d8ad2","resolution":{"observed_at":"2026-08-16T11:31:56.444840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.450223Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.450223Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:471dbed00f456246380a1b8c4091439b4772fa8b491c1084d7aa2871d9082b79","observation_id":"9a46f69e-d210-48ed-b606-30f628382720","resolution":{"observed_at":"2026-08-16T11:31:56.450223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05950","last_updated":"2024-05-14T03:20:42Z","snapshot_observed_at":"2026-08-23T15:20:36.067138Z","submitted_at":"2023-09-12T04:03:41Z","title":"Language Models as Black-Box Optimizers for Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05950","snapshot_observed_at":"2026-08-16T11:31:56.455342Z","title":"Language models as black-box optimizers for vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.455342Z"},"links":{"cited_paper":"/paper/2309.05950","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:fe4d44c782950014f80a913f9f2a782e4aae4462d3589ea89bdf4e4b237df292","observation_id":"12ce1517-8066-402d-b816-8a313ccab6c1","resolution":{"observed_at":"2026-08-16T11:31:56.455342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.610900Z","title":"Chatcam: Empowering camera control through conversational ai","venue":null,"work_id":"68792f1d-0eaf-43cc-8a50-24c1dd2eb71f","year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.460415Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:7e5d6388bddaa53bfa7c8ce1666c392394c0e330586a7f21c252687ad4ed8d5c","observation_id":"34a5909f-7418-4156-bcd5-4dc071bb190a","resolution":{"observed_at":"2026-08-16T11:31:57.615581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:31:56.464994Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.464994Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:7d14aa2459f7694fe1387aa5aaf50aae500e0f7663c336b095459320b06f6eb2","observation_id":"34a8e7d2-b4b6-4a8c-a794-a11837d588d5","resolution":{"observed_at":"2026-08-16T11:31:56.464994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12425","last_updated":"2024-05-22T16:29:58Z","snapshot_observed_at":"2026-08-16T14:25:22.939533Z","submitted_at":"2024-01-23T01:25:00Z","title":"The Neglected Tails in Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12425","snapshot_observed_at":"2026-08-16T11:31:56.469528Z","title":"The neglected tails of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.469528Z"},"links":{"cited_paper":"/paper/2401.12425","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:d8415badfb31299b38e7ca88a08b614c1d56b382f779d818c0153adc4073feca","observation_id":"51305558-5bdb-4ba2-bd34-d1f27e75d8c4","resolution":{"observed_at":"2026-08-16T11:31:56.469528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.596041Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":"823f2d87-8d26-4438-8bde-bd2e84906bed","year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.474305Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:a2a11d43ae21820aa708956b2d17ebf66a70ff831d1b533570ae25e2b89b01a6","observation_id":"8df05936-99b6-4286-9707-52b9972a6bdb","resolution":{"observed_at":"2026-08-16T11:31:57.600678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.478859Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.478859Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:1e6ee75a0de5c7de360bbaeed1ef3427059fb04b022da3458b5aa686d2f5d583","observation_id":"eb53926f-b00b-4e43-8155-de4a81340e2f","resolution":{"observed_at":"2026-08-16T11:31:56.478859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.571784Z","title":"A unified framework for shot type classification based on subject centric lens","venue":null,"work_id":"8a174eff-b6eb-4277-b67d-5a138c4ddba3","year":2020},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.483209Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:5c4fbfdf0ae57580fc25068cdb1ee42868b65237ad72cac87c3b25a5daa72e79","observation_id":"c66a896e-68ef-4b6d-9378-acced6cda7f1","resolution":{"observed_at":"2026-08-16T11:31:57.576429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.556343Z","title":"Motion parallax as an independent cue for depth perception.Perception, 8(2):125–134, 1979","venue":null,"work_id":"23dd0375-f336-4f62-aef3-ed3d40131405","year":1979},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.487993Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:77fefc7ad126847d6552adc2be1444b6709b666b23067cb59c1b4fd0a5f41d71","observation_id":"2c6430ab-ca37-4373-ac90-9db3b852d0ec","resolution":{"observed_at":"2026-08-16T11:31:57.561587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.492394Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.492394Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:b96b5a4b33a1b8bcf3a6419ceb53ba26c4d3ba48a9e9a293a7e570b31f510a22","observation_id":"a6427f87-5a08-45f1-af59-1fb2215e5e05","resolution":{"observed_at":"2026-08-16T11:31:56.492394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01425","last_updated":"2025-07-20T08:17:15Z","snapshot_observed_at":"2026-08-10T22:25:38.795793Z","submitted_at":"2025-01-02T18:59:45Z","title":"Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01425","snapshot_observed_at":"2026-08-16T11:31:56.496850Z","title":"Free-form motion control: A synthetic video generation dataset with controllable camera and object motions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.496850Z"},"links":{"cited_paper":"/paper/2501.01425","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:9d8f033fb869a01c0ece68f7c6d941c383bc28a7e27384f0c0808f28d18a3ea1","observation_id":"e51cdf39-5066-457a-9ed1-d478544a2e20","resolution":{"observed_at":"2026-08-16T11:31:56.496850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.501833Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.501833Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:f8b8509925ef9a499729fac38d02f48e2f65e99219ebc76fe23042ee72b7315d","observation_id":"cd2172a3-50e6-4b28-887b-943632cd2997","resolution":{"observed_at":"2026-08-16T11:31:56.501833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.522103Z","title":"A grammar of the film: An analysis of film technique","venue":null,"work_id":"acc44478-84c3-4752-a4a8-bb0facd14ddc","year":1969},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.506107Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:7e87ff23a9f055808ea8b8c3852df4996d4dc0ba473818e283f06ec79827a861","observation_id":"8d5323e1-d71d-40c3-aed7-1c47f60bd1b3","resolution":{"observed_at":"2026-08-16T11:31:57.526846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.507322Z","title":"Visual slam algorithms: A survey from 2010 to","venue":null,"work_id":"48d1fc1e-d453-4265-a783-7c4a01154333","year":2010},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.510614Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:de070c8d4a3fcac5f67ff9c5dc1c1feadf3a27d588280baf48eeadc75f69c29d","observation_id":"57b43a73-8850-4c63-90b3-08bc0986677a","resolution":{"observed_at":"2026-08-16T11:31:57.512189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.519524Z","title":"Vidcomposition: Can mllms analyze compositions in compiled videos? arXiv preprint arXiv:2411.10979, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.519524Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:0ec87dadd1824116d06ad0799386eae411d594b90eb0627e5f9fb38240f31831","observation_id":"a7990c5c-a314-421d-a5ed-711bb1e5d876","resolution":{"observed_at":"2026-08-16T11:31:56.519524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T11:31:56.524009Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.524009Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:f0d16e41ab1b6d917a89c717e237141ec96e0c67ede38fbe4e480847ac0d6e7f","observation_id":"cd7f0e3a-35c3-4d29-b77c-aa4b4bb11f04","resolution":{"observed_at":"2026-08-16T11:31:56.524009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.476816Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":"058f2a38-5780-4541-854a-4a4beae4d21e","year":2022},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.528838Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:bd2578a97cf76052b7c17a87d772be1a8be8853698c515805afb8d34a0c9138d","observation_id":"69b43521-4bf4-40af-97dd-08715950dc79","resolution":{"observed_at":"2026-08-16T11:31:57.481654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.533385Z","title":"Vggsfm: Visual geometry grounded deep structure from motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.533385Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:78e633df6992274d077e49207089acf93cec15e758628c580b2cdba80f8ca929","observation_id":"e1e1073e-887e-47af-90f5-ee74b3a70efe","resolution":{"observed_at":"2026-08-16T11:31:56.533385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-16T13:38:25.179414Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-16T11:31:56.538046Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.538046Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:0d6868b9a5c6dae6375e20e0c7b43f68c39e5f9086effb5c7c40bef4bb33ac17","observation_id":"5c05d351-778a-496b-9157-98155d2fb5f4","resolution":{"observed_at":"2026-08-16T11:31:56.538046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12387","last_updated":"2025-01-21T18:59:23Z","snapshot_observed_at":"2026-08-16T14:09:46.395011Z","submitted_at":"2025-01-21T18:59:23Z","title":"Continuous 3D Perception Model with Persistent State","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12387","snapshot_observed_at":"2026-08-16T11:31:56.543345Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.543345Z"},"links":{"cited_paper":"/paper/2501.12387","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:0338338a4f55683a22511730fa12c7e6fac8b03ba7b5654185480475dfa0f2b8","observation_id":"49154c57-10c3-4d2d-acff-39452055c994","resolution":{"observed_at":"2026-08-16T11:31:56.543345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.547973Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.547973Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:44d488ac9230a4fb4155345e8ffe6c053f0b881d7b0ac7942e494f4cf9b595e5","observation_id":"fe7c90a6-0914-4366-93df-b08451e1e27e","resolution":{"observed_at":"2026-08-16T11:31:56.547973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.442287Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"3ad9a04d-6dee-458a-b11b-7b1feef86401","year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.552469Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:6afe6c8c535d9d5cff88f9af820df54d8f0f9cb931518b49879c64b3fe463b67","observation_id":"7c84f8ba-0b31-43f5-afcd-dd55dc26c0ed","resolution":{"observed_at":"2026-08-16T11:31:57.447191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01429","last_updated":"2024-12-02T12:10:00Z","snapshot_observed_at":"2026-08-22T14:15:42.571975Z","submitted_at":"2024-12-02T12:10:00Z","title":"CPA: Camera-pose-awareness Diffusion Transformer for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01429","snapshot_observed_at":"2026-08-16T11:31:56.557164Z","title":"Cpa: Camera-pose- awareness diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.557164Z"},"links":{"cited_paper":"/paper/2412.01429","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:da2dcbc6d13b2d5a04ec593638a6f61dada33f60be22ea71ed133db13d4dec3d","observation_id":"c13e7384-7680-4cde-bc54-3664d9db2ddb","resolution":{"observed_at":"2026-08-16T11:31:56.557164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.426946Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":"5c120506-d4fc-49b6-9a85-a41f335c4564","year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.562638Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:92869569795aedbc0d2b4593fc0ce5aca68c710dccf3f90744d9d9cee8b49ecc","observation_id":"6c1241ba-f910-4fea-bafa-7d1c940d5128","resolution":{"observed_at":"2026-08-16T11:31:57.431615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19324","last_updated":"2024-11-28T18:59:51Z","snapshot_observed_at":"2026-08-17T15:25:09.988792Z","submitted_at":"2024-11-28T18:59:51Z","title":"Trajectory Attention for Fine-grained Video Motion Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19324","snapshot_observed_at":"2026-08-16T11:31:56.567142Z","title":"Trajectory attention for fine-grained video motion control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.567142Z"},"links":{"cited_paper":"/paper/2411.19324","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:8b8f64a476fe3bf760fd3848ef3a4699719f23172e4c552bf799dc948539ad24","observation_id":"e751bc5a-ee03-48c2-bae1-bf5a391a1f79","resolution":{"observed_at":"2026-08-16T11:31:56.567142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04299","last_updated":"2025-02-06T18:41:04Z","snapshot_observed_at":"2026-08-18T23:50:33.850532Z","submitted_at":"2025-02-06T18:41:04Z","title":"MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04299","snapshot_observed_at":"2026-08-16T11:31:56.571810Z","title":"Motioncanvas: Cinematic shot design with controllable image-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.571810Z"},"links":{"cited_paper":"/paper/2502.04299","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:0c008b786312fe9a7c9b236f7349b73cfe51496feda7a3fe6406e79b2ee65929","observation_id":"2605e6ca-d8fa-49ca-bfc0-35ed89f33818","resolution":{"observed_at":"2026-08-16T11:31:56.571810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.576677Z","title":"Direct-a-video: Customized video generation with user-directed camera movement and object motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.576677Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:a3eabec74328fdfc5cee3f5461ec25a9c862fb903919a26e0fdf29a0e7acb7e2","observation_id":"316e1eff-a610-46e2-8250-f6d02fc2e671","resolution":{"observed_at":"2026-08-16T11:31:56.576677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-16T11:31:56.581101Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.581101Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:68fb5ff3d3f65fe7463c886c23b2f35c3a61ebc449417a4fdb56644e2fd5ce39","observation_id":"db84b5e2-f00e-4e45-9445-43f40a683aa4","resolution":{"observed_at":"2026-08-16T11:31:56.581101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-17T15:18:36.149300Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-16T11:31:56.585601Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.585601Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:020c7d6b6a5b704dbd079df61782f9cf51e5337350f463451f96fe6b5cec8348","observation_id":"85cdf9c8-dcd6-41b6-b758-a480572fb9ad","resolution":{"observed_at":"2026-08-16T11:31:56.585601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-16T11:31:56.590340Z","title":"Internlm-xcomposer2.5-omnilive: A comprehensive multimodal system for long-term streaming video and audio interactions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.590340Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:714ff4fcaeb1059db4501581416f9e087e0ae41ad4bded8fb10acb9540e69fd1","observation_id":"61a438b0-bfb6-49f1-9949-94f0d8549a88","resolution":{"observed_at":"2026-08-16T11:31:56.590340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-16T11:31:56.595009Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.595009Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:2c748835e0ea092e64bb92b548254d259c1426142f6586c4e57063c68d44ac01","observation_id":"3dad9ab5-fc2e-420b-bb21-ccd8b7691102","resolution":{"observed_at":"2026-08-16T11:31:56.595009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:56.599970Z","title":"Structure and motion from casual videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.599970Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:bd131dc24098321b647f60af8a2956c48a0f1868a3e0f4cc7aa427f5a4034af2","observation_id":"35aec037-5ca6-40b3-8106-f2f4822493df","resolution":{"observed_at":"2026-08-16T11:31:56.599970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07531","last_updated":"2026-06-17T07:15:21Z","snapshot_observed_at":"2026-08-14T14:18:10.233278Z","submitted_at":"2025-02-11T13:11:59Z","title":"VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07531","snapshot_observed_at":"2026-08-16T11:31:56.604627Z","title":"Vidcraft3: Camera, object, and lighting control for image-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.604627Z"},"links":{"cited_paper":"/paper/2502.07531","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:7534a8f83db3162dc0a86ac536d8708d89f546315ebc0a4db2cc56a12f4390ca","observation_id":"f7b9e279-574e-42f4-b805-606a3f4650c4","resolution":{"observed_at":"2026-08-16T11:31:56.604627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-08-16T00:52:41.730888Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-08-16T11:31:56.609266Z","title":"Stereo magnification: Learning view synthesis using multiplane images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.609266Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:6810f12fe43b5710bc304d521414537d6bbd5e0ec2eeb8f4b63eaadaa371e1be","observation_id":"5bd11483-4e0e-48b5-9d22-6632337f1a79","resolution":{"observed_at":"2026-08-16T11:31:56.609266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06029","last_updated":"2024-12-08T18:59:54Z","snapshot_observed_at":"2026-08-17T07:51:03.885112Z","submitted_at":"2024-12-08T18:59:54Z","title":"Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06029","snapshot_observed_at":"2026-08-16T11:31:56.614294Z","title":"Latent-reframe: Enabling camera control for video diffusion model without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.614294Z"},"links":{"cited_paper":"/paper/2412.06029","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:445cad039e9897da7d750e06c42bca4090599b0d479e5c87cfb3a1c2067785d7","observation_id":"822936e3-7891-4abc-93ed-32d1f31dd543","resolution":{"observed_at":"2026-08-16T11:31:56.614294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.392556Z","title":"the camera zooms in for a push shot","venue":null,"work_id":"6ce86e55-f3c7-47b4-9341-3b193e1c86bf","year":2022},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.619693Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:9b04d601ed744b2f07188038669134cee413d85f953975be694eabaeaf7c5244","observation_id":"2cf50800-f62e-48ad-ad3d-a838b8a13be2","resolution":{"observed_at":"2026-08-16T11:31:57.397945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.375765Z","title":null,"venue":null,"work_id":"cd12e45e-478d-4558-a75b-8502ec9eac1c","year":null},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.625203Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:8cce6670ce7df2bfd28fdf7eaaa8b76cafab43cfaebd2beb94c646ec99e463b5","observation_id":"c2a284e2-9185-48f2-a719-ae44accdb98f","resolution":{"observed_at":"2026-08-16T11:31:57.381270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.358327Z","title":"north” or toward the top of the frame, and backward motion ( dolly-out) as moving “south","venue":null,"work_id":"705a92f3-5297-423c-8d8e-c13752b00587","year":null},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.629967Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:11dc73a111141411f986c5458e0f956ed8fd4298073751281c49376cf74a8630","observation_id":"a181f2ec-b58e-4747-9d98-538559842eef","resolution":{"observed_at":"2026-08-16T11:31:57.364891Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:31:57.491927Z","title":null,"venue":null,"work_id":"da708a66-de18-47ca-98b2-24c52b918bf4","year":2017},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.515070Z"},"links":{"citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:c20f7de85bdb1950ae161c76b062328f528e197d586bb6853d5d075be240430f","observation_id":"414dbcd9-68f1-447e-bc8a-ed9fa28adea6","resolution":{"observed_at":"2026-08-16T11:31:57.496846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 18 inbound Pith citation observations for arXiv:2504.15376."}