{"as_of":"2026-08-09T06:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c655f15c9a82c0f5dbda7dfd4b8b4e4bfdfbee8a795cc099c6fb22241f635e9a","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:07:58.535598Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T04:39:22.400458Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T04:40:23.162451Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"cited_work":{"arxiv_id":"2502.05503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05503","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b362e41-6f7c-4552-a91d-7e9476a25964","year":2025},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2502.05503","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:ed1b5f8e9cd9fd57110074cad3024730a73af044815ecc7439b98a1a65f1309c","observation_id":"560fa5f9-410a-468d-a39f-088e8b0260b2","resolution":{"observed_at":"2026-05-25T04:40:23.166018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05503/citation-record","integrity":"/paper/2502.05503/integrity","json":"/paper/2502.05503/citation-record.json","paper":"/paper/2502.05503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.076326Z","title":"Keling1.5","venue":null,"work_id":"2aca1e12-fb0d-47bf-9411-517368b5e1b1","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.336373Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:880fa7dafd96d9d00e6f877c818d18d5d6a1878d5c09395ab45c571c01caca1e","observation_id":"aacfe9df-39c6-452c-b5e1-be52c6c51e9d","resolution":{"observed_at":"2026-08-08T19:07:59.079601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.067303Z","title":"Dream machine","venue":null,"work_id":"1061d670-42f3-423c-947a-4bb543c21865","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.341952Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:6d3ea6e75ce8e66e39f85a4569c57142670371f6a884c9b1986e91c75fc08f5a","observation_id":"ac4dd7b1-0c23-4aae-a005-a6d13101170e","resolution":{"observed_at":"2026-08-08T19:07:59.070167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-08T19:07:58.345968Z","title":"Videophy: Evaluating physical commonsense for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.345968Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:033151bc13656baa12f586b1dfce1f9c1ccc5c617f378370689f9e899c049fa0","observation_id":"ebda91a0-3626-43f6-b6b0-1c102d52d5e9","resolution":{"observed_at":"2026-08-08T19:07:58.345968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T19:07:58.349998Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.349998Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d5f0b0205e5fcb165db96fa423d441fad7aeca1136d6e6647cd62ce2c20afdbf","observation_id":"1ff5507f-4e73-4feb-a4b0-afa44b692e63","resolution":{"observed_at":"2026-08-08T19:07:58.349998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.354214Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.354214Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:64b31ea402635c326b0daa4103b242e760533961aae47bb5ea416b8545570962","observation_id":"798ff80a-2cd3-4354-9295-160645abd189","resolution":{"observed_at":"2026-08-08T19:07:58.354214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-08T19:07:58.357975Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.357975Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1118b13e74aa60233e6d3b12c56c1e5b5a761591ca1cfc7c4ed1b83f1c4b766d","observation_id":"c440b295-9d94-4df7-9a64-df2c877c113f","resolution":{"observed_at":"2026-08-08T19:07:58.357975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.050833Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"2070ea15-2b30-4f0a-85ac-456a6bc4a3a3","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.362012Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:f424ad39a0b8dd2107fccc3c519e45803b8a5b219f792dc0435ad4d6a82a1cd7","observation_id":"14b9ae6f-d62c-4202-91ae-3efb178e7bc9","resolution":{"observed_at":"2026-08-08T19:07:59.054343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14404","last_updated":"2023-04-27T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:50.194742Z","submitted_at":"2023-04-27T17:59:32Z","title":"Motion-Conditioned Diffusion Model for Controllable Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14404","snapshot_observed_at":"2026-08-08T19:07:58.366235Z","title":"Motion-conditioned diffu- sion model for controllable video synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.366235Z"},"links":{"cited_paper":"/paper/2304.14404","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:c0606830dc4505ae991db5abc79fa5a7efa678c3c2fa98260bfba3d54500db6c","observation_id":"64f19260-1f72-4b51-be90-1074ea98a5a3","resolution":{"observed_at":"2026-08-08T19:07:58.366235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.040638Z","title":"Haa500: Human-centric atomic action dataset with curated videos","venue":null,"work_id":"af6d353d-a2bc-4d0b-8d5d-9bbe1cde97a2","year":2021},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.370007Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:fce8a268c89eba3ac84dda4305162f50d4c359e2980cf3268d2bba274b37f544","observation_id":"c3fe1dba-0b35-4c5f-92eb-5d952da7792c","resolution":{"observed_at":"2026-08-08T19:07:59.044283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.373673Z","title":"Flownet: Learning optical flow with convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.373673Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:fe51ea869c8f915d6daa8b81087c689efad8746defe4c30021a4d432557614ef","observation_id":"26206c47-5205-47c1-902b-e11ee92308d9","resolution":{"observed_at":"2026-08-08T19:07:58.373673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.377446Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.377446Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:de4a134e93010c0f3eacdb00162577564a835e54acba0eaea891eaa9e442cdbc","observation_id":"2ee13d42-b45f-48ce-b2c0-b1086aff403a","resolution":{"observed_at":"2026-08-08T19:07:58.377446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.018391Z","title":"Seer: Language instructed video prediction with latent diffusion models","venue":null,"work_id":"2a0e7bf6-9974-4da0-b61f-456bd4838c71","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.381582Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:54f7208b8636fde3222e1a7ba15ad24fd32815ad6448de15ad9cbbf495bfaf8d","observation_id":"6b3e5c32-8e82-4621-8ec0-7c55200786c7","resolution":{"observed_at":"2026-08-08T19:07:59.021871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:59.007888Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":"f7b0d32e-26a2-4f04-a472-67d0642793c0","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.384854Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:4ab1476dec67fc2f4d8c047b1e48648d2158914983b605efaf111b8c91b0a4ee","observation_id":"b671a80c-858d-4972-a793-055171c7fc59","resolution":{"observed_at":"2026-08-08T19:07:59.011921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.997717Z","title":"Flexible diffusion modeling of long videos","venue":null,"work_id":"7c305ed4-bbf1-40c9-9694-20c1d16b12da","year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.388306Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:dfca0b63647905dce7712879c70d6f95af44c64a1e8f0d0cd9e7f51fe83d533e","observation_id":"986d7164-f394-4f8e-84c3-6235e1844c9d","resolution":{"observed_at":"2026-08-08T19:07:59.001272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-08T19:07:58.391643Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.391643Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:810dc4e0234a89cba76198e52fd55d6764e9bd377fddc74125709f33262f23a1","observation_id":"72201789-ecd8-4991-884a-e568932fc65a","resolution":{"observed_at":"2026-08-08T19:07:58.391643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.395852Z","title":"CLIPScore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.395852Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:fdb0cfd955815a8d5c8ce232bddaaa2a341b89e0ddaaab22a6a97754dc0f4fdd","observation_id":"b7b007f1-8ca3-4ef6-92ea-d60006a5144d","resolution":{"observed_at":"2026-08-08T19:07:58.395852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.399178Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.399178Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:f05444cde98710d607f454ac0b459999f9171674c26ba3cc8b2b832214aca0f8","observation_id":"d72a3536-7862-4bf4-882f-b53258223c92","resolution":{"observed_at":"2026-08-08T19:07:58.399178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.974863Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"b09cab23-0e1b-4a7e-aa2e-02e987a18f7a","year":2020},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.402508Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:7ba3bae98f9598883dcd20d711d3a68aa5f2b38c59db4b31df70209b0e43c6b1","observation_id":"6223fdd1-b4f0-4227-addb-9a575b2461f6","resolution":{"observed_at":"2026-08-08T19:07:58.978522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-08T19:07:58.405880Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.405880Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:6ae0adc296ff8da6f778614f1df23f968671a4dac7406f1564415cc2e70e395b","observation_id":"3a5afeaa-0a9e-4650-980a-8e0523f45d91","resolution":{"observed_at":"2026-08-08T19:07:58.405880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.410074Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.410074Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d1058a111521319df9006ed8d32f09264f9ac498a21a9d278bd371e17b3f2ed0","observation_id":"8afc2389-46a0-4e76-bf98-656e9d2f75e6","resolution":{"observed_at":"2026-08-08T19:07:58.410074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.958329Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"99699772-1de0-4c69-beb2-865caf9eec51","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.413504Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:91b80ae29d62ff637c3d609e9f0f7bd84b72ca4f06121ad624f6b01a79d9aed5","observation_id":"0c714bc0-a28f-4aa7-9615-12c6b8845cbf","resolution":{"observed_at":"2026-08-08T19:07:58.962116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.948182Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"8d66ca1d-0510-495e-8dea-ac36b316af2f","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.416535Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1b79c0c36542479f4d443316f304c1c91f78c6005e836c2ee4c0dc7d30fd9a2f","observation_id":"3fe6320b-88ad-4825-8377-c3406790a430","resolution":{"observed_at":"2026-08-08T19:07:58.951655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.938068Z","title":"Text2performer: Text- driven human video generation","venue":null,"work_id":"3e8cb11b-f7f4-4a8d-8a3d-2efa0b5d416b","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.420098Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:7716bdcea6808d990a7e705a8e0677a0b50f00d97fec8742fb287e66e92ea03e","observation_id":"aa4652ee-d295-4a5f-b6c8-3a22b2d993d0","resolution":{"observed_at":"2026-08-08T19:07:58.941907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.928416Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"08208de3-6177-499a-9082-4aa0bd952eb4","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.424020Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:6b8bd4c1510d73e5df90f43ff0b74e98fb85be0de80aba1b321065716fddb909","observation_id":"7941c066-3b2c-4ed5-a730-85ba33d1374d","resolution":{"observed_at":"2026-08-08T19:07:58.931873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.918792Z","title":"Fu- ture frame prediction for anomaly detection–a new baseline","venue":null,"work_id":"5ccddb43-8e9c-44cf-a6e1-adf5750de9f1","year":2018},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.427768Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:7f5c2cdf9e57535bc5d5d9379906b7f36c79877bad4252b496d890d8c732b0df","observation_id":"217e425d-fe78-4f18-8ab1-25d69403966a","resolution":{"observed_at":"2026-08-08T19:07:58.922207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.908431Z","title":"Evalcrafter: Benchmarking and evalu- ating large video generation models","venue":null,"work_id":"c9d45dbf-6490-411b-a803-4e459117b602","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.431488Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:456570af9e353af745cbf83ad5d7dc38b77ae9ef694088427457055c485eaa3f","observation_id":"dd920b3e-31b5-4301-9e8a-12b94d5b5970","resolution":{"observed_at":"2026-08-08T19:07:58.911811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-08T19:07:58.435122Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.435122Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:8dd73aba9ea2902484d4a9a4f8da676bbec2e2333b5a018cae1a08ab247417ea","observation_id":"9e8b2b9e-6a69-49ba-ba44-134adaf51296","resolution":{"observed_at":"2026-08-08T19:07:58.435122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.899262Z","title":"A hybrid video anomaly detection framework via memory-augmented flow reconstruction and flow-guided frame prediction","venue":null,"work_id":"446393fb-b102-4dd9-b06f-981b37ad2ed3","year":2021},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.439841Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:810e5c7b6c8f777d34372fcd07a08aa115ba2726f7caea6a06497c471df4760c","observation_id":"838d67dc-4286-41c8-aec5-d3fed257a187","resolution":{"observed_at":"2026-08-08T19:07:58.902288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-08T19:07:58.444466Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.444466Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:86714a4f379fc2ba35677dfbf44a7265feafc5c0e497d39c67a97412a4004f00","observation_id":"a13e4214-535c-4e0e-833e-07f69f9abf1f","resolution":{"observed_at":"2026-08-08T19:07:58.444466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.890117Z","title":"Anomaly detec- tion in video sequence with appearance-motion correspon- dence","venue":null,"work_id":"d1171c98-ac45-4e91-a914-cd681eb57dc6","year":2019},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.449990Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d25c0a2225848960e60923bbbaf9214b19eafff8144835a1c861aa331bee3730","observation_id":"7720d487-6810-4223-82e4-78b4030889a0","resolution":{"observed_at":"2026-08-08T19:07:58.893328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.880441Z","title":"Conditional image-to-video gener- ation with latent flow diffusion models","venue":null,"work_id":"79e7271a-dbd2-4607-8cbe-55bac82f69f8","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.456819Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:42e41a2ccab304058cfda9ec751861565b3ea00bbbf3d6922b10e2f518086418","observation_id":"4a515592-1148-40bd-a624-61e167a8afec","resolution":{"observed_at":"2026-08-08T19:07:58.883730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.869072Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"22b06c36-e3f7-417e-ac5e-6502a8ac348f","year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.460361Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:c412edefe1a2d990d305820025dcf64cd8acd8bf2b662aa592ad2eebc5417017","observation_id":"57ebd623-431f-4304-ac8a-565380684eec","resolution":{"observed_at":"2026-08-08T19:07:58.872850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.857687Z","title":"Gen-3 alpha","venue":null,"work_id":"ec1471f2-e604-4e70-99dc-6fcf7705cc21","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.464109Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:2c5cb908585d8fb5793cf2f09219225032dd97df4320e633c801f3154ba5e843","observation_id":"a1923c1d-32ea-49fc-94b7-cadfaee4c4e9","resolution":{"observed_at":"2026-08-08T19:07:58.862037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.467503Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.467503Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:16e37139b3976d0da65e0a4fd3c1d68b3a23d124d97f56421aa184079c8e2f7e","observation_id":"0d0e1072-f738-4ce8-8764-d828ea64158f","resolution":{"observed_at":"2026-08-08T19:07:58.467503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.840654Z","title":"Flowformer++: Masked cost volume autoen- coding for pretraining optical flow estimation","venue":null,"work_id":"496eec8c-30bb-48de-937a-5a1afea119b5","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.470767Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:a579e8fa6a656f93961cfbb89ccc361d5d79d77fbcde33616c7953312c772ed8","observation_id":"8af7054e-578d-49ab-8bab-cf2cc931b67e","resolution":{"observed_at":"2026-08-08T19:07:58.844508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-08T19:07:58.473951Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.473951Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:602a23b59590d6e54078f9d5d6ddddf79a6dfd3ae94e0311ddacf63d68569538","observation_id":"40e2eef0-db38-4197-8c5b-49b3c8ad3160","resolution":{"observed_at":"2026-08-08T19:07:58.473951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-08T19:07:58.477854Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.477854Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:010cfbe6d1943ddc08adfb75d24ac0cc84fb3c7665231eba89e5b44d25996ee2","observation_id":"8dc8c0aa-e6b9-47a5-8613-26ba16df7514","resolution":{"observed_at":"2026-08-08T19:07:58.477854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.829598Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"ffdc3858-bab8-40ea-9238-2cc34373cd23","year":2019},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.481856Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:bc76a89301736b0c85de029436070f5712a4cb317709b3818ae2af31dbeb674c","observation_id":"e8bf2cdb-1fb7-4c40-8265-1da70dd2b5e3","resolution":{"observed_at":"2026-08-08T19:07:58.833145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-08T19:07:58.485289Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.485289Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:74de8e53639b1042481f57cfebc823d31a76c38cb1d0b84d0a0ed37e6c424563","observation_id":"969b66bb-f100-427d-8c42-7dd76cd86847","resolution":{"observed_at":"2026-08-08T19:07:58.485289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.488954Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.488954Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:73fcd2c0b64df1ebb4cb37c4fa5c67b54c04ea37768f87ba88d621fb91d6c471","observation_id":"c0849c7b-f4ac-474d-a11a-5c8d5921ca20","resolution":{"observed_at":"2026-08-08T19:07:58.488954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.812328Z","title":"Physics 101: Learning phys- ical object properties from unlabeled videos","venue":null,"work_id":"2254d023-5af2-4408-a6a9-28b8fa613544","year":2016},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.492328Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:2fff3080d51b5671a95bc753c1d6f8156f25cc00b2f8fa0ab374d487741ec7ea","observation_id":"252d19db-03ee-4e5a-87e4-57a7b091b105","resolution":{"observed_at":"2026-08-08T19:07:58.816422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.801187Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"61a83536-fb6b-47f4-ad3a-5a8f14e5c410","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.495794Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:4ea2da3cb3624c0fa5a563b87c3cf83f9f5b2e49942cc1bd0863c08b6e4c4b44","observation_id":"18aa7581-19b7-4363-9cd9-bc4c7d889d10","resolution":{"observed_at":"2026-08-08T19:07:58.805369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.789930Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"a9b73b50-eb40-48cf-9fd1-06bd3ec1ad31","year":2025},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.499135Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d2e35aaa4619abc15467ac73f7e8d5ca702bafb8671fa0229f6dae0ba1002706","observation_id":"7ba1da60-6668-4085-acde-f8c7f2cdd3e0","resolution":{"observed_at":"2026-08-08T19:07:58.793865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06465","last_updated":"2024-06-10T17:02:08Z","snapshot_observed_at":"2026-08-02T18:07:43.330243Z","submitted_at":"2024-06-10T17:02:08Z","title":"AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06465","snapshot_observed_at":"2026-08-08T19:07:58.502170Z","title":"Aid: Adapting image2video diffusion mod- els for instruction-guided video prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.502170Z"},"links":{"cited_paper":"/paper/2406.06465","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:3a8222fd9857c73379affb4a033683e431ea2be1b9a5e1b0373365a37a4bb782","observation_id":"760dfc1b-dff9-4059-9ec1-ce7c0eb813d3","resolution":{"observed_at":"2026-08-08T19:07:58.502170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T19:07:58.505717Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.505717Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1344984957e278c2213e73354f1f1774779d8a473acb33dc5d82364d09ad5176","observation_id":"51d3eea7-44f7-4d0c-b1e3-7e6cb019ae1a","resolution":{"observed_at":"2026-08-08T19:07:58.505717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.777155Z","title":"Video event restoration based on keyframes for video anomaly detection","venue":null,"work_id":"c64f9e1c-e853-49c8-a6a0-70385ee04952","year":2023},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.510028Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:08fc51f14fb01ba9a85939121d15bea2060f3a9d8bcc9e8293fc8c2f1c83b93e","observation_id":"8d69ffdf-297a-4ffa-bcd2-28472ca2b2bc","resolution":{"observed_at":"2026-08-08T19:07:58.781024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.766681Z","title":"Old is gold: Redefining the adversari- ally learned one-class classifier training paradigm","venue":null,"work_id":"a992057f-633e-487a-9a35-9aa9bfa0426a","year":2020},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.514117Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:b872efbab21e1e7571178cf459e6a32f3b69f54ef9cd0150000ba28dfe87a8e6","observation_id":"9f965f28-18f7-4268-83d3-846089dbc865","resolution":{"observed_at":"2026-08-08T19:07:58.770133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.755355Z","title":"From actemes to action: A strongly-supervised repre- sentation for detailed action understanding","venue":null,"work_id":"e11d19d9-b796-45b9-a39e-beb4b2abd3a3","year":2013},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.518220Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:9d643464eae279cd8ac96efa8c251539f4053d4c85dc725435e8b0c56422c3d6","observation_id":"7bdc9441-8f93-4852-bb64-77aa9eac0ed0","resolution":{"observed_at":"2026-08-08T19:07:58.759635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12935","last_updated":"2025-01-22T15:06:30Z","snapshot_observed_at":"2026-08-07T01:27:03.735858Z","submitted_at":"2025-01-22T15:06:30Z","title":"3D Object Manipulation in a Single Image using Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12935","snapshot_observed_at":"2026-08-08T19:07:58.522326Z","title":"3d object manipulation in a single image using generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.522326Z"},"links":{"cited_paper":"/paper/2501.12935","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:4cf1c83ea5555ec75b14301a4f74e7a20cbb680d8424f8e9ac0e58f99bd4e24a","observation_id":"6cbaa88b-b97b-4adf-a4a1-4cd48afd9b07","resolution":{"observed_at":"2026-08-08T19:07:58.522326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.743465Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"580e9fbb-c1dc-4af3-96c8-66fb06524a27","year":2024},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.526717Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:07ce602422cea7ab1484547cf82850673898a1fab670f77c73aa76a8a13168ae","observation_id":"cbaae48b-53d0-41b8-bdd0-fa6c9046feac","resolution":{"observed_at":"2026-08-08T19:07:58.748383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-08T19:07:58.531238Z","title":"The output of the MLM","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.531238Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:d50589f327f36a8cb817d58ca821d20b1a9bce759d03663f08130ea4d9bdd523","observation_id":"cca730df-da82-4a9d-b7ec-7c967d999e6d","resolution":{"observed_at":"2026-08-08T19:07:58.531238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:07:58.729887Z","title":"2 > 1 > 3 > 4,","venue":null,"work_id":"5efa88ef-2dc1-4088-9a5c-11b4c35fb9f3","year":null},"citing_paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:58.535598Z"},"links":{"citing_paper":"/paper/2502.05503"},"observation_digest":"sha256:1c165bd679340f7fad52d929e431e8d5b5056a379aabb1e58c9d4e015ed62785","observation_id":"c0c941da-6f29-4d31-9bce-eef5b89bf89d","resolution":{"observed_at":"2026-08-08T19:07:58.735388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05503","last_updated":"2025-03-05T12:27:57Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:02:03.717344Z","submitted_at":"2025-02-08T09:31:26Z","title":"A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2502.05503."}