{"as_of":"2026-08-22T12:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f85244d2b587c71d64929404c0517612c93f86143747b227554990c7a849bf7","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:39:22.070629Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.07061/citation-record","integrity":"/paper/2605.07061/integrity","json":"/paper/2605.07061/citation-record.json","paper":"/paper/2605.07061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:ce1084bb3b204be66b765a45d716068bd8d598faa7aa70dc95ec2e6b5f557799","observation_id":"5a8a2620-d35a-4f03-b086-7b814fd71ea4","resolution":{"observed_at":"2026-06-30T23:45:08.260783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-08-16T12:54:37.000371Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:ff531c521567c979da0d5b8190848067258c91ef981c78639c26d6fe1f5ef85d","observation_id":"c0795d41-239c-494c-919d-5e8ec55ae934","resolution":{"observed_at":"2026-06-30T23:45:08.231096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-16T12:51:43.372607Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:45f376f7ef980302fe903d603ae3d99ab2a08fd78dcb090199adf9ce01f89311","observation_id":"68ca9a9f-28a4-45f6-97c7-000e535ba148","resolution":{"observed_at":"2026-06-30T23:45:08.203083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.290790Z","title":"Video generation models as world simulators","venue":null,"work_id":"6d25dc8f-02d4-4aab-84e4-1d87bf3567a6","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:948c84adaa8201a12ed1e7977312f234d6bfa86b137ca0395a521a75d83db242","observation_id":"70f089c7-d8d9-45fc-871e-9cc4bfdee1b2","resolution":{"observed_at":"2026-07-07T10:33:40.268019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/10494820.2024.2414152","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie: Generative interactive environments","venue":"Interactive Learning Environments","work_id":"6c633c28-756b-4f8a-b31e-d5ac37197f04","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:9134e2d2991e5bd8d4154714e422e1c743b8937cd68a4532b795513a5dffa058","observation_id":"76e56aab-8d82-414a-b7e8-908829fa1ca6","resolution":{"observed_at":"2026-07-07T10:33:40.269905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.21094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-07-02T22:17:26.093228Z","title":"T2av-compass: Towards unified evaluation for text-to-audio-video generation","venue":"cs.CV","work_id":"f4d29773-29d6-486a-8faa-73376b01dd55","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:63904d23837fe0514a75b1bfb9b2caa8a74cf63731b545598b369f0030754dc3","observation_id":"a69173e7-7a2c-468a-9dcb-74d5437933cb","resolution":{"observed_at":"2026-06-30T23:45:08.236205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.270469Z","title":"Soundspaces 2.0: A simulation platform for visual-acoustic learning.Advances in Neural Information Processing Systems, 35:8896– 8911","venue":null,"work_id":"caa69eb8-28a6-4f24-9b4c-0c14d009ae7f","year":2022},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:c4995914eb93b505cd4906bdc113bd448a067438cd729e1cef6717828c59931c","observation_id":"b2617e39-eb0d-4709-b816-ddbac5719cac","resolution":{"observed_at":"2026-07-07T10:33:40.271754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-17T15:58:43.868299Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:efa7eb46e885a368a2aacb0206d0e6796cd4e6b8415c37044823bd995764be97","observation_id":"162511d4-657a-4d71-8e94-51887078ef76","resolution":{"observed_at":"2026-06-30T23:45:08.223574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:37:29.792063Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":"b20b430c-75db-48ea-9a8d-4bbdeb416467","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:0ec67fabad83ce4a1ddc86ae3c8d78852617fec5ff9ae40f9ec84e228ff2e1f5","observation_id":"0eb73f90-8817-4f51-b983-38ff60e71dbb","resolution":{"observed_at":"2026-06-30T23:45:08.241509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:42720aa02941da9dd02a16dc51cab2ad3760d0fd77503caf47ee55e53d2c817d","observation_id":"75847fe0-e924-4df2-ac3d-91fb842a887a","resolution":{"observed_at":"2026-06-30T23:45:08.215209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.265192Z","title":"Introducing Veo 3.1 and advanced capa- bilities in Flow","venue":null,"work_id":"f44a13df-f9f2-436f-a19a-26c9357a6c1b","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:4a108ec9106603a4885e39a3b980a2d29e2e479492afc53fea513d2d73cf7846","observation_id":"385760c1-0697-4437-8535-80c3b003ef5c","resolution":{"observed_at":"2026-07-07T10:33:40.266378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.272322Z","title":"Technical details inherited from the Veo 3 Tech Re- port,https://storage.googleapis.com/deepmind-media/veo/Veo-3-Tech-Report","venue":null,"work_id":"2f0fa94c-94b5-42c2-871e-60bfecf9e225","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:6d65a18245015d3c3abc76859c415d52098551f8b12536a91aba332e2605b4b2","observation_id":"19520228-7172-4c56-929d-2f27853d27b7","resolution":{"observed_at":"2026-07-07T10:33:40.273514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.257749Z","title":"Look, listen, and act: Towards audio-visual embodied navigation","venue":null,"work_id":"7e4089a1-a026-4652-adfc-4994a93cac70","year":2020},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:37ac7112d0c32e3a6b4552cff8a2242f54ca994f757406d90091076ba2aba7d0","observation_id":"dddbdb33-a9e4-4c17-bce5-d2c8fef8bbde","resolution":{"observed_at":"2026-07-07T10:33:40.259561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13428","last_updated":"2026-05-26T08:34:24Z","snapshot_observed_at":"2026-08-06T16:22:35.916708Z","submitted_at":"2025-07-17T17:54:09Z","title":"\"PhyWorldBench\": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models","version":3},"cited_work":{"arxiv_id":"2507.13428","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.13428","snapshot_observed_at":"2026-07-08T07:14:45.185207Z","title":"InThe Thirteenth International Conference on Learning Representations","venue":"cs.CV","work_id":"7c164e09-5340-4f56-b63d-0e810f24f851","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2507.13428","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:add9dac9b062beeb3ba06b0f89e36070a7d72fc697f870c699406aa782f55d40","observation_id":"1ca743af-1dfe-440b-bb86-c2ecf398f61f","resolution":{"observed_at":"2026-06-30T23:45:08.238608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00337","last_updated":"2025-05-01T06:34:55Z","snapshot_observed_at":"2026-08-16T04:42:37.134626Z","submitted_at":"2025-05-01T06:34:55Z","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2505.00337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00337","snapshot_observed_at":"2026-07-04T13:59:51.792842Z","title":"T 2 V P hys B ench: A first-principles benchmark for physical consistency in text-to-video generation","venue":null,"work_id":"8e0819a9-997f-40ad-9d64-220808cd9d4c","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2505.00337","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:3e8f4fa424b5ade53a44fd7dd670cba6d5037d8c959654d3050742b050c4e6f3","observation_id":"9cbc7b9f-9d62-433f-81d8-56ab5f6b919b","resolution":{"observed_at":"2026-06-30T23:45:08.258303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-21T07:01:40.887307Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:05fb693732561a526a4d03ed5d1faa12bb6838e8d7c1a27c0f54de6e97e824f8","observation_id":"5975024c-9ed4-454a-b844-4ca3c6bf49ab","resolution":{"observed_at":"2026-06-30T23:45:08.209925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.825321Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":"a95a4387-dcbf-44b4-b3ed-2111b55ee80f","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f9973f7fdd3ef24d964b15d6c4d50b2d381a41fb199205fe003c00d92fce624b","observation_id":"03d9c9c7-4aa9-46ad-8eea-6c77da3d07b2","resolution":{"observed_at":"2026-07-07T10:33:40.257251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.260150Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"141a869e-b835-4f09-ba60-a92e0c752882","year":2021},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:8dac97312f3584df76e1d0a22a063eada760cc47d64077609d56d68d8ff7d5b3","observation_id":"d4e9e043-088a-44f1-af6c-7cb6fa3e6914","resolution":{"observed_at":"2026-07-07T10:33:40.261363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-08-18T03:03:12.839060Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.09299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09299","snapshot_observed_at":"2026-07-05T12:41:04.378368Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","venue":"cs.CV","work_id":"0b1e3c4c-ed41-4a5d-aee8-471b82e5072a","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.09299","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:1cf9f435c6b0da0a71519309ea4f3a03dbda186bb13329c3d4baa38e8fe61045","observation_id":"3d3576bf-83f4-4c9a-9439-5d73cfdcf179","resolution":{"observed_at":"2026-06-30T23:45:08.228667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:50.611559Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"2383dbc4-0e5d-40ed-a102-5aac37332eae","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:34e26a5202da56c95ae2305be33ae69349da656eb27923f7b23065984ee604cb","observation_id":"ad0976e0-f54c-4ff2-9944-6ad393062896","resolution":{"observed_at":"2026-07-07T10:33:40.264640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.249806Z","title":"A reference-free metric for evaluating music enhancement algorithms","venue":null,"work_id":"32359d19-5aa1-4309-b5c9-be186728fb8f","year":2019},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:8b13beb2625dd84d3769e26f9d5eff5b6d7a75aa2db0fe23ba23e16f01daa62c","observation_id":"f3b0d21a-3025-45eb-a22c-c9dee7fb4e05","resolution":{"observed_at":"2026-07-07T10:33:40.251522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.241438Z","title":"The measurement of observer agreement for categorical data.biometrics, pages 159–174","venue":null,"work_id":"3d83c61a-3d9e-430a-8819-b63caa7a7fe9","year":1977},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:61a027397053bb72f945e917b7446e9333ff1d1cc464cd210d9d300931036d73","observation_id":"7085bb9c-47fe-4f79-8bca-cc182a94ab33","resolution":{"observed_at":"2026-07-07T10:33:40.242940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.239628Z","title":"Video generation models: A survey of post-training and alignment","venue":null,"work_id":"eddc1589-c8e1-4e84-ba0b-6c16aefec776","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:bd22c2b915531d90d9da696ed998a02bfb4eba44fc1c62bb0c87d5ef411f21d7","observation_id":"ad03681c-d52a-49b6-a5ef-e09c1e0c8229","resolution":{"observed_at":"2026-07-07T10:33:40.240842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.381869Z","title":"JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":"3b03d007-725f-4692-9648-a2785e1e2398","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:a0ede67a8dfd1e21db7218cb3a4dd8e52479d115c05d21949de95157739d6886","observation_id":"0317efd0-ebfc-4283-9024-76ef8e8627be","resolution":{"observed_at":"2026-06-30T23:45:08.195881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:55.709500Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":"59aaef1a-efc0-4078-b139-ac7e5a7c58f9","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:42badf11c2275ae2763a28a72a1040093ee0d08313f9d3f92b44ad569b477003","observation_id":"0770c935-9b86-4a56-92d2-4906dbd1ab50","resolution":{"observed_at":"2026-06-30T23:45:08.249848Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.243523Z","title":"Caven: An embodied conversational agent for efficient audio-visual navigation in noisy environments","venue":null,"work_id":"5665d39e-66a4-4aaa-b809-6db17972d747","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:b87e2fe47f8fbc8ebe9e830b7d357cad958f35233d6db8541becfa9aca550dee","observation_id":"748f8c98-a274-41a2-8867-6dff29af8db8","resolution":{"observed_at":"2026-07-07T10:33:40.247169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.247786Z","title":"Tell what you hear from what you see-video to audio generation through text.Advances in Neural Information Processing Systems, 37:101337– 101366, 2024","venue":null,"work_id":"d50153c7-7a79-4019-a9f4-a520484d2d9e","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:04c83ddc43675939ab3eb1f28b86373527938446e2610d86ff43b8a9725cf745","observation_id":"9eb70423-d81d-4dac-a462-08c57376539d","resolution":{"observed_at":"2026-07-07T10:33:40.249135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:d7d9b661a883d88a93a40e9e16fd606b4505bb5bc9e5419c5c5c5eb2ee312ff3","observation_id":"32cb4ad9-c698-4217-9117-a4f494c3acf7","resolution":{"observed_at":"2026-06-30T23:45:08.269827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.237853Z","title":"Tavgbench: Benchmarking text to audible-video generation","venue":null,"work_id":"f6ecdee9-0afd-4280-b978-7e219f28fa3f","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:e959d5055cf6324aeaf422a1ab7b4370797ce86646780ef36d03bf890feda093","observation_id":"5bd31d78-326f-4c67-bd83-a5f8bc71f341","resolution":{"observed_at":"2026-07-07T10:33:40.239063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:570550f75974bf544f53fd80f3c799ab3ea232a74fedc9bcdd0061bddc0a4152","observation_id":"5a7ff603-bb63-429c-94d6-992a18facb2a","resolution":{"observed_at":"2026-06-30T23:45:08.217598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.235957Z","title":"Do gener- ative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958","venue":null,"work_id":"36cb023c-0785-4a5e-9e87-e1470c7daaa3","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:b32fdaa3bdebb37a0a78a1b7d37d1801361c9bd56b42ce61fddc633a3d5ad777","observation_id":"3dfafc7a-5b28-4f36-b88c-4f1d3cc6e3f8","resolution":{"observed_at":"2026-07-07T10:33:40.237267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.232466Z","title":"Sora 2, 2025","venue":null,"work_id":"81b175e5-e634-42e7-a811-10ee2a25a632","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:5bc4f7ad453251595869895b45f941e0fe812e374eecae2499f8ac8938a5c9b3","observation_id":"566884d4-dc78-4da6-b2f2-fe67cda4520c","resolution":{"observed_at":"2026-07-07T10:33:40.233544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-08-16T16:06:44.375994Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"cited_work":{"arxiv_id":"2604.04348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04348","snapshot_observed_at":"2026-06-30T23:45:08.232528Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","venue":"cs.SD","work_id":"eba79e0e-d1da-484e-b2c8-d1c5b7a135b5","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.04348","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:7c2d7b8a20fc9e1106b7b13ad54a55b6b5f86c49314bdb5efcdf656489d3fa4e","observation_id":"f703365e-a69d-494b-bbf3-5a12f52a8deb","resolution":{"observed_at":"2026-06-30T23:45:08.233900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:0fe6c846b1f66c9d1e2d3f0c74271f884f958d18fb8e6212e548a2234d87c77e","observation_id":"d376540a-2246-45e3-be74-25853a0dd631","resolution":{"observed_at":"2026-06-30T23:45:08.275677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.230688Z","title":"Savgbench: Benchmarking spatially aligned audio-video generation","venue":null,"work_id":"f8a722d6-e124-4b25-b5cf-f7fda8f18fac","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:478558f66f8770173d4b14ee7ef2656dc095df12d2356c91e5bbb2caf23f4438","observation_id":"084b07ca-7a41-4ddc-9b31-a0b1e4913807","resolution":{"observed_at":"2026-07-07T10:33:40.231900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:dbc99e393baf75da8cc698d7d2dd2410ae5ca45e3e3e5f597f6d340b924c1a3a","observation_id":"6f2e1459-40fc-48d7-b3f0-8ab806ece0f3","resolution":{"observed_at":"2026-06-30T23:45:08.207476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:14.623228+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:14.623228+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19132","last_updated":"2024-09-27T20:26:34Z","snapshot_observed_at":"2026-08-16T13:14:38.372324Z","submitted_at":"2024-09-27T20:26:34Z","title":"From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation","version":1},"cited_work":{"arxiv_id":"2409.19132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.19132","snapshot_observed_at":"2026-07-03T13:28:18.779237Z","title":"From vision to audio and beyond: A unified model for audio-visual representation and generation","venue":null,"work_id":"f270194a-9edb-4d53-8fa4-6abdfa42c589","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2409.19132","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:7987d4ae170fc79c7e61c302f572168ad95d089955f5afd58242b8e3d5209618","observation_id":"4c469386-d564-4fbb-88f1-64ad2f9fc04e","resolution":{"observed_at":"2026-06-30T23:45:08.234269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.829287Z","title":"T2v- compbench: A comprehensive benchmark for compositional text-to-video generation","venue":null,"work_id":"94acc5b7-1602-4283-bf34-3549e7250963","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:a6ef4bd12bba34430badb0dec019f80164f605d3c9ad7a366f463a9b2d92e369","observation_id":"8b2f2e9b-780d-47b1-9ca5-5bb0fc51fc2d","resolution":{"observed_at":"2026-07-07T10:33:40.235367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.11039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:17:43.949417Z","title":"Sonicbench: Dissecting the physical perception bottleneck in large audio language models","venue":null,"work_id":"b0427e7f-5dee-4e5c-9abe-a744e7538a48","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:8fcb0b36b3688f43829d6cb9982cf9c42d3a11892df38fff10f10791ee895153","observation_id":"f75f7dd6-302c-441e-990d-695c2314aa8a","resolution":{"observed_at":"2026-06-30T23:45:08.208655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-08-18T19:56:03.713377Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2512.16776","doi":"10.48550/arxiv.2512.16776","metadata_source":"pith","pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kling-Omni Technical Report","venue":"cs.CV","work_id":"52d502bd-9d8e-4944-9bf2-cfd097cfdb4e","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:7053e13e9076d9a99877c6b05ee27de32205aba9d2a71a68029fe171d45f3428","observation_id":"b99f848b-3f92-44c0-b1c3-d1f9628e34e9","resolution":{"observed_at":"2026-06-30T23:45:08.219778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:2e1796d74e0c85def2676b6c9343ca27fbb62bac9cd252af0c9cffcbcf9886bd","observation_id":"50d22eea-2a04-447b-aa7b-793f65bc697f","resolution":{"observed_at":"2026-06-30T23:45:08.255291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-22T10:00:20.553295Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:9534a87c6e9ee8a9a6a5c9923e53653d0c4db51b7c593851a688ffcec830a63b","observation_id":"cd596f24-076e-4356-a092-3b74d53b140e","resolution":{"observed_at":"2026-06-30T23:45:08.226099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-20T05:56:51.995983Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":"2509.06155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-07-05T12:41:04.336871Z","title":"UniVerse-1: Unified audio-video generation via stitching of experts","venue":"cs.CV","work_id":"b460dec5-ca31-4982-8dc8-769dad75efb5","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:baae6b35c4463d0372a562dfafd9aebf722c7227f6f02b440fd7926a80fbca27","observation_id":"158c2ec1-1e00-4bfa-9c73-b4ea28a3f037","resolution":{"observed_at":"2026-06-30T23:45:08.252808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"cited_work":{"arxiv_id":"2512.23994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23994","snapshot_observed_at":"2026-07-05T12:41:04.333890Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","venue":"cs.SD","work_id":"f195e204-6846-46de-9de8-8ed43724d874","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.23994","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f86b85727f5dc33ce2de845a6cc5d7c0df6494e17833c73b369b7f0d640d99eb","observation_id":"6b087763-ae3e-4f2a-bce9-60e6a324b030","resolution":{"observed_at":"2026-06-30T23:45:08.237129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.252051Z","title":"A survey on video diffusion models.ACM Computing Surveys, 57(2):1–42","venue":null,"work_id":"a88b3ca8-9c1c-4854-9ff2-8d3cdb127965","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:9ccfe98db82926382e41e09290a0bce7424fb0767fe46c1b16e7d96103c56e78","observation_id":"5ebebb9b-8765-4ce0-aac4-710fb43f94cd","resolution":{"observed_at":"2026-07-07T10:33:40.253226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25427","last_updated":"2026-04-28T09:34:51Z","snapshot_observed_at":"2026-08-17T06:09:26.787125Z","submitted_at":"2026-04-28T09:34:51Z","title":"A Systematic Post-Train Framework for Video Generation","version":1},"cited_work":{"arxiv_id":"2604.25427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.25427","snapshot_observed_at":"2026-07-09T03:05:55.283109Z","title":"A Systematic Post-Train Framework for Video Generation","venue":"cs.CV","work_id":"447433fb-ea71-4357-8c19-53b528d34300","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.25427","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:1efb6aeef036669f9561e3626cbb32a2a59a7ef09b8928d7eb773ab6d3d9ba65","observation_id":"f7c47df5-db7c-48c4-af0f-dd15dd4d8eca","resolution":{"observed_at":"2026-06-30T23:45:08.213661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:d4c0059617ed54f1485a37409a8316148492e22a078b16e720742e4c1833acee","observation_id":"3221fd1e-30a0-4801-a237-d9b5617ed036","resolution":{"observed_at":"2026-06-30T23:45:08.266662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.253818Z","title":"Diverse and aligned audio-to-video generation via text-to-video model adaptation","venue":null,"work_id":"eed9447d-4ba4-43c7-b82a-73cc61070ffb","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:ab284c4b8b7314321958e537bdd1e580aedb3ed9c4e1abc7ff89e8c93c7cb7df","observation_id":"eebe27e9-d3a5-46bd-80e6-a1cc79960dd5","resolution":{"observed_at":"2026-07-07T10:33:40.255030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11700","last_updated":"2024-03-22T08:13:11Z","snapshot_observed_at":"2026-08-16T14:08:50.706415Z","submitted_at":"2024-03-18T11:56:35Z","title":"Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing","version":2},"cited_work":{"arxiv_id":"2403.11700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11700","snapshot_observed_at":"2026-06-30T23:45:08.271539Z","title":"A mallet strikes a xylophone from the longest bar to the shortest. Each bar rings higher than the one before, from deep warm tones to bright high notes","venue":null,"work_id":"22afddd1-f9f3-4a89-97fd-173a04aa5085","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2403.11700","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:62fbf04c7fb96d99b425ef7029492a3d16a6301dfab859de8a96bee4021bbf0a","observation_id":"da48796b-6c81-455b-8b34-3c8f4ba82f53","resolution":{"observed_at":"2026-06-30T23:45:08.273174Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.261929Z","title":null,"venue":null,"work_id":"dbd05674-f1e9-4e01-b57d-95cea9efed52","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f14ecc5593cb21aac0ef4f6f3ad29c418d5a233139da8d1b09d0c8febf781b65","observation_id":"fb640097-828b-45fa-a630-04466d5e7927","resolution":{"observed_at":"2026-07-07T10:33:40.263014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.274193Z","title":"{video.event}","venue":null,"work_id":"7a0a973e-a2f4-4647-a1aa-926132d7bd4b","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:983e373823119c22ad3cbd1453aaad9ab69e1c85ca17ba6184d38fab9570833c","observation_id":"b2ccf433-5f3d-40cc-a41d-fa46ed0d7a46","resolution":{"observed_at":"2026-07-07T10:33:40.275271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.228749Z","title":"would normally be audible if real-world physics held; answer Yes if they are appropriately represented as such (typically silent here)","venue":null,"work_id":"280cc492-0e39-41d5-820d-ac1e367eafb5","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:aafe1430b66a11f6b027f6e7bfb2e3dadf9f698f244d048679b54b064fa08b49","observation_id":"8b5a116c-98b3-4886-827c-d5f100057b03","resolution":{"observed_at":"2026-07-07T10:33:40.230063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9340.9850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T23:45:08.262195Z","title":"the clip is expected to be silent during the depicted event; answer Yes if it is appropriately silent throughout with no audible leak-through","venue":null,"work_id":"8151e355-66bd-479b-8c62-fa986915632d","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:ee7a058e06e52ecde2fa1fda9895129d090a25ef919b400f7489df45011dc562","observation_id":"ea3732ce-2cc2-4940-ac13-347e774178af","resolution":{"observed_at":"2026-06-30T23:45:08.263931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":27,"verified_fuzzy":23},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2605.07061."}