{"as_of":"2026-08-10T19:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e54f199fb98f9eca80fd3d93f1b5d2f9919428eb1391b7cd3896ce95a045cb10","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:27:03.245735Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15824/citation-record","integrity":"/paper/2507.15824/integrity","json":"/paper/2507.15824/citation-record.json","paper":"/paper/2507.15824"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T15:27:00.219696Z","title":"Agarwal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.219696Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:27a7ca7427107ccffc5324b02733c2c288f0a622c28f926a545857ccc2b548eb","observation_id":"dd05d835-036a-4d73-a28f-484ef0c0855e","resolution":{"observed_at":"2026-08-06T15:27:00.219696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14378","last_updated":"2025-03-18T16:10:24Z","snapshot_observed_at":"2026-08-07T16:54:31.868932Z","submitted_at":"2025-03-18T16:10:24Z","title":"Impossible Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14378","snapshot_observed_at":"2026-08-06T15:27:00.284729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.284729Z"},"links":{"cited_paper":"/paper/2503.14378","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:42eefe7b971edf6129c9731db18285e8d4a4240ef1a1b2a6fc33bbcf28f60865","observation_id":"6d342f1d-ad5c-427e-b5bd-651c97f9a05e","resolution":{"observed_at":"2026-08-06T15:27:00.284729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-06T15:27:00.383675Z","title":"Bansal, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.383675Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:04d2fc62b7c6bc4c2f31e491c309910374af46e18de27662278fa43e23b7678a","observation_id":"ab5d0084-29aa-49f1-8b60-e22e7e23eb9f","resolution":{"observed_at":"2026-08-06T15:27:00.383675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-09T23:44:57.579845Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-08-06T15:27:00.441134Z","title":"Bansal, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.441134Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:d4e8aa4d4ae84876f85e12a84b4c0235f7938ba198301b8780e984b52a1e5a5c","observation_id":"5408ffb6-a523-4df4-b901-5475e57ec79a","resolution":{"observed_at":"2026-08-06T15:27:00.441134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-06T15:27:00.511632Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.511632Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:a3a3cebec9d1d4e42a5b9e1d8694f7d50bf2978301e84b549c079327b08609e0","observation_id":"0cd747e2-bf7b-4097-86cf-cb7ba2c3b498","resolution":{"observed_at":"2026-08-06T15:27:00.511632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.184215Z","title":null,"venue":null,"work_id":"e51d1e0f-a724-4007-a10b-7d3184935402","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.600323Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:725a87eccfc68f978fe49d0c646bf3a5ffeb16f3ba34a32641722341caf78ff7","observation_id":"68e9ff5b-fc7e-4e3a-ab78-bdd91f96d9c4","resolution":{"observed_at":"2026-08-06T15:27:04.190158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.163667Z","title":null,"venue":null,"work_id":"e1f193a8-e44b-4650-ad2f-d8ce47f1ca5e","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.668523Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:aa03a3cc5e51bb9622d1125981373281ee4175bca54cb0ed91e674dfaac0a341","observation_id":"06aaccd1-4251-4057-a12d-a536cd6bce6d","resolution":{"observed_at":"2026-08-06T15:27:04.168628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.148443Z","title":null,"venue":null,"work_id":"5487707b-637a-433a-b0d4-deb737966491","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.772417Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:44d74f4b349cade6966990080debc19b4ee73df3fcdf53587a3656cdf0bf4462","observation_id":"443a8733-255a-4e0c-a0c6-9a7208b88e23","resolution":{"observed_at":"2026-08-06T15:27:04.152771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.132227Z","title":"Gemini 2.5 Pro","venue":null,"work_id":"71a8cd73-d833-419d-9379-35addb145e81","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.825849Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:dc365b9418f9ed4d497f132c570a56f635ea72b08547c787d317f6f45f8fb4bd","observation_id":"203b6b81-9be3-4821-981a-47ddeeb5ec0b","resolution":{"observed_at":"2026-08-06T15:27:04.137144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.108561Z","title":"Gemini 2.5 Flash","venue":null,"work_id":"7bc41575-6a96-40c8-bd45-78104ddc25c6","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.897645Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:ca38e9a7871f7f6caf117f03e630c2c49c3c9111b96349dd9dd4c7e3f8b8620f","observation_id":"b1f2d662-8e71-42d6-872c-e817f9b13f2b","resolution":{"observed_at":"2026-08-06T15:27:04.116230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.093353Z","title":null,"venue":null,"work_id":"a6eafbc2-58fb-4d8d-8af8-b621b146617b","year":null},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.996067Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:dde31be3e8908ea37328009c21f433c7b6f0ff81cb3c80926d34bb6f8a5cea7c","observation_id":"49e730d7-c9ba-457e-b563-20e622c9018f","resolution":{"observed_at":"2026-08-06T15:27:04.097902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T15:27:01.156060Z","title":"HaCohen, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.156060Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:9803daea762a414122b2a8d665cd8bb478844377ab66f2f03585d5b639f24f78","observation_id":"e9be4478-8ace-4043-8239-d84d8ea79e36","resolution":{"observed_at":"2026-08-06T15:27:01.156060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-09T01:46:25.522034Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07825","snapshot_observed_at":"2026-08-06T15:27:01.234367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.234367Z"},"links":{"cited_paper":"/paper/2502.07825","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:38c97c1b3b922d2fe8067b050f426dcf738f931c4fba013bb6c860dad35317da","observation_id":"a72f13bd-15f5-4954-abc2-fc2f681ef209","resolution":{"observed_at":"2026-08-06T15:27:01.234367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.059476Z","title":"Hessel, A","venue":null,"work_id":"44f1c900-efb5-4670-a9a6-4343fa1da275","year":2021},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.325311Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:d850c93dddda4d1d117fdd774b3f33c72a935c4703beb8ec6823f72f98b34d14","observation_id":"af6b60e2-c63c-45b3-8c6b-cdf8d396e8b1","resolution":{"observed_at":"2026-08-06T15:27:04.064421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-06T15:27:01.391505Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.391505Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:9090db915b928f03460b295803bad4d3e07be4582067a11405676a89193fb086","observation_id":"6ec4b984-e348-489b-be63-be1a310b892a","resolution":{"observed_at":"2026-08-06T15:27:01.391505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:01.441313Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.441313Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:a8982ae8c8e3dc127fca77c440b1eaacc93bc7bff23cf9781da735fced4ce9a8","observation_id":"4efc76c7-0511-40a7-895d-2155be20621c","resolution":{"observed_at":"2026-08-06T15:27:01.441313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.044872Z","title":"Huang, H","venue":null,"work_id":"4824e21f-f0d4-45d4-98b9-a3c6cff22039","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.495108Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:5ce2053ec8004d589614133a867f7285377214f0f42658a41dbce1952e4a166e","observation_id":"746c52b3-4100-4d68-a5ad-ffe926aa39fd","resolution":{"observed_at":"2026-08-06T15:27:04.049667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.026088Z","title":"Huang, Y","venue":null,"work_id":"a343fc5d-59c1-43a6-bd0f-f4aec3f87754","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.576906Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:90c1d731eb1ad0c500da3a68db09bdadc6a778aabedb04c117ff68b93af56735","observation_id":"d3e8b807-4e35-4a51-9bb8-da81b28bb603","resolution":{"observed_at":"2026-08-06T15:27:04.032429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T15:27:01.639928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.639928Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:ec26a44de5b68deb13620c696bd6b42c860bcc7ff8c2acb041718b443d69f898","observation_id":"fa7dc48a-ed60-4b45-a638-f94f94f50c2b","resolution":{"observed_at":"2026-08-06T15:27:01.639928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.004443Z","title":null,"venue":null,"work_id":"1fd1404d-6e07-498b-aeb9-a5099c47a2f7","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.712330Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:c60d1395271b1f40eab72cb1f7a8f7d89e8122efcd263e0bf254a44ca4cc1643","observation_id":"06750cd7-951f-4862-acd7-51c0aaeca1bc","resolution":{"observed_at":"2026-08-06T15:27:04.009403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.980447Z","title":null,"venue":null,"work_id":"8a40ec28-25ab-4542-91e2-2e0d839904f9","year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.801312Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:cdd6a1e36c3ba99bc554becc1fc13984f23f248ad5c916f4aaa030aa107898c2","observation_id":"8697019d-a8fc-476f-adc8-4201986812b1","resolution":{"observed_at":"2026-08-06T15:27:03.986899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.960671Z","title":null,"venue":null,"work_id":"c8f8b04a-6549-4cc0-8db1-9d7cb48f90dd","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.865776Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:063d2e482a605e133103a0654a3e74d08b8176d58c5a1db01a2e31b73804e51f","observation_id":"2dac2889-bf4f-47b0-b914-8a8391058d78","resolution":{"observed_at":"2026-08-06T15:27:03.967150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-06T15:27:01.918575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.918575Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:eadf31524d5a4d13ed0ad0f8d20edf8698b2e099476c7e36f3af20fd83f8038f","observation_id":"78df88ff-b6a1-4c01-b8c2-34c05b4f63a7","resolution":{"observed_at":"2026-08-06T15:27:01.918575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-06T15:27:01.977216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.977216Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:04641c5e2b4eb17492ed250242f2c6081e272dba1673ca56d779ae5b49832035","observation_id":"27178bec-ac2b-4eb9-81d7-9bd31f9552fe","resolution":{"observed_at":"2026-08-06T15:27:01.977216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-06T15:27:02.052076Z","title":"Motamed, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.052076Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:fc90a6c17d06076b7cd8dbaf2ded8c1244b62444a746b2e8434907efca4d07bd","observation_id":"c9861670-97bb-4563-b7f1-469724aed6ba","resolution":{"observed_at":"2026-08-06T15:27:02.052076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.944344Z","title":"Sora: Generating videos from text, 2025","venue":null,"work_id":"e48cc3c0-3d63-46ad-9637-5fd3583de321","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.115473Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:473615e5a37e22dac974ffebe07d04f0cb233a503509618b14f41330649fc528","observation_id":"dd65b5ba-7e32-48b4-8fda-d7d3f0d98802","resolution":{"observed_at":"2026-08-06T15:27:03.949098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.924895Z","title":"Gen-3 Alpha","venue":null,"work_id":"47d84713-720e-46d3-8126-bf59331c007c","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.234677Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:edf88240f24d75015ea5cdb63252e3b6d9234248fe50b7edd50ed2e301a09406","observation_id":"83d1dd11-8178-4bb1-b895-5aff8986a35f","resolution":{"observed_at":"2026-08-06T15:27:03.931477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.905906Z","title":"Salimans, I","venue":null,"work_id":"e8b95e4b-7d48-49a0-8be2-9704f03b7b18","year":2016},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.385510Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:7aa00360f68c2186af381570131ed1ba77bec62d6ddf57fbfaf38dd280a9ef1c","observation_id":"2ca34fe6-b039-42c7-8c55-7e16e86dfc42","resolution":{"observed_at":"2026-08-06T15:27:03.911290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.888623Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":"9d8b3cad-b8f9-481c-8cf6-928f77972f37","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.553838Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:c327295bd8c31c7929b636073f879bac46ec549eeba72847be35e2293cc3df37","observation_id":"bc2a468d-5cd6-4fd3-bffa-f615d734e8e7","resolution":{"observed_at":"2026-08-06T15:27:03.893828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T15:27:02.698103Z","title":"Unterthiner, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.698103Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:0cf73fc478df24f316daa8793f86f019fdb4a6c3b3b36d3132c0594df397b275","observation_id":"b4ea5221-cc9e-4341-8817-fc93eac75d0a","resolution":{"observed_at":"2026-08-06T15:27:02.698103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T15:27:02.864867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.864867Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:bdf88841cfa58fb369b23b5111f758e26618ad27823b0f4e004f3dbd32e41e7a","observation_id":"6f08ae1b-8495-4218-9ab9-857cabf24641","resolution":{"observed_at":"2026-08-06T15:27:02.864867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-06T15:27:02.986657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.986657Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:bc173fe6dd577367f4446c73e2d35407cb5726de3e189df7507456e0089e4bf3","observation_id":"fe0eb035-5071-4400-b47a-e6a17f6bbff8","resolution":{"observed_at":"2026-08-06T15:27:02.986657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.870526Z","title":null,"venue":null,"work_id":"96c04f3a-4aaa-42aa-a83f-adbee2c0a5f4","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.109495Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:66e27a9ff0c5f7223bcf8abd03633d4657fce01dba8bf01ee18a563425b3e748","observation_id":"b6464209-3ee2-44bb-89d8-af07f222587f","resolution":{"observed_at":"2026-08-06T15:27:03.876651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.851788Z","title":null,"venue":null,"work_id":"cd2d5a75-61cb-4fdb-acfc-d97a98672f09","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.230414Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:59b8dca50da340f6709e13b3cf2a73088760deb5d2f6d069395f60657a636d5c","observation_id":"8b847a99-dda7-4fbd-a632-715a95042b47","resolution":{"observed_at":"2026-08-06T15:27:03.857513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05199","last_updated":"2023-04-05T02:32:59Z","snapshot_observed_at":"2026-07-06T14:28:56.301970Z","submitted_at":"2022-12-10T04:26:32Z","title":"MAGVIT: Masked Generative Video Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05199","snapshot_observed_at":"2026-08-06T15:27:03.235158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.235158Z"},"links":{"cited_paper":"/paper/2212.05199","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:5bc9007d5acb50d12ac6cb03a598df3d4f26a3b9f8f15dfce540b4f6932b6d72","observation_id":"144296a1-b1b6-42ab-a870-9fc2f61ec084","resolution":{"observed_at":"2026-08-06T15:27:03.235158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-06T15:27:03.240621Z","title":"Zheng, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.240621Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:48bff30735bc84fa6f2caf1ce523a34fc0647a3529d0dd0c7d23d3a19ea85247","observation_id":"7b25baba-56db-4676-8722-d9ea2ea759f3","resolution":{"observed_at":"2026-08-06T15:27:03.240621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.828167Z","title":"are” rather than what agents can “do","venue":null,"work_id":"5d7fb6a1-8d56-4c2e-b71b-6ce101a5af27","year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.245735Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:9b6f9e3281dee2d3857624d1f69f8032ec22f884e4652dc9446627b398ef0e50","observation_id":"b82d2d0f-ccd5-4d98-a987-6b562a6e5018","resolution":{"observed_at":"2026-08-06T15:27:03.834877Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.076634Z","title":null,"venue":null,"work_id":"ef39cbae-3c74-44e9-af8a-bc111385f175","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.065176Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:506940e2fbbdbdee24fc97fa7d3204e46b7ad58b0202033428f0d302313b5bdc","observation_id":"9e4b52cf-bc2b-4562-9aac-05d737f56107","resolution":{"observed_at":"2026-08-06T15:27:04.082066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2507.15824."}