{"as_of":"2026-08-17T20:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f6b79ce97987d28e31dc05454f54d22cff1cb91d1e65319947fc9776099be25","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:11:14.766000Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16572/citation-record","integrity":"/paper/2507.16572/integrity","json":"/paper/2507.16572/citation-record.json","paper":"/paper/2507.16572"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:11:12.168546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.168546Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:aff312fee2211c24ece5aab05c7bf25ba1622d38570c6d7c5792e918f8055b64","observation_id":"6c4eb6a0-cc59-4a8c-8053-f812c3f5d742","resolution":{"observed_at":"2026-08-06T15:11:12.168546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.225522Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.225522Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:ecc8ea512bc3d3f515f4bdb4c3973c62f38b0fdaee7d661f0fb74cfc50e3f9d7","observation_id":"eee8b781-685f-4c45-9eaa-57c3e993e3ba","resolution":{"observed_at":"2026-08-06T15:11:12.225522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.307404Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.307404Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:437f09c2d2b80f7fd8d57b4437cd6d645c6b28c2e1a8b18ed70f5053955859b5","observation_id":"5125d093-4fff-48cd-8765-35e7db76f562","resolution":{"observed_at":"2026-08-06T15:11:12.307404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T15:11:12.407564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.407564Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:d02f7a171f0621384b5904312c18550c713467070a2837e89b6f795fdfc83130","observation_id":"7eff2aa3-7d81-40f1-bb84-3a1d4e6e64a4","resolution":{"observed_at":"2026-08-06T15:11:12.407564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.488884Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.488884Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:1dd8b6dea06be35a870d26abdfdbfd90218c3a471b17ba2b572d8498ba9846ce","observation_id":"d8945958-0cc0-4c78-a9dd-684d30b50619","resolution":{"observed_at":"2026-08-06T15:11:12.488884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09849","last_updated":"2025-06-11T15:21:16Z","snapshot_observed_at":"2026-08-12T15:10:44.435246Z","submitted_at":"2025-06-11T15:21:16Z","title":"IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09849","snapshot_observed_at":"2026-08-06T15:11:12.519978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.519978Z"},"links":{"cited_paper":"/paper/2506.09849","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:b33c74d1b6f64dabf70c83023e26bd98719490ee184ff4c254bec88fb63b7279","observation_id":"387556de-6c77-4331-ae44-bac8cd03dfb6","resolution":{"observed_at":"2026-08-06T15:11:12.519978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.606431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.606431Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:3cc3b4d5121eb97de0f4d487e2ebcc4d00ca95deb0aa5a88235e4805ed1fec16","observation_id":"6117e60a-2a34-49a7-b331-e209d9b7f235","resolution":{"observed_at":"2026-08-06T15:11:12.606431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T15:11:12.698230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.698230Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:bbd4b8cbbfe3b2eb40038eb1fb7434d36181d642ecd450ffed95d56133795fb0","observation_id":"2c3c7f0b-8a1b-4314-b006-38b8da8989f5","resolution":{"observed_at":"2026-08-06T15:11:12.698230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.969191Z","title":null,"venue":null,"work_id":"1af250f7-5964-44d0-9e3b-74f297973d6f","year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.771898Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:515b679fcf410903de62f06577f0e423a5e86bfea48c1c4a1a24c71c45c73b28","observation_id":"b5355c35-c65c-42c7-8578-35f1c534e48a","resolution":{"observed_at":"2026-08-06T15:11:15.973886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08826","last_updated":"2021-11-16T22:59:25Z","snapshot_observed_at":"2026-08-16T17:41:19.696027Z","submitted_at":"2021-11-16T22:59:25Z","title":"A Benchmark for Modeling Violation-of-Expectation in Physical Reasoning Across Event Categories","version":1},"cited_work":{"arxiv_id":"2111.08826","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08826","snapshot_observed_at":"2026-08-06T15:11:15.123641Z","title":"A Benchmark for Modeling Violation-of-Expectation in Physical Reasoning Across Event Categories","venue":"cs.CV","work_id":"6bcd44b3-b724-4387-b9aa-54127a6fe9ae","year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.876139Z"},"links":{"cited_paper":"/paper/2111.08826","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:ac47601c978caffc9d2a1420dad23ba06445695f31c798ee7c018fe5335bb0f6","observation_id":"bedc9eb0-4a7c-44e5-a2b8-bd4491814976","resolution":{"observed_at":"2026-08-06T15:11:15.130252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05836","last_updated":"2021-11-16T22:24:45Z","snapshot_observed_at":"2026-08-16T17:50:02.978235Z","submitted_at":"2021-10-12T08:59:19Z","title":"AVoE: A Synthetic 3D Dataset on Understanding Violation of Expectation for Artificial Cognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05836","snapshot_observed_at":"2026-08-06T15:11:12.965960Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.965960Z"},"links":{"cited_paper":"/paper/2110.05836","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:959608cf3e4d6de08686faee5916cb6f0a0fa7937e90456a9a0554fec2e09eca","observation_id":"df6f8801-d1d8-4a69-b72d-d98be9929044","resolution":{"observed_at":"2026-08-06T15:11:12.965960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:13.008606Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.008606Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:03dbbc721d405874dfed1a89d943ec9b02f9bc181848ee8d73a3a66b2a62b2a6","observation_id":"5d3b3982-8459-4e62-99ee-af3cc39f2383","resolution":{"observed_at":"2026-08-06T15:11:13.008606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:11:13.080676Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.080676Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:1279eafbc08e3834860ee3c9e6eb5d9a6077c80d1095524010bff8409b755c71","observation_id":"6556c17f-6a96-4a6a-97e8-c84941104b5b","resolution":{"observed_at":"2026-08-06T15:11:13.080676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11831","last_updated":"2025-02-17T14:27:14Z","snapshot_observed_at":"2026-08-16T12:57:42.825389Z","submitted_at":"2025-02-17T14:27:14Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11831","snapshot_observed_at":"2026-08-06T15:11:13.195335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.195335Z"},"links":{"cited_paper":"/paper/2502.11831","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:0da6e2bf3366765f7e47bf83dca53b13a15be856165478492fe7126821020250","observation_id":"cae7475f-b3f7-4dbb-b554-b0be803e9fd3","resolution":{"observed_at":"2026-08-06T15:11:13.195335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T15:11:13.255782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.255782Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:154d2007d1f8eb2332519e1d45288cb29eb00ae4c26b23f0a4b5e747529c5f8b","observation_id":"56d724ea-ea0f-4cb3-a221-7f85e6fec3f1","resolution":{"observed_at":"2026-08-06T15:11:13.255782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.874436Z","title":null,"venue":null,"work_id":"096a2812-6bc2-4b98-a891-b70c8fa80116","year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.371765Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:f4eab58e52c409cf3942df0ee7b2f84edac30e69f86f804c683865094b99d90e","observation_id":"ff96b2ae-d259-4667-ba64-f467b78f95b3","resolution":{"observed_at":"2026-08-06T15:11:15.949373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09048","last_updated":"2024-06-06T09:35:53Z","snapshot_observed_at":"2026-08-17T08:03:57.030481Z","submitted_at":"2023-11-15T15:38:28Z","title":"GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09048","snapshot_observed_at":"2026-08-06T15:11:13.541388Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.541388Z"},"links":{"cited_paper":"/paper/2311.09048","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:ed5a0ff70d804b6b5ecdde132ddf5d224037e1cdb82658d6fe26fd593259d074","observation_id":"e0a564ef-37bb-4197-b0a3-f27ad1b4f9ec","resolution":{"observed_at":"2026-08-06T15:11:13.541388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.648261Z","title":null,"venue":null,"work_id":"f93d16e2-fb3b-40a0-9ecf-237fceadcd2a","year":2017},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.657772Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:6a35a9b7fc8e40e7b76d1020e9ed9fc515fb248e6523ecfdca9a57b84ebe235c","observation_id":"24da215f-88ec-4365-aa02-19409ed2aacf","resolution":{"observed_at":"2026-08-06T15:11:15.762191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T15:11:13.766494Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.766494Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:187b3e10a07917a4ea9793fca5bc23501a76417c943ff8f30dab46e12aea9095","observation_id":"5b114338-6480-458b-9d1a-0e77fd4c6538","resolution":{"observed_at":"2026-08-06T15:11:13.766494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:13.890245Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.890245Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:dd6246b6e4f4927d49bde8e8056fa99c7af9df8f2f9a605ce9162407a7670aa2","observation_id":"f34fa65d-ada7-4c2a-b0c6-fadb9762d3ac","resolution":{"observed_at":"2026-08-06T15:11:13.890245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14057","last_updated":"2023-05-23T13:36:55Z","snapshot_observed_at":"2026-08-16T15:30:38.648701Z","submitted_at":"2023-05-23T13:36:55Z","title":"Can Language Models Understand Physical Concepts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14057","snapshot_observed_at":"2026-08-06T15:11:14.036103Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.036103Z"},"links":{"cited_paper":"/paper/2305.14057","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:7dac6529dbd39930e3b53bbd6f8299a10a7462237f1620b57113a11f1a6d409d","observation_id":"aac878d5-99d3-4f04-8489-8dda9dc91fbd","resolution":{"observed_at":"2026-08-06T15:11:14.036103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.173321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.173321Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:bfb85ed2571ba1cd3d79a32d7929ed02691c0ea317a075942e1ba6ef8c081fd1","observation_id":"08d661fb-8165-4d39-a219-3d60e3b1bed8","resolution":{"observed_at":"2026-08-06T15:11:14.173321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.356424Z","title":null,"venue":null,"work_id":"e097b2ec-d772-46ac-8c17-e0ca5d8ec0e1","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.279711Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:486d725ea4893547140cc51e14d0ca1c352057ae4e83986cda96600c396a9087","observation_id":"6f21a6b0-703c-4c97-9e54-50383e7ab20b","resolution":{"observed_at":"2026-08-06T15:11:15.467863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.432587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.432587Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:cba2075c5864d7cf511f217f7bcd075f9ff90ad76135cd74bcda0f66e01259a7","observation_id":"e17c428e-f5aa-42da-9d43-d02deb25a53a","resolution":{"observed_at":"2026-08-06T15:11:14.432587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.552976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.552976Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:4531f51a584357786063d2b87dafa40426c419f4099f5e7352d92d0167f3156c","observation_id":"98e189a2-5eb0-458a-9320-da2582ddc8a3","resolution":{"observed_at":"2026-08-06T15:11:14.552976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T15:11:14.696170Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.696170Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:b71482a82a1e70b3a4427ad13cea269020f3ee4956dcc7a7cae2d96eb8cc1d5b","observation_id":"5b33f8da-5510-4578-b4c7-ccb39706b3e5","resolution":{"observed_at":"2026-08-06T15:11:14.696170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.700889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.700889Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:d3d21e58b892a2ce2e5e8187c73096c5173971a084d214f71282ce9e39b6242b","observation_id":"2929b9cd-ac8d-4be9-8a81-ea8c3bdb57a5","resolution":{"observed_at":"2026-08-06T15:11:14.700889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.320560Z","title":null,"venue":null,"work_id":"25db917e-615a-4ea8-9d72-4ed61cdf201a","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.705407Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:7e21cce03edbae968f31adcad54f32de6dab47605138bb9a454dad6628f9822a","observation_id":"efb7f591-37b2-43e4-b927-0253584f9f46","resolution":{"observed_at":"2026-08-06T15:11:15.326860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.709448Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.709448Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:2427b21feecab5818c33b79c8eb5424ea4d9f0a70698ecb90fe09728af94f049","observation_id":"58de5064-d534-495e-83a7-ef8579e7e366","resolution":{"observed_at":"2026-08-06T15:11:14.709448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.713561Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.713561Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:bc85aa895d43c2a3adaff14d521e8a22000ba2431d80c1cb2932ecc2342a792d","observation_id":"04da826a-c3d4-41ee-9601-45ae32d62018","resolution":{"observed_at":"2026-08-06T15:11:14.713561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.717818Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.717818Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:92e1fba69fe3df409eb9a4598d747427edb158526c287cf37a56d7fa37691cc3","observation_id":"63edee14-d71c-4460-8f39-3cb13866f2a9","resolution":{"observed_at":"2026-08-06T15:11:14.717818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.279579Z","title":null,"venue":null,"work_id":"c3976e1d-d8f4-48fc-8c8c-fcb4d63f2bce","year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.721837Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:88941619e98679b570ae6fbb9db35ea29b364a21b2d7d7db7ab36055030e3c19","observation_id":"b6be27a9-8810-4e2c-a5c1-b4e9c0031158","resolution":{"observed_at":"2026-08-06T15:11:15.283706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-06T15:11:14.725690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.725690Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:593fac0029c21f84339853fa4e216ba9c5db86451184be3ab640924a057a8c76","observation_id":"bae01cb4-bef2-4d1b-a36b-52a4ed951b4b","resolution":{"observed_at":"2026-08-06T15:11:14.725690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:11:14.730419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.730419Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:0329c4dc9d364fcc0cfffd592a1af3d3ac5ca934e22692a9ea6ebd3ab8b692fb","observation_id":"6c7ca839-5847-4978-a424-2cbf06b1e371","resolution":{"observed_at":"2026-08-06T15:11:14.730419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.734477Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.734477Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:6ab09da616a7df640554adff1b8481639d762724c3dd3f49ba6a35b1598b7025","observation_id":"91ea4641-b347-479d-a10f-b9fc7611c18d","resolution":{"observed_at":"2026-08-06T15:11:14.734477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-16T17:40:08.900487Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-06T15:11:14.739001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.739001Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:6edf9a790ca08a326babf0dde688e986b9dad348b13838760dcba61930f6e6cb","observation_id":"90b2e545-4d4e-477d-87b8-f5f0060242f2","resolution":{"observed_at":"2026-08-06T15:11:14.739001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.255378Z","title":null,"venue":null,"work_id":"20b1a582-b2c7-48ec-a897-bbd8c7cd360e","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.743067Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:c5277cd272a4949189917e4a04ac55e0c50a6fcd684cbdccdcabe905a2afdb31","observation_id":"2354edb6-f071-4b39-b282-583b62b60d57","resolution":{"observed_at":"2026-08-06T15:11:15.259105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.242771Z","title":null,"venue":null,"work_id":"155733e6-9227-494c-90fe-bc2db3522fb9","year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.746584Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:42dc9be6e6a2c291d3c2cd68d0682695ebafa9b7b66830df0ff5fc97d0b99491","observation_id":"a7fa17ee-5ec7-4bd3-82bc-7df24defbc88","resolution":{"observed_at":"2026-08-06T15:11:15.246673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.228785Z","title":null,"venue":null,"work_id":"6529f708-0ccd-4a3f-950b-b6eedfc91ce0","year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.750384Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:fa375c5700858efafc1048b6cb2d3f31a754f5f970a07b5a5a69c4ce65b509d5","observation_id":"404dedfe-0ead-453f-b051-e3bcd61e3b77","resolution":{"observed_at":"2026-08-06T15:11:15.232591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.212912Z","title":null,"venue":null,"work_id":"397c673a-2f23-49bb-98b6-a75b3e5b463e","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.753937Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:168763548b0144f0933c49fa9d17e3b390b32beb8d4ec7351e3b6fa1483f736b","observation_id":"7d7ced0c-17d5-4d50-9919-256056341202","resolution":{"observed_at":"2026-08-06T15:11:15.218647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T15:11:14.757700Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.757700Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:73cd1a74a5845129b3ad79cd6bf110c9a7df6e26b4028b886b5ca7625dd263c1","observation_id":"4fffeeb7-8366-4d76-b761-0728ff6abae7","resolution":{"observed_at":"2026-08-06T15:11:14.757700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.761625Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.761625Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a94249ca986e38fb1c13031dc10ccb7d6b0d64de250bcc29d8b1e68ec6c4c135","observation_id":"53e4cc5f-28ac-44d8-a4ec-60a9a19b8b32","resolution":{"observed_at":"2026-08-06T15:11:14.761625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.766000Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.766000Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:c91a6a8c4fcc1586a67d471a1e3bb34a8140a3d5d0e771e88a4e8ac0dfa90d88","observation_id":"b60a00c7-41f4-4c66-9ef6-5372d4799f25","resolution":{"observed_at":"2026-08-06T15:11:14.766000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T23:24:38.316449Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.16572."}