{"as_of":"2026-08-16T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ee0978a3a77df193ca9ed43757a5d487a212e64489533186fbe90f28ffdc92e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:26.588538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T15:36:26.588538Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-10T19:06:19.246966Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.588538Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:c92310c67d2a3b84a45cf184e992bbeb4064aad8f12c314a02e057b30b5d02ef","observation_id":"34ceef5a-16a8-4f97-8686-d72cca1ab5ab","resolution":{"observed_at":"2026-08-07T15:36:26.588538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T15:26:59.524310Z","title":"arXiv preprint arXiv:2504.16074 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-10T08:39:37.621137Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.524310Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.15146"},"observation_digest":"sha256:774e7d8c7d90a6397e6e69b38c00d1d47f69bcc240651695e317936ad1946b9c","observation_id":"c0b9f034-2e97-42c1-bb1a-d5525b541192","resolution":{"observed_at":"2026-08-07T15:26:59.524310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T15:20:26.948825Z","title":"Preprint, arXiv:2504.16074","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15472","last_updated":"2025-05-22T03:34:41Z","snapshot_observed_at":"2026-08-14T14:31:23.249216Z","submitted_at":"2025-05-21T12:48:16Z","title":"PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:26.948825Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.15472"},"observation_digest":"sha256:d9062b6c50a89855de6cd3b27074ffc43d92e539bd379f97a7fa68e45849602b","observation_id":"f59b5a75-24ae-458c-8033-15a5d622bfe8","resolution":{"observed_at":"2026-08-07T15:20:26.948825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T15:14:54.491719Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models.arXiv preprint arXiv:2504.16074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-13T13:57:52.208397Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:54.491719Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.15929"},"observation_digest":"sha256:ca9997b9a81420f06fba402d3a16499cebe7c93bd8d2b0e89c57dd3a045192ab","observation_id":"3e72e41a-3861-42b4-b98c-1fab90fbf033","resolution":{"observed_at":"2026-08-07T15:14:54.491719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T14:01:14.955222Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20246","last_updated":"2025-06-19T15:42:45Z","snapshot_observed_at":"2026-08-16T08:37:20.448403Z","submitted_at":"2025-05-26T17:22:20Z","title":"On Path to Multimodal Historical Reasoning: HistBench and HistAgent","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:14.955222Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.20246"},"observation_digest":"sha256:8c5914a76fdb8d61bc98ea8d61c878aa2cf201e484b3422bb4590f4272fd381e","observation_id":"137ad425-18a0-4f6a-bb26-72eb091899c9","resolution":{"observed_at":"2026-08-07T14:01:14.955222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T12:22:25.013730Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-14T23:42:48.868529Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.013730Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:b3c5c9ee29d0db8771e0775c1f87305c4f3686e599c57604380d3d2e002254fd","observation_id":"b1401a96-4fdf-4fce-8ad7-6f18ae4f77ba","resolution":{"observed_at":"2026-08-07T12:22:25.013730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T12:02:44.713393Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:44.713393Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:94536e26074771bf89da6e50b35592c933d0b26bf5aa08d6039cd391c603abdd","observation_id":"cb23a208-8f20-4c44-afa0-73abc1de32fb","resolution":{"observed_at":"2026-08-07T12:02:44.713393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T05:25:44.353897Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-15T04:49:36.267472Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:44.353897Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2506.07977"},"observation_digest":"sha256:5153bd5d04945f391fe7f8204476029a947e3e057c4336939c588af5eba1c78f","observation_id":"ef9be859-608e-4677-a58a-2d2f2b39bf22","resolution":{"observed_at":"2026-08-07T05:25:44.353897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T00:40:18.603262Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-09T08:48:01.044046Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.603262Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:dfc692c20253e95ad4aa7106ec6b4a6d2b7dcc031773e5b8af041c178f7c3d36","observation_id":"a7ec1267-8c38-4f5b-8ca6-c35061de6a75","resolution":{"observed_at":"2026-08-07T00:40:18.603262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-06T19:46:46.994892Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04766","last_updated":"2025-07-07T08:43:56Z","snapshot_observed_at":"2026-08-16T05:33:24.081484Z","submitted_at":"2025-07-07T08:43:56Z","title":"ABench-Physics: Benchmarking Physical Reasoning in LLMs via High-Difficulty and Dynamic Physics Problems","version":1},"reference_index":1949,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:46.994892Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2507.04766"},"observation_digest":"sha256:f2f327887b0efed3a2348bdba81bd15ad6c3d97ac75e353d6dbc17472cec2d7c","observation_id":"bc12a3de-5e3b-4c8c-9447-ab0a6ee1263d","resolution":{"observed_at":"2026-08-06T19:46:46.994892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-04T13:51:31.512492Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models.arXiv, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24978","last_updated":"2026-07-08T17:52:03Z","snapshot_observed_at":"2026-08-15T15:54:15.667023Z","submitted_at":"2025-09-29T16:07:05Z","title":"Agentic Exploration of Physics Models","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:31.512492Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2509.24978"},"observation_digest":"sha256:c353d62f2d24b865daab1d6919e69c75d110d8463c5e93212e2255c2bbe65403","observation_id":"f23f2682-f21a-46f2-be0b-74d2cd113e36","resolution":{"observed_at":"2026-08-04T13:51:31.512492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2509.26574","last_updated":"2026-05-08T21:22:01Z","snapshot_observed_at":"2026-08-12T16:45:40.750345Z","submitted_at":"2025-09-30T17:34:03Z","title":"Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T11:52:10.205796Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2509.26574"},"observation_digest":"sha256:912a833ab91d8c68787bf6a9994a0ea3cac3d1115ce970f261695c559f4bfb9e","observation_id":"e0b744c6-cc25-48c7-86ca-448723632ff8","resolution":{"observed_at":"2026-05-18T11:52:35.306254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:c4d00647d0eb50700e526c2c4e39bf1be9b5c31646c33927e080e9ba3fe00731","observation_id":"cbac3c2e-1c69-46f2-8286-5d56524584fb","resolution":{"observed_at":"2026-05-14T18:53:21.116805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-12T22:11:58.919874Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:83bdf59fc5ecdc44f0eda9c9ccd86d6574f998c9e07cd9b196d6038c8e4cb356","observation_id":"d603fdcf-2b82-42da-b44d-d8cc4cf1ac57","resolution":{"observed_at":"2026-05-14T19:12:24.750113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2602.01203","last_updated":"2026-05-27T09:56:04Z","snapshot_observed_at":"2026-08-15T17:33:50.111337Z","submitted_at":"2026-02-01T12:45:39Z","title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:47:29.236561Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2602.01203"},"observation_digest":"sha256:53a239c4b69b1b79a2621ad6414123488def223b39d817a4410b2ba46c58f916","observation_id":"b7c46987-ace9-4a1a-9360-c9abda75a829","resolution":{"observed_at":"2026-05-16T08:47:37.220461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-03T05:50:24.771643Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01203","last_updated":"2026-05-27T09:56:04Z","snapshot_observed_at":"2026-08-15T17:33:50.111337Z","submitted_at":"2026-02-01T12:45:39Z","title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:50:24.771643Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2602.01203"},"observation_digest":"sha256:44423d256cf7509c3c8e3d519c8c29fd76637c0a4befcbccaa05e8580d1291db","observation_id":"5682c563-bb91-4c9e-bcff-234fb65fec30","resolution":{"observed_at":"2026-08-03T05:50:24.771643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:42eaaf5ac7d0cada91a1b3157dd69137c526b1129ae45c28436a72113f39b295","observation_id":"d9d0573e-e1ac-475f-a076-319faa5b08f4","resolution":{"observed_at":"2026-05-16T07:10:43.156734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-07-15T13:27:51.848177Z","title":"Phybench: Holis- tic evaluation of physical perception and reasoning in large language models.arXiv preprint arXiv:2504.16074,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.07109","last_updated":"2026-05-30T07:36:55Z","snapshot_observed_at":"2026-08-15T13:10:05.470489Z","submitted_at":"2026-03-07T08:40:09Z","title":"Vision Language Models Cannot Reason About Physical Transformation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-15T13:27:51.848177Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2603.07109"},"observation_digest":"sha256:dc08feb74f9b844814d2a7e1df618b8d27cce696006bd5455a9d68a98aa28407","observation_id":"af40aa66-2d6c-4ea5-aac5-f4df7fab6785","resolution":{"observed_at":"2026-07-15T13:27:51.848177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T07:44:02.827006Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2603.20633"},"observation_digest":"sha256:d6e1b7a8ee6066499e764982c557df855e4dc8fc0d83231a3ff920225bcd63af","observation_id":"969d8e6d-5cbb-49a2-a9a8-34101c6babf9","resolution":{"observed_at":"2026-05-15T07:45:14.405531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2604.02934","last_updated":"2026-04-03T10:05:30Z","snapshot_observed_at":"2026-08-12T12:05:18.789320Z","submitted_at":"2026-04-03T10:05:30Z","title":"PolyReal: A Benchmark for Real-World Polymer Science Workflows","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T19:55:17.366868Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2604.02934"},"observation_digest":"sha256:3bc5816f677f0c19967117c7e980ce5a88db15d53925389b11f56fb643aa63fe","observation_id":"c20b9fcf-9eaf-4c23-ac30-c378aaf4a9db","resolution":{"observed_at":"2026-05-13T19:58:12.284099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2604.15411","last_updated":"2026-04-16T16:22:04Z","snapshot_observed_at":"2026-08-14T21:58:54.974272Z","submitted_at":"2026-04-16T16:22:04Z","title":"PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T11:10:21.639856Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2604.15411"},"observation_digest":"sha256:38354baf66b5e2d945d5475b2a2a168cdb112359825fe4de0d126f81dec3e045","observation_id":"aaaff15b-3695-4c8d-a275-dc55b59c8288","resolution":{"observed_at":"2026-05-10T11:20:11.381486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2604.23580","last_updated":"2026-04-26T07:37:20Z","snapshot_observed_at":"2026-08-11T13:54:48.616297Z","submitted_at":"2026-04-26T07:37:20Z","title":"PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T06:13:18.967603Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2604.23580"},"observation_digest":"sha256:1d5a13e25745e6f80a53d4657312d239f4b4c4d324d5ef7348edcf73e045b1c2","observation_id":"f727223d-5410-41c5-ab9f-d9748d93aea9","resolution":{"observed_at":"2026-05-11T21:16:13.110357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2604.24443","last_updated":"2026-04-27T13:10:52Z","snapshot_observed_at":"2026-08-03T02:02:44.520224Z","submitted_at":"2026-04-27T13:10:52Z","title":"PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T03:43:18.640857Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2604.24443"},"observation_digest":"sha256:69e615ca808a779811fa7bf10a3b0b86f9656806f1b7b3e386f3a1a870e25123","observation_id":"79a6c43f-2664-4ec9-b725-153a6c4c7309","resolution":{"observed_at":"2026-05-11T21:56:26.628602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2604.27351","last_updated":"2026-04-30T03:02:27Z","snapshot_observed_at":"2026-08-15T05:56:45.851308Z","submitted_at":"2026-04-30T03:02:27Z","title":"Heterogeneous Scientific Foundation Model Collaboration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T08:50:05.980191Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2604.27351"},"observation_digest":"sha256:1946d379b4620655b3bd87d4aefe0d17ffe576511a4ee4db62161f1c280d336c","observation_id":"5d636051-6d1a-4be7-abd3-9f50fa66a361","resolution":{"observed_at":"2026-05-09T04:30:10.962510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2605.09636","last_updated":"2026-05-10T16:25:43Z","snapshot_observed_at":"2026-07-30T14:07:22.496707Z","submitted_at":"2026-05-10T16:25:43Z","title":"PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T02:36:40.696567Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2605.09636"},"observation_digest":"sha256:a0acad5a8dfef4828b9fea1199bbc40f81ed16490b9cab53893372f9c2e29800","observation_id":"c55c8f39-8847-494f-ac22-95dec3f160dd","resolution":{"observed_at":"2026-05-12T07:31:26.675661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2606.01538","last_updated":"2026-06-11T05:58:14Z","snapshot_observed_at":"2026-08-02T12:35:46.473849Z","submitted_at":"2026-06-01T01:36:44Z","title":"MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T12:19:27.221596Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2606.01538"},"observation_digest":"sha256:c6251990d26137b0fd343fd05565d2ab04048f189cb89b3f156aae1efb244864","observation_id":"668e0963-bcde-40db-8433-fc7ccdcea260","resolution":{"observed_at":"2026-07-02T01:16:24.687383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f3300db09ad8cdf26d57f5a6c1f187640ac55cc37e9dccd51b43f2fa82a49ba3","observation_id":"22bbed5b-1b7d-4d4c-87bf-c95da090f955","resolution":{"observed_at":"2026-07-02T20:27:22.619660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2606.08034","last_updated":"2026-06-06T07:51:52Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:51:52Z","title":"Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T20:11:02.445626Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2606.08034"},"observation_digest":"sha256:2e3a1d8fdc94a3eb02f58659b92bb6c4c552c2d1bb8774167761272b4adb75bb","observation_id":"188ce006-ec3f-4cf6-8db8-cef93e7c21fe","resolution":{"observed_at":"2026-07-02T20:47:22.878722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:3ab709587ee27fac2fb3918f9d21d7c945b7704f9476a0f79fefa8fb5554ee87","observation_id":"323ff441-fde6-4d5e-95e1-41ece48248e6","resolution":{"observed_at":"2026-07-02T19:07:17.387781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2607.00276","last_updated":"2026-06-30T23:52:15Z","snapshot_observed_at":"2026-08-14T05:45:14.918470Z","submitted_at":"2026-06-30T23:52:15Z","title":"Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-02T19:18:43.558804Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2607.00276"},"observation_digest":"sha256:f96ec9396dbeaf7ab2c83e9ab833f4edcb2ddfb3aa2b2163d4040a201dc1c6c7","observation_id":"2bb6da02-4f4e-4cd2-bfe9-f1a20a654948","resolution":{"observed_at":"2026-07-02T19:27:18.703824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-07-14T09:17:00.467000Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10789","last_updated":"2026-07-12T14:42:57Z","snapshot_observed_at":"2026-08-14T16:11:41.485356Z","submitted_at":"2026-07-12T14:42:57Z","title":"Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T09:17:00.467000Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2607.10789"},"observation_digest":"sha256:9703db1acdf4e4f43fcbdcd896cc9303af1503985a81a7e27d80c90c82e69edf","observation_id":"1d9d6a85-fc24-471f-84df-0d55338e06e6","resolution":{"observed_at":"2026-07-14T09:17:00.467000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-01T00:52:32.240795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27822","last_updated":"2026-07-30T08:02:33Z","snapshot_observed_at":"2026-08-06T16:33:41.959663Z","submitted_at":"2026-07-30T08:02:33Z","title":"CLVisc Agent for autonomous relativistic hydrodynamics studies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:52:32.240795Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2607.27822"},"observation_digest":"sha256:44d993e3dbf7a208a2f5b5b0e703afa19f05ffdc8ad62bfc457f71c573c54336","observation_id":"a9f75970-1fd3-4dcf-9cb4-c4e41ddf764a","resolution":{"observed_at":"2026-08-01T00:52:32.240795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T04:24:54.863248Z","title":"arXiv preprint arXiv:2504.16074 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-14T11:11:04.815546Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.863248Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:28bfaf12fd0a80536ae4faa809a9de6f514a320981aa13566482467504471051","observation_id":"6db93d44-64d1-43b9-b14c-0093100b1754","resolution":{"observed_at":"2026-08-07T04:24:54.863248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16074/citation-record","integrity":"/paper/2504.16074/integrity","json":"/paper/2504.16074/citation-record.json","paper":"/paper/2504.16074"},"outbound":[],"paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T23:17:53.534492Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2504.16074."}