{"as_of":"2026-08-10T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1cb5df89e9f8a38f996e096371474228501788e9e7445105d9939f7a1137fe38","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:22:26.217604Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24823/citation-record","integrity":"/paper/2505.24823/integrity","json":"/paper/2505.24823/citation-record.json","paper":"/paper/2505.24823"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10833","last_updated":"2024-09-28T23:58:10Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T08:03:24Z","title":"A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10833","snapshot_observed_at":"2026-08-07T12:22:22.263718Z","title":"A comprehensive survey of scientific large language models and their applications in scientific discovery, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.263718Z"},"links":{"cited_paper":"/paper/2406.10833","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:6e8e8ef44a05e1592d29d991bf46e22147732093dfa7b52b1db7880882465fcc","observation_id":"b5a48d0e-96b2-47ab-837b-9a9a873b4ed1","resolution":{"observed_at":"2026-08-07T12:22:22.263718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:22.403429Z","title":"Romera-Paredes, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.403429Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:317dd36e546f53e3043179d40ea2095c6114ed972b8059a4dba5ee25d188503a","observation_id":"808a5c32-b05e-48b9-99ca-4c0c0033234a","resolution":{"observed_at":"2026-08-07T12:22:22.403429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-07T12:22:22.541012Z","title":"The ai scientist: Towards fully automated open-ended scientific discovery, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.541012Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:f19a6e79f0e898e261a00b2794cd24252313bac8b4aa0a79259ae20329109873","observation_id":"fe59b0df-1003-4619-bb2e-5994d0365be5","resolution":{"observed_at":"2026-08-07T12:22:22.541012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:28.450072Z","title":"Llm-sr: Scientific equation discovery via programming with large language models,","venue":null,"work_id":"67909387-8480-4a67-9ac2-63fd34904ec5","year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.670967Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:acb402a8657a6048b663d626b1c2842a6508bbe354a32d3d278c2edf2fc41f48","observation_id":"df50c6f1-8be3-4d9d-915d-7c18ab264605","resolution":{"observed_at":"2026-08-07T12:22:28.507274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:22.854654Z","title":"Brenner, and Eun-Ah Kim","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.854654Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:9fb5657ac51a97fbe2acb7e28ba1d0ef0396887004ce0c3e13060f6aca03a775","observation_id":"a364e9d4-33f0-4d5c-93a0-a456a9d46440","resolution":{"observed_at":"2026-08-07T12:22:22.854654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06512","last_updated":"2025-07-25T12:50:50Z","snapshot_observed_at":"2026-08-07T17:19:14.809711Z","submitted_at":"2025-03-09T08:34:51Z","title":"LLM-Feynman: Leveraging Large Language Models for Universal Scientific Formula and Theory Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06512","snapshot_observed_at":"2026-08-07T12:22:22.956783Z","title":"Llm-feynman: Leveraging large language models for universal scientific formula and theory discovery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.956783Z"},"links":{"cited_paper":"/paper/2503.06512","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:5021d44781cf79dfc6f9ef18c9060d5381159365de5c68d3248f4156823baf38","observation_id":"51298dbc-c492-4a51-8376-bb4d517b523d","resolution":{"observed_at":"2026-08-07T12:22:22.956783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:23.042992Z","title":"Large physics models: Towards a collaborative approach with large language models and foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.042992Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:6fee2f156c7399cf1b8d086fecc14d5fc35d7df74905719c2dd83b1e6cc2a5a3","observation_id":"32b624ba-dac3-4396-a211-711b3a7bd2a1","resolution":{"observed_at":"2026-08-07T12:22:23.042992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01911","last_updated":"2025-08-18T08:28:27Z","snapshot_observed_at":"2026-08-07T16:14:03.023833Z","submitted_at":"2025-04-02T17:13:16Z","title":"Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01911","snapshot_observed_at":"2026-08-07T12:22:23.142195Z","title":"Advancing ai-scientist understanding: Making llm think like a physicist with interpretable reasoning.arXiv preprint arXiv:2504.01911, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.142195Z"},"links":{"cited_paper":"/paper/2504.01911","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:183915ddb9c7c6e2f7f79d7ed5dce4187d9ebc02af3d5615d3eb5877a957723d","observation_id":"c4563436-9104-4f8f-87b4-a07a5a2783fb","resolution":{"observed_at":"2026-08-07T12:22:23.142195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-10T15:50:18.915523Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T12:22:23.253023Z","title":"Alex Hofer, Jan Humplik, Atil Iscen, Mithun George Jacob, Deepali Jain, Ryan Julian, Dmitry Kalash- nikov, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.253023Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:b3e65ca4add220da3f121968b4c36cc4866c9cef00ba2566aa51b8da520003f9","observation_id":"0b2493fa-4321-4818-a7ef-0128d76ea2ca","resolution":{"observed_at":"2026-08-07T12:22:23.253023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15815","last_updated":"2025-02-19T19:00:00Z","snapshot_observed_at":"2026-08-07T23:28:55.289287Z","submitted_at":"2025-02-19T19:00:00Z","title":"Theoretical Physics Benchmark (TPBench) -- a Dataset and Study of AI Reasoning Capabilities in Theoretical Physics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15815","snapshot_observed_at":"2026-08-07T12:22:23.366842Z","title":"Theoretical physics benchmark (tpbench)–a dataset and study of ai reasoning capabilities in theoretical physics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.366842Z"},"links":{"cited_paper":"/paper/2502.15815","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:c984796326329b497cb2721876ac9b84791d54674fcd61b88e129b946f7df6b2","observation_id":"396fc029-6d63-4220-a6ad-614e4ce1b101","resolution":{"observed_at":"2026-08-07T12:22:23.366842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T12:22:23.478351Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.478351Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:796f56e03e5e1a622e6c7001bdf86794c72f9fb73f1e48142b8fa372e2144880","observation_id":"3f783fd1-951f-41cb-9688-782fa1291086","resolution":{"observed_at":"2026-08-07T12:22:23.478351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:28.264393Z","title":"Expert and novice performance in solving physics problems","venue":null,"work_id":"f8954274-7b75-45dd-825b-dbac8e0fc057","year":1980},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.556910Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:534511d87c0100ac1225d5736ca2c9416ed11c73f517a015cc1c65c6057becf6","observation_id":"803b530e-0457-400d-a200-728c2ce4442f","resolution":{"observed_at":"2026-08-07T12:22:28.365459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:23.661672Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.661672Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:f39b2c72c731d38a2133b00fad7f7bfbd9889c8532ef417659297abec760808d","observation_id":"9371a1df-69bf-44c3-85d2-988571c33163","resolution":{"observed_at":"2026-08-07T12:22:23.661672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:23.740680Z","title":"Cognitive load during problem solving: Effects on learning","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.740680Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:a08d685edd077620bc7441fb6eb44f7d4472d16bfef9c4729433939c696e26e3","observation_id":"f7c2d1ae-54f7-48bf-9368-62c51f1b0030","resolution":{"observed_at":"2026-08-07T12:22:23.740680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:22:23.833827Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.833827Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:f75d4e8c1cd99120e30003963f291f01b542bc1ef450cc624a2caa287cdd4b53","observation_id":"4b35877a-f8ac-416f-aebc-eba31f4ffe22","resolution":{"observed_at":"2026-08-07T12:22:23.833827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:22:23.924503Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.924503Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:b7fb57ccae811951abf245643c56049f2acb6bb42abca8e12f13ccdf2a5b412e","observation_id":"521599b2-9065-4a7f-931a-2bbcfdfd0ee4","resolution":{"observed_at":"2026-08-07T12:22:23.924503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-07T12:22:23.996077Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.996077Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:7f658421a326aafd65bf9b89a5fd082a6bdd7877a0e7862ec738fa12a2ac9122","observation_id":"dbb57740-cea8-471f-bcbf-fc7a73709532","resolution":{"observed_at":"2026-08-07T12:22:23.996077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.060193Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.060193Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:3806d2b333dc6c693a4d9a35f828f33f91a90e979e6b870fc137793521c5d883","observation_id":"f4e69425-a990-4618-bc0a-e1b6462b638a","resolution":{"observed_at":"2026-08-07T12:22:24.060193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-07T12:22:24.129251Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.129251Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:579ae6f37dc2c155c196d8025ef78957a49a626a981a3ae29c1bfaea8d24ee9c","observation_id":"cdf12970-07b3-43f0-bc47-85ff7762fa00","resolution":{"observed_at":"2026-08-07T12:22:24.129251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.207587Z","title":"Have LLMs advanced enough? a chal- lenging problem solving benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.207587Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:2ab79e2d73b1f906ff764944fa20e4898daf8442a8aef38cd77aa5543f7bfe9b","observation_id":"79cc130c-bbb1-43d2-b840-5dcaa3d9d231","resolution":{"observed_at":"2026-08-07T12:22:24.207587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-07T12:22:24.297967Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.297967Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:33c2a14f3a0b27fc143d555d5849e342a4c8ff3036ef75bf5c74d3f8e746b803","observation_id":"02dda92c-2780-45b9-8f2c-1f865cb1b5ae","resolution":{"observed_at":"2026-08-07T12:22:24.297967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.372229Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.372229Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:7edc5fac233096529248c1a30936b6be909c61a6bef037b4b947b2be20c9cf56","observation_id":"0c387862-5d82-4e16-9e86-65313924be74","resolution":{"observed_at":"2026-08-07T12:22:24.372229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:28.059161Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific research","venue":null,"work_id":"c9412459-29ac-495d-bcfd-af531feddcfd","year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.440236Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:276d40c6b8e8acf1e1dc54cf53dc1918bdcde2a0f9b4f0a2ffca295d233b3da1","observation_id":"a869ab84-d082-48b6-ba44-90cd9788c3f8","resolution":{"observed_at":"2026-08-07T12:22:28.130295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12524","last_updated":"2023-12-06T03:02:45Z","snapshot_observed_at":"2026-08-09T22:04:41.811623Z","submitted_at":"2023-05-21T17:51:35Z","title":"TheoremQA: A Theorem-driven Question Answering dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12524","snapshot_observed_at":"2026-08-07T12:22:24.562397Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.562397Z"},"links":{"cited_paper":"/paper/2305.12524","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:b4f3daac60d7c7941444aaf910a533587427671fa4440c56794e756ea8a1d6de","observation_id":"5a431d61-daf8-4a7e-897a-e5c964430a73","resolution":{"observed_at":"2026-08-07T12:22:24.562397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T12:22:24.630990Z","title":"Humanity’s last exam","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.630990Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:5e8907fa82dca2fdd0d110ab9f6e19f80129d28bec29fb1e12847b0712e85522","observation_id":"af06dde0-a12c-42a3-ade6-77517c781a61","resolution":{"observed_at":"2026-08-07T12:22:24.630990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T12:22:24.704748Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.704748Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:624fce67e718dda6c451295007eef9410ad762f1281532be9805d35bbf8d0f66","observation_id":"4a96a0a4-9d2a-495f-b9bc-2f049d547835","resolution":{"observed_at":"2026-08-07T12:22:24.704748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.776896Z","title":"Olympicarena: Benchmarking multi-discipline cognitive reasoning for superintelligent ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.776896Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:59960edc0f64ac35443011ab3ce55ab6f4a1e0826e2dcbf7750042cfd636f173","observation_id":"180c217d-8b14-420f-b85d-f8106afa1290","resolution":{"observed_at":"2026-08-07T12:22:24.776896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08182","last_updated":"2023-09-20T07:08:53Z","snapshot_observed_at":"2026-08-10T12:44:27.778626Z","submitted_at":"2023-09-15T06:13:06Z","title":"Using Large Language Model to Solve and Explain Physics Word Problems Approaching Human Level","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08182","snapshot_observed_at":"2026-08-07T12:22:24.850334Z","title":"Using large language model to solve and explain physics word problems approaching human level","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.850334Z"},"links":{"cited_paper":"/paper/2309.08182","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:07828bdacbacdc30dd958a347df44ae08392d43c0e809792051e0fecdf9ceb8b","observation_id":"9b4783e0-6f33-4c67-a1ba-a05baec08497","resolution":{"observed_at":"2026-08-07T12:22:24.850334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00334","last_updated":"2025-06-03T07:13:03Z","snapshot_observed_at":"2026-08-09T21:05:59.284722Z","submitted_at":"2025-02-01T06:42:02Z","title":"UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00334","snapshot_observed_at":"2026-08-07T12:22:24.926698Z","title":"Ugphysics: A comprehensive benchmark for undergraduate physics reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.926698Z"},"links":{"cited_paper":"/paper/2502.00334","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:77e691beb55b6e40e71f52fe6cb683f9a877de5a90f1e7806e767754b4dd12af","observation_id":"03c59c30-0f57-4c2b-9221-927d494fe54b","resolution":{"observed_at":"2026-08-07T12:22:24.926698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-07T16:00:09.967849Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T12:22:25.013730Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.013730Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:e9194c940b665f85a2e0aec5975482fb0452cbfc9c2b1a813db075e8857839d3","observation_id":"b1401a96-4fdf-4fce-8ad7-6f18ae4f77ba","resolution":{"observed_at":"2026-08-07T12:22:25.013730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12054","last_updated":"2025-05-26T13:42:06Z","snapshot_observed_at":"2026-08-09T21:13:13.536782Z","submitted_at":"2025-02-17T17:24:14Z","title":"PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12054","snapshot_observed_at":"2026-08-07T12:22:25.112064Z","title":"Physreason: A comprehensive benchmark towards physics-based reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.112064Z"},"links":{"cited_paper":"/paper/2502.12054","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:16fb6fee536bb66bb2947575265312e245d6aa83c87ae9aaf132eb3a928f17ab","observation_id":"aa447c21-1001-482c-9c3f-e2f2bc2942c1","resolution":{"observed_at":"2026-08-07T12:22:25.112064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13517","last_updated":"2025-05-13T06:16:23Z","snapshot_observed_at":"2026-08-09T02:25:55.215098Z","submitted_at":"2025-03-14T17:53:03Z","title":"CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13517","snapshot_observed_at":"2026-08-07T12:22:25.206982Z","title":"Curie: Evalu- ating llms on multitask scientific long context understanding and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.206982Z"},"links":{"cited_paper":"/paper/2503.13517","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:d307c0aa9ea274830ad0b4fb6e578fc0cc5031bc3210fbca3d6dbe802b9717bb","observation_id":"9993ea64-1444-49b2-b6e0-7d4512665de9","resolution":{"observed_at":"2026-08-07T12:22:25.206982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:25.273400Z","title":"Mm-phyqa: Multimodal physics question-answering with multi-image cot prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.273400Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:bff25831fd129291b7b38ee796a8129eab7fb161b75159dd7f18228469a693a7","observation_id":"18e58079-ba3c-4c38-ab28-ba13d822cc40","resolution":{"observed_at":"2026-08-07T12:22:25.273400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06260","last_updated":"2025-04-08T17:59:39Z","snapshot_observed_at":"2026-08-07T16:07:25.844827Z","submitted_at":"2025-04-08T17:59:39Z","title":"FEABench: Evaluating Language Models on Multiphysics Reasoning Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06260","snapshot_observed_at":"2026-08-07T12:22:25.362149Z","title":"Feabench: Evaluating language models on multiphysics reasoning ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.362149Z"},"links":{"cited_paper":"/paper/2504.06260","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:d115f54e335f7535d50006d3365ec9da021a2ab4839e0f0806c7f409b6861c0e","observation_id":"6da479d7-7839-4893-9e43-1d28264fe77c","resolution":{"observed_at":"2026-08-07T12:22:25.362149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.828575Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":"2eb8a384-3af0-412b-9377-00481d3b89d1","year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.433618Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:dea78e4f8ee6bc85bd0c0402d3987079d2bf16641dfc112c56b6b342b31e851f","observation_id":"7a961bc9-1382-43b1-9101-ff2fc5c1d320","resolution":{"observed_at":"2026-08-07T12:22:27.886863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:22:25.520633Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.520633Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:f7e30536f3ce00206efc0eb2f7486bb7ddee0fcab3479d0e6188c5f3aa438a2e","observation_id":"f3766474-28fc-4d52-aaee-35044a14fcff","resolution":{"observed_at":"2026-08-07T12:22:25.520633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:22:25.610427Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.610427Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:d0caeb5d5d8faa66a9a39102d3f44c75bdedae0e95d7244d8a980547aea950ab","observation_id":"82d86910-6508-4c19-a1ed-f374995122c0","resolution":{"observed_at":"2026-08-07T12:22:25.610427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.627013Z","title":"Claude 3.7 sonnet and extended thinking mode","venue":null,"work_id":"1d31ced2-98a8-49ad-979c-8c75c9dce9a9","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.698133Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:f3334f5cd8b797b52574eb71ae28fc3d6a0389a540e04f808568c32c68c7b949","observation_id":"df088cbf-23f6-4b89-ad03-62d780ba7c78","resolution":{"observed_at":"2026-08-07T12:22:27.712882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.453672Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"183c22ab-6543-4256-acc5-1e3fef6fff8c","year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.762655Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:7aef45945306a77ff0be0db360c131a2118f7bb86a154bf524854a6d31de1b03","observation_id":"9c98da01-6cb7-4932-8275-2d57c4e85b04","resolution":{"observed_at":"2026-08-07T12:22:27.536957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.265261Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"9329e775-ff13-45b1-83e5-b1cbe71fdb2a","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.833242Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:1e6c29045ec1f60e41e5f08aee55c68d9da95f882f8323ceccb7523382d28f0c","observation_id":"610037b8-ea61-4d33-9e03-36693ba95cde","resolution":{"observed_at":"2026-08-07T12:22:27.353683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.141932Z","title":"URL https://blog.google/technology/ google-deepmind/gemini-model-thinking-updates-march-2025/","venue":null,"work_id":"85e66c3b-7d8e-4795-a1aa-cc34d2b35410","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.907140Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:c52b59fff108448ba27344bde41dec447d6d0dc3daf0b97043e9289502fea12a","observation_id":"bc3d9c65-2030-4145-a99d-14949198f77d","resolution":{"observed_at":"2026-08-07T12:22:27.190613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:25.980401Z","title":"Introducing gpt-4.1 in the api, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.980401Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:7b92b8fe17bed1a15eeb59190b954860c00baed2c8d4f935bc0d7608e83832f9","observation_id":"0c3101cb-d4ed-4803-9e0f-7821cf0c4c4f","resolution":{"observed_at":"2026-08-07T12:22:25.980401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:26.962328Z","title":"Claude 3.7 sonnet and claude code, February 2025","venue":null,"work_id":"d6f5ac19-ffd1-43c2-851d-147fbccd5a4c","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:26.052171Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:a327b0b3c36c623b3dc9be0ae9f14d08a3f142d73708a53a8871e2f0e20bd95a","observation_id":"41e85d35-4d36-4afa-9448-d6f018c2cc8d","resolution":{"observed_at":"2026-08-07T12:22:27.046469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:26.127078Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:26.127078Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:bd09256cdb177e1f2de9861b997f03167613e8492e6826893f20855801c98d44","observation_id":"2d41297a-7b22-48f6-824a-25225da34672","resolution":{"observed_at":"2026-08-07T12:22:26.127078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:22:26.217604Z","title":"Zero-shot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:26.217604Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:4ca5d1fee9b5a0e0d5364e4150ba98f218f7d4b686ac24c79d33d9bd3d50adfb","observation_id":"56ffc97e-5c6e-4606-9adb-ba5a36adf4f6","resolution":{"observed_at":"2026-08-07T12:22:26.217604Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18400","last_updated":"2025-03-20T16:37:17Z","snapshot_observed_at":"2026-08-09T12:02:00.353147Z","submitted_at":"2024-04-29T03:30:06Z","title":"LLM-SR: Scientific Equation Discovery via Programming with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18400","snapshot_observed_at":"2026-08-07T12:22:22.780339Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.780339Z"},"links":{"cited_paper":"/paper/2404.18400","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:ebe7e939cbd16f84ed34412942b45919a844fea6e512878cd563756d5ad53536","observation_id":"0e7d5fea-6140-40d0-9f66-44aae2f38c47","resolution":{"observed_at":"2026-08-07T12:22:22.780339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:39:20.850711Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2505.24823."}