{"as_of":"2026-08-22T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd67cfef32a142f2908def9c82d327dda35885cc260fc3301d19bebfc4cdfa56","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:21.111443Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:22:23.855247Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:22:26.516274Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"cited_work":{"arxiv_id":"2505.17139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17139","snapshot_observed_at":"2026-08-07T00:22:26.516274Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","venue":"cs.CL","work_id":"4260d01d-7a7f-4f47-8a11-49c1d1f01d2d","year":2025},"citing_paper":{"arxiv_id":"2506.14345","last_updated":"2025-06-17T09:38:45Z","snapshot_observed_at":"2026-08-13T04:00:57.374755Z","submitted_at":"2025-06-17T09:38:45Z","title":"A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:22:23.855247Z"},"links":{"cited_paper":"/paper/2505.17139","citing_paper":"/paper/2506.14345"},"observation_digest":"sha256:6c08a65f3ee1bc126bf5d56961a4d09ae7f63ddcfa101eae1bc43f4f0691146b","observation_id":"e1b52b5b-524f-4269-898e-da894a8fef87","resolution":{"observed_at":"2026-08-07T00:22:26.646516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17139/citation-record","integrity":"/paper/2505.17139/integrity","json":"/paper/2505.17139/citation-record.json","paper":"/paper/2505.17139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:10:20.566305Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.566305Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:24957c739b1ba6efc9e08d65d0149faf7e9ba115a5d57e666147102c35301a32","observation_id":"12e6ab02-ab96-4435-9f59-007f7f320169","resolution":{"observed_at":"2026-08-07T15:10:20.566305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02031","last_updated":"2024-09-03T10:19:52Z","snapshot_observed_at":"2026-08-16T14:55:30.183623Z","submitted_at":"2023-10-03T13:17:35Z","title":"OceanGPT: A Large Language Model for Ocean Science Tasks","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02031","snapshot_observed_at":"2026-08-07T15:10:20.576960Z","title":"Oceangpt: A large language model for ocean science tasks.arXiv preprint arXiv:2310.02031, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.576960Z"},"links":{"cited_paper":"/paper/2310.02031","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:f136880b847bdfe0de40a32d135caba0b1d17784ff32c2f8ef0bddbd19c21a92","observation_id":"6f7f9f8a-0dc7-4e7c-b5ab-106c5b6bd07a","resolution":{"observed_at":"2026-08-07T15:10:20.576960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.724660Z","title":"Matplotlib and seaborn","venue":null,"work_id":"25e69ff4-e0be-4df8-873d-6c93689c596b","year":2019},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.586447Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:1e506150f40110412b2d431a2b7bb814761a7c07dd372ba9f12e432d5ffefa2f","observation_id":"3b9a4a9b-84d1-49dc-8890-d6f090abcec9","resolution":{"observed_at":"2026-08-07T15:10:22.734997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.696127Z","title":"This reference does not exist: an exploration of llm citation accuracy and relevance","venue":null,"work_id":"6c2321e2-b4d9-420d-b60e-9cf32779e44b","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.597692Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:8e55ad22b4eeb6502ed8ad8b6bb1ff720bded0f8584a04eac1e590b91ad521eb","observation_id":"ee12df61-3140-427d-89bd-3baa7c2563f7","resolution":{"observed_at":"2026-08-07T15:10:22.704132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01976","last_updated":"2024-10-18T06:52:17Z","snapshot_observed_at":"2026-08-19T18:35:37.900378Z","submitted_at":"2024-03-04T12:19:28Z","title":"SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01976","snapshot_observed_at":"2026-08-07T15:10:20.605939Z","title":"Sciassess: Benchmarking llm proficiency in scientific literature analysis.arXiv preprint arXiv:2403.01976, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.605939Z"},"links":{"cited_paper":"/paper/2403.01976","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:42364b8a2679bc48be8a8d0c8fe6938af93013a2c007d59eab82ec48bbb4d594","observation_id":"03694014-52e2-4d23-a59a-ca3afde7f50d","resolution":{"observed_at":"2026-08-07T15:10:20.605939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.14788","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.183748Z","title":"On the design and analysis of llm-based algorithms.arXiv preprint arXiv:2407.14788, 2024","venue":null,"work_id":"83ebe501-1fb9-4750-9363-dc82d9a53489","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.613696Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:4f6cf5af0d649983b0a9abb946a229120069581964301f7f975ed95e073056e7","observation_id":"5c6626de-6fc7-4472-9abd-8611b34178a7","resolution":{"observed_at":"2026-08-07T15:10:22.199410Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.672149Z","title":"Grok, gemini, chatgpt and deepseek: Com- parison and applications in conversational artificial intelligence.INTELIGENCIA ARTIFICIAL, 2(1), 2025","venue":null,"work_id":"4f52d76f-4ec9-4796-8567-37c499700078","year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.624596Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:a05b3f543476b257c1b0e28a4ae83af8a77fa4a51e7f661cce994067f65d4cbe","observation_id":"5c3a3ed5-4562-4bb9-a41d-72eecfe0a441","resolution":{"observed_at":"2026-08-07T15:10:22.679570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.644780Z","title":"K2: A foundation language model for geoscience knowledge understanding and utilization","venue":null,"work_id":"183bbd3d-8e90-4614-a301-4e4d01573bcd","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.633444Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:cdb1fdd27838233570d932c6c0c4f65aa2b75ae7efa57bd6153715fb6b91718d","observation_id":"ddd7c2a3-4a07-4ef7-8503-14a8219b0570","resolution":{"observed_at":"2026-08-07T15:10:22.653051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.621984Z","title":"A deep learning model based on bert and sentence transformer for semantic keyphrase extraction on big social data.IEEE Access, 9:165252–165261, 2021","venue":null,"work_id":"23f0e196-78bb-48d2-bb1a-234772a346de","year":2021},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.642177Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:b0b1b81f3d3de78452a744add045086b2177e4c105a7a3a9014d244f1aee7a56","observation_id":"3a77f33f-629b-42ae-aa1d-af2ec3f14e6e","resolution":{"observed_at":"2026-08-07T15:10:22.629090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-08-15T17:40:05.031382Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T15:10:20.649206Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines.arXiv preprint arXiv:2502.14739, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.649206Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:ff7e0d33c20e95206f9b3893f842cae74763db68541fa8265cdd5cb9c4f36c64","observation_id":"8e52f789-699d-415e-8981-809fe1d85431","resolution":{"observed_at":"2026-08-07T15:10:20.649206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.588673Z","title":"The impact factor.Current contents, 25(20):3–7, 1994","venue":null,"work_id":"39d6820f-6971-4c5f-b396-c7cb75f163f2","year":1994},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.656055Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:2c68d75e79917bc0350b6ece28d09cf08bdaecdb7f00a81982e5d0835fb0336c","observation_id":"901f78dc-51e1-4aa5-89ae-83a1174aeb2f","resolution":{"observed_at":"2026-08-07T15:10:22.599611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:10:20.662840Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.662840Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:f0b49057e186440fc165c0f99f2a04568ab24f3a4457152e89b3888eb1c35e63","observation_id":"558f8956-d940-4cbb-ac35-562400adbf7a","resolution":{"observed_at":"2026-08-07T15:10:20.662840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.550190Z","title":"Llm-based code generation method for golang compiler testing","venue":null,"work_id":"9c4c78fe-527e-4c3c-ad95-ed5895f1f416","year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.674468Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c2638617ce7d58979bf23a4ffa28058db9c9f79d5f0dab9b7a5d2a6db7b2252f","observation_id":"a51b57c8-8b18-4140-ba82-5509949b35fe","resolution":{"observed_at":"2026-08-07T15:10:22.566077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13773","last_updated":"2024-06-04T10:42:01Z","snapshot_observed_at":"2026-08-19T17:32:25.432224Z","submitted_at":"2024-06-04T10:42:01Z","title":"OpenDataLab: Empowering General Artificial Intelligence with Open Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13773","snapshot_observed_at":"2026-08-07T15:10:20.683625Z","title":"Opendatalab: Empowering general artificial intelligence with open datasets.arXiv preprint arXiv:2407.13773, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.683625Z"},"links":{"cited_paper":"/paper/2407.13773","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:17606cc33e0fda28aa28b2b7be71cf7edc741d3a1d99f4e01b7453264781b334","observation_id":"95be0cb6-704e-402e-886b-af5bf384528f","resolution":{"observed_at":"2026-08-07T15:10:20.683625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00916","last_updated":"2025-02-02T21:05:21Z","snapshot_observed_at":"2026-08-20T03:09:57.978283Z","submitted_at":"2025-02-02T21:05:21Z","title":"The Accuracy, Robustness, and Readability of LLM-Generated Sustainability-Related Word Definitions","version":1},"cited_work":{"arxiv_id":"2502.00916","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00916","snapshot_observed_at":"2026-08-07T15:10:22.021571Z","title":"The Accuracy, Robustness, and Readability of LLM-Generated Sustainability-Related Word Definitions","venue":"cs.CL","work_id":"c977a6ef-e5e7-4285-98f4-1636b8fd1de1","year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.695723Z"},"links":{"cited_paper":"/paper/2502.00916","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:e9dbbf9d3771ceceb35d4d602d8911d068a2198b56c0c9daae3bebff205b5b2a","observation_id":"91fc2325-9511-40b3-a819-e546cb97576a","resolution":{"observed_at":"2026-08-07T15:10:22.028408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:10:20.704332Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.704332Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:f6e472161e9674043ee61735bb5b37efa0e373c28119a74c33390ec105ff3939","observation_id":"b1fc3332-5753-4732-b197-51241d8d9f52","resolution":{"observed_at":"2026-08-07T15:10:20.704332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.713964Z","title":"The era5 global reanalysis.Quarterly journal of the royal meteorological society, 146(730):1999–2049, 2020","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.713964Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:2775250e1c6c288b3d33315617cb7a8bef078efd4f9c548792d3bd0e7b4287a9","observation_id":"78b29462-ae4a-485d-b659-4a848770e410","resolution":{"observed_at":"2026-08-07T15:10:20.713964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.723245Z","title":"Gpt-4o: The cutting-edge advancement in multimodal llm.Authorea Preprints, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.723245Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:90343b010bd59ac29a6a24f60a59835a3e1d7a249c767ec63d24f85d0211d24b","observation_id":"281212e1-4636-41b7-acc7-a9c31a696dea","resolution":{"observed_at":"2026-08-07T15:10:20.723245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00116","last_updated":"2023-03-31T20:24:14Z","snapshot_observed_at":"2026-08-16T19:20:29.905967Z","submitted_at":"2023-03-31T20:24:14Z","title":"Enhancing Large Language Models with Climate Resources","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00116","snapshot_observed_at":"2026-08-07T15:10:20.734284Z","title":"Enhancing large language models with climate resources.arXiv preprint arXiv:2304.00116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.734284Z"},"links":{"cited_paper":"/paper/2304.00116","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:afb0cf28b482d5c255a9c68d3dfc70a5a0abc9e2bdc8e820209fa12dd5972714","observation_id":"ebe8e811-81a1-49bf-b046-a2957d4f76d5","resolution":{"observed_at":"2026-08-07T15:10:20.734284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.487417Z","title":null,"venue":null,"work_id":"62fe9c5e-7435-49b7-8d18-b26ab9bd59c9","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.757242Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:0050a1092b5e4ffb17d74bcb657f08466c9f722cc5bae5711305660a03a2f1a8","observation_id":"afffe1b5-8a9f-49a9-9371-5b9914af7231","resolution":{"observed_at":"2026-08-07T15:10:22.494299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.465207Z","title":"Iterative large language models evolution through self-critique","venue":null,"work_id":"914ccef8-9b84-4872-a0fb-76965844cde1","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.766466Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:e6d4239f8d20a8a251cc9d1e20c5cf7c37da847b614593d9284039f7b1930603","observation_id":"74aae74f-2757-4bb5-b553-06560836c397","resolution":{"observed_at":"2026-08-07T15:10:22.471709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13889","last_updated":"2024-12-07T09:43:20Z","snapshot_observed_at":"2026-08-17T17:43:47.736560Z","submitted_at":"2024-08-25T16:43:19Z","title":"LLM with Relation Classifier for Document-Level Relation Extraction","version":2},"cited_work":{"arxiv_id":"2408.13889","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13889","snapshot_observed_at":"2026-08-07T15:10:21.947644Z","title":"LLM with Relation Classifier for Document-Level Relation Extraction","venue":"cs.CL","work_id":"0c03343a-b758-450d-8550-788bf3d76a21","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.777262Z"},"links":{"cited_paper":"/paper/2408.13889","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c45285002d174f774b35457db93f58a4cf2f6d193c7b05b41e90ff4df1234ef3","observation_id":"6bc77e47-f0a3-4788-b6d7-8306b957569e","resolution":{"observed_at":"2026-08-07T15:10:21.956033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-21T05:30:31.348509Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T15:10:20.798959Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.798959Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:cd293614225d08a4f4536e12c4413743561fcf033b44e2e2fb187ed6b6c60e5e","observation_id":"fe3cb26d-1bf5-4cb4-8269-3a815cbc21c2","resolution":{"observed_at":"2026-08-07T15:10:20.798959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.437666Z","title":null,"venue":null,"work_id":"a9c641ea-308c-42aa-af56-f69f59e33a4f","year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.819684Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:8ba8c62d9ad75f2e7f01866fc8e9b5f5c349ebbd8397a42fde417dd9040f0b95","observation_id":"872ab3e7-b821-49cc-87ec-146b1e0ff023","resolution":{"observed_at":"2026-08-07T15:10:22.445208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:10:20.829089Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.829089Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:f46f961a1ea47dfafe01e23bede5c6eb4618a9ef9bc992c156ba8e1745689d80","observation_id":"056aff60-4819-4244-93b8-6950fc322455","resolution":{"observed_at":"2026-08-07T15:10:20.829089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-08-20T13:44:59.356502Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-07T15:10:20.840356Z","title":"The ai scien- tist: Towards fully automated open-ended scientific discovery.arXiv preprint arXiv:2408.06292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.840356Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:b7a4232b0a92966831a07bfbaeb36907794bc1756dbd197bdf5b2a9531fa61cf","observation_id":"62bd0b92-6d7e-4daa-b372-7e9b269ae79d","resolution":{"observed_at":"2026-08-07T15:10:20.840356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.852395Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.852395Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:ced4807224cfe82e0e10a339fa1695a6fbb00d261a37c0fe4fd11ad933f22690","observation_id":"6531b314-a0a7-4985-8138-d996dd5fdde2","resolution":{"observed_at":"2026-08-07T15:10:20.852395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.392871Z","title":"The five environmental spheres","venue":null,"work_id":"8de8567b-242f-4990-8ab6-8654f888b9ea","year":2006},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.859905Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:431a1f35ed1b9c86a24ffeae80fa45142c7aee2ce27997211ac4763179e12bee","observation_id":"8f689b85-f820-48e3-a3e8-f959eef2b0ac","resolution":{"observed_at":"2026-08-07T15:10:22.399166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16701","last_updated":"2025-03-09T18:31:12Z","snapshot_observed_at":"2026-08-18T14:53:53.665380Z","submitted_at":"2024-10-22T05:12:19Z","title":"ClimaQA: An Automated Evaluation Framework for Climate Question Answering Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16701","snapshot_observed_at":"2026-08-07T15:10:20.868023Z","title":"Climaqa: An auto- mated evaluation framework for climate foundation models.arXiv preprint arXiv:2410.16701, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.868023Z"},"links":{"cited_paper":"/paper/2410.16701","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:baba42b17af411643571887dfd576d87706d1954b692e1476152e9e32ab4dacb","observation_id":"bd80d183-00d0-4c2f-86be-20dacafbcab6","resolution":{"observed_at":"2026-08-07T15:10:20.868023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.369851Z","title":"Seafloorai: A large-scale vision- language dataset for seafloor geological survey.Advances in Neural Information Processing Systems, 37:22107–22123, 2024","venue":null,"work_id":"45e98122-2a91-4465-aa3d-f729d8a49086","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.876565Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:fa53676c05685551a5f3c629abfab11ad2230ec93f12c4d79327527da343a25c","observation_id":"45cf0f75-ab81-4122-ba23-88b942d26cd5","resolution":{"observed_at":"2026-08-07T15:10:22.378751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00492","last_updated":"2024-05-01T12:59:37Z","snapshot_observed_at":"2026-08-20T08:23:20.981381Z","submitted_at":"2024-05-01T12:59:37Z","title":"Is Temperature the Creativity Parameter of Large Language Models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00492","snapshot_observed_at":"2026-08-07T15:10:20.885364Z","title":"Is temperature the creativity parameter of large language models?arXiv preprint arXiv:2405.00492, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.885364Z"},"links":{"cited_paper":"/paper/2405.00492","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:d08aa70bf6b31f34c22ae9a829bf256a4cdd1f225a449ba2a40e30f48c4074eb","observation_id":"4c1b245e-0f1d-4ba5-bac3-493010190ebf","resolution":{"observed_at":"2026-08-07T15:10:20.885364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:10:20.895287Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.895287Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:52b83d533e1e011bdc4370fc9ffd1af82854afd56aa90e2478c4f41d7ffbcb70","observation_id":"c50de15f-b858-4496-af4f-72d51508e97a","resolution":{"observed_at":"2026-08-07T15:10:20.895287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.903533Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.903533Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:bbf4760c999fef883903f7793981aa67ca6864a29417b60c4b9da0b94475656e","observation_id":"13166c0e-916b-40bc-b5bc-c9685bceabd0","resolution":{"observed_at":"2026-08-07T15:10:20.903533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04168","last_updated":"2025-05-12T19:41:57Z","snapshot_observed_at":"2026-08-16T13:20:48.539468Z","submitted_at":"2024-09-06T10:09:41Z","title":"From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04168","snapshot_observed_at":"2026-08-07T15:10:20.913666Z","title":"From calculation to adjudication: Examining llm judges on mathematical reasoning tasks.arXiv preprint arXiv:2409.04168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.913666Z"},"links":{"cited_paper":"/paper/2409.04168","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:94e99383281da67ba2124b88bc72688eb7e6c475916f819863313759a29c0d09","observation_id":"7d5f817d-5d5f-484e-9271-46d7e81fbf16","resolution":{"observed_at":"2026-08-07T15:10:20.913666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-07T15:10:20.923953Z","title":"Galactica: A large language model for science.arXiv preprint arXiv:2211.09085, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.923953Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:3a2b2bc0cb62d09d56914e6780eb8972e1c428b8086ccba9f9f756477d1cb945","observation_id":"2ea61cff-348e-4ac5-8f3c-92b75c277f79","resolution":{"observed_at":"2026-08-07T15:10:20.923953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:10:20.951647Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.951647Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:2d582a160010e0bb4866919ea370e5115e85077892e8f896f45848cd557f1585","observation_id":"673f422b-1eae-4dc7-b4f9-06cf2fd9c73e","resolution":{"observed_at":"2026-08-07T15:10:20.951647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:10:20.957403Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.957403Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:378d6a1d0c9a5f4067088298e840b3ff5583ff5071c6e788e73756e961cf2e8e","observation_id":"bf4b7597-e101-4f0e-a4d5-bdccec3f0e9d","resolution":{"observed_at":"2026-08-07T15:10:20.957403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.967014Z","title":"Large language models in medicine.Nature medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.967014Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:748fb3ee34205736f21a57b2b92562e487638fe0d7cb0f56b263a6bf8e4a3b6a","observation_id":"acd440be-6d2c-4734-9ae5-b41998e399ba","resolution":{"observed_at":"2026-08-07T15:10:20.967014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.00483","last_updated":"2021-01-02T16:13:06Z","snapshot_observed_at":"2026-08-16T19:01:53.527736Z","submitted_at":"2020-12-01T13:42:37Z","title":"ClimaText: A Dataset for Climate Change Topic Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.00483","snapshot_observed_at":"2026-08-07T15:10:20.976823Z","title":"Climatext: A dataset for climate change topic detection.arXiv preprint arXiv:2012.00483, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.976823Z"},"links":{"cited_paper":"/paper/2012.00483","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:436f539843da1fa9781b4d72e4d87e9b99a7605c9fa0064f3b4c948418939082","observation_id":"8756a6bd-781f-4f4d-9f0a-649e2e411800","resolution":{"observed_at":"2026-08-07T15:10:20.976823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-08-14T02:54:31.558222Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-07T15:10:20.984124Z","title":"Mineru: An open-source solution for precise document content extraction.arXiv preprint arXiv:2409.18839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.984124Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:dab442cf6342bd5b73f30f0bb0bc18b29275e1ea8d84a02847e082b8254b3123","observation_id":"357c6f56-b065-4774-afe6-059089e7894a","resolution":{"observed_at":"2026-08-07T15:10:20.984124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-07T15:10:20.991495Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models.arXiv preprint arXiv:2307.10635, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.991495Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c37c0f32a827b74fbb70509c8a57f8053f7795082a51d125341d0504b1d759fb","observation_id":"12c2eb19-6730-442c-bc1a-4f20aabc21d0","resolution":{"observed_at":"2026-08-07T15:10:20.991495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:21.000707Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.000707Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:d75a69b63524dec99046178258ea2ca231042120d9890164fab436f3a5cc709b","observation_id":"28c22c42-0dcb-4e72-a4ef-d3c17236d7a5","resolution":{"observed_at":"2026-08-07T15:10:21.000707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12010","last_updated":"2022-12-17T12:20:08Z","snapshot_observed_at":"2026-08-16T17:47:14.001030Z","submitted_at":"2021-10-22T18:47:34Z","title":"ClimateBert: A Pretrained Language Model for Climate-Related Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12010","snapshot_observed_at":"2026-08-07T15:10:21.012346Z","title":"Climatebert: A pretrained language model for climate-related text.arXiv preprint arXiv:2110.12010, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.012346Z"},"links":{"cited_paper":"/paper/2110.12010","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:72517e0425f6ee5f6edd3d656c56fc95c57cfb2cdcfcaaa40c38183cbc1b00c4","observation_id":"aa62ad69-0af6-4ff4-ba72-3673f29240f7","resolution":{"observed_at":"2026-08-07T15:10:21.012346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:21.021049Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.021049Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:2ecc0ac184a53de33ff798b29e6a1b269c0edf8f725261319b5cee11577e61f5","observation_id":"ee202403-8be4-410d-aa55-a0fe69b11eba","resolution":{"observed_at":"2026-08-07T15:10:21.021049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10412","last_updated":"2024-06-06T18:33:02Z","snapshot_observed_at":"2026-08-16T14:18:07.336985Z","submitted_at":"2024-02-16T02:32:06Z","title":"Measuring and Reducing LLM Hallucination without Gold-Standard Answers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10412","snapshot_observed_at":"2026-08-07T15:10:21.033271Z","title":"Measuring and reducing llm hallucination without gold-standard answers.arXiv preprint arXiv:2402.10412, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.033271Z"},"links":{"cited_paper":"/paper/2402.10412","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:ffe0c474e109cf1e08b2ac6029c4853dfb14e74a437543ca35a8728f14cd8d47","observation_id":"882da276-877c-4230-8329-583e317e64c8","resolution":{"observed_at":"2026-08-07T15:10:21.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14741","last_updated":"2024-10-06T10:55:23Z","snapshot_observed_at":"2026-08-16T13:58:39.733693Z","submitted_at":"2024-04-23T04:47:22Z","title":"Generate-on-Graph: Treat LLM as both Agent and KG in Incomplete Knowledge Graph Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14741","snapshot_observed_at":"2026-08-07T15:10:21.043894Z","title":"Generate-on-graph: Treat llm as both agent and kg in incomplete knowledge graph question answering.arXiv preprint arXiv:2404.14741, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.043894Z"},"links":{"cited_paper":"/paper/2404.14741","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:7f1c8daac44b1d88a93653f70b28bfb7eb251d4465fd3abc605311d6a27b8ea9","observation_id":"a3fa1203-58fb-4250-8f7a-2351f2c302e5","resolution":{"observed_at":"2026-08-07T15:10:21.043894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08066","last_updated":"2025-04-10T18:44:41Z","snapshot_observed_at":"2026-08-10T03:18:36.275195Z","submitted_at":"2025-04-10T18:44:41Z","title":"The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08066","snapshot_observed_at":"2026-08-07T15:10:21.055953Z","title":"The ai scientist-v2: Workshop-level automated scientific discovery via agentic tree search.arXiv preprint arXiv:2504.08066, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.055953Z"},"links":{"cited_paper":"/paper/2504.08066","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:06154a95aa0e309dd5d83d69fda07cb14e8b59f8849c58affb192381882bdbef","observation_id":"0a166818-bfdd-4da6-9091-d13638846a20","resolution":{"observed_at":"2026-08-07T15:10:21.055953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:10:21.069062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.069062Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:e99bcf9b2331b4ef5d003d2a639a68a5891ac43aba49c3a1482ba826c4ecb3f0","observation_id":"b950559e-db08-45cb-9739-4e1e6c3a1833","resolution":{"observed_at":"2026-08-07T15:10:21.069062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:21.082662Z","title":"Moose-chem: Large language models for rediscovering unseen chemistry scientific hypotheses.arXiv preprint arXiv:2410.07076, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.082662Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:3a71b3e26205251c1da9476d9ef81560d7d0fe87ca0a86f35de70b2d6140ed88","observation_id":"066a04ea-38ca-43f4-b377-dab3c81ac489","resolution":{"observed_at":"2026-08-07T15:10:21.082662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06201","last_updated":"2024-03-27T06:31:42Z","snapshot_observed_at":"2026-08-16T14:28:11.216133Z","submitted_at":"2024-01-11T15:45:11Z","title":"EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06201","snapshot_observed_at":"2026-08-07T15:10:21.090064Z","title":"Easytool: Enhancing llm-based agents with concise tool instruction.arXiv preprint arXiv:2401.06201, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.090064Z"},"links":{"cited_paper":"/paper/2401.06201","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:f6a7e35e15a3417bcd650bd30e4e3af467ef6807625489c98a7c93a5eac7b592","observation_id":"f19a0ba4-1cee-4e09-b7f4-adc0898306ea","resolution":{"observed_at":"2026-08-07T15:10:21.090064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06852","last_updated":"2024-04-25T14:34:28Z","snapshot_observed_at":"2026-08-16T14:19:43.618677Z","submitted_at":"2024-02-10T01:11:59Z","title":"ChemLLM: A Chemical Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06852","snapshot_observed_at":"2026-08-07T15:10:21.095513Z","title":"Chemllm: A chemical large language model.arXiv preprint arXiv:2402.06852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.095513Z"},"links":{"cited_paper":"/paper/2402.06852","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:4aa0afb49404062efe7d9bdcb5aab977f143f44704eadd5e1b99e6f7f972f454","observation_id":"e5745806-da5d-4446-a65c-17f1f2f9bb1a","resolution":{"observed_at":"2026-08-07T15:10:21.095513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00305","last_updated":"2023-09-30T08:33:04Z","snapshot_observed_at":"2026-08-21T04:23:42.132601Z","submitted_at":"2023-09-30T08:33:04Z","title":"Towards LLM-based Fact Verification on News Claims with a Hierarchical Step-by-Step Prompting Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00305","snapshot_observed_at":"2026-08-07T15:10:21.101708Z","title":"Towards llm-based fact verification on news claims with a hierarchi- cal step-by-step prompting method.arXiv preprint arXiv:2310.00305, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.101708Z"},"links":{"cited_paper":"/paper/2310.00305","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:d5ebad6cc903c300ba7eb47d6ae36da133b9eb225c5baa085d0f2796ae0d6a9b","observation_id":"315d0c97-3918-4b71-8097-c69c1a985ad6","resolution":{"observed_at":"2026-08-07T15:10:21.101708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07930","last_updated":"2023-07-16T03:03:59Z","snapshot_observed_at":"2026-08-16T15:15:57.855162Z","submitted_at":"2023-07-16T03:03:59Z","title":"GeoGPT: Understanding and Processing Geospatial Tasks through An Autonomous GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07930","snapshot_observed_at":"2026-08-07T15:10:21.111443Z","title":"earth\" as a positive keyword, astronomy-related papers may incorrectly appear relevant. To address this, we introduce","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.111443Z"},"links":{"cited_paper":"/paper/2307.07930","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:79c1c9fe096e13392c3e87598d335903e1b8ed38c747c734e0266511794be440","observation_id":"de14b375-f8d0-4057-97a3-1c5fa38b8394","resolution":{"observed_at":"2026-08-07T15:10:21.111443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2505.17139."}