{"as_of":"2026-08-16T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:147a54001a6d71ce64cd8eea5b95fed9d0c7e367eeaabccebb8d92ab1ced0e9a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:08:27.681538Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T07:36:16.071678Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"cited_work":{"arxiv_id":"2504.16414","doi":"10.48550/arxiv.2504.16414","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16414","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating multi-hop reasoning in large language models: A chemistry-centric case study","venue":"arXiv (Cornell University)","work_id":"9de53312-1ec7-43ed-b79f-961b565e6939","year":2025},"citing_paper":{"arxiv_id":"2601.19827","last_updated":"2026-07-31T16:53:04Z","snapshot_observed_at":"2026-08-16T16:17:09.827149Z","submitted_at":"2026-01-27T17:35:05Z","title":"When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.987672Z"},"links":{"cited_paper":"/paper/2504.16414","citing_paper":"/paper/2601.19827"},"observation_digest":"sha256:dd38f648709902cb194a642b3990aea017a7961184a91971b1f57ee89e3ab098","observation_id":"21c4f34c-9e8a-4df6-9b7f-669d779d9684","resolution":{"observed_at":"2026-05-16T10:32:44.995439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16414","snapshot_observed_at":"2026-08-03T07:36:16.071678Z","title":"Evaluating multi-hop reasoning in large language models: A chemistry-centric case study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.19827","last_updated":"2026-07-31T16:53:04Z","snapshot_observed_at":"2026-08-16T16:17:09.827149Z","submitted_at":"2026-01-27T17:35:05Z","title":"When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T07:36:16.071678Z"},"links":{"cited_paper":"/paper/2504.16414","citing_paper":"/paper/2601.19827"},"observation_digest":"sha256:ffdd6a474d7ce806652ff0d6f9ef5bf62e0800d6a8c473fa551b05fc9fe79a26","observation_id":"1693f0ed-7475-441d-9649-716484bb71d1","resolution":{"observed_at":"2026-08-03T07:36:16.071678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"cited_work":{"arxiv_id":"2504.16414","doi":"10.48550/arxiv.2504.16414","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16414","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating multi-hop reasoning in large language models: A chemistry-centric case study","venue":"arXiv (Cornell University)","work_id":"9de53312-1ec7-43ed-b79f-961b565e6939","year":2025},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-08-10T19:13:02Z","snapshot_observed_at":"2026-08-14T23:09:31.705348Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2504.16414","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:173794c811b1c97ce9280d4dd25ce639e976f15e76c2acc48bf72327e9dee997","observation_id":"03480b6e-f309-4b1a-ab25-7a48a7342950","resolution":{"observed_at":"2026-06-27T13:00:55.949775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16414/citation-record","integrity":"/paper/2504.16414/integrity","json":"/paper/2504.16414/citation-record.json","paper":"/paper/2504.16414"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.033380Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.033380Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:24731e8dcd0f81885d58965f2df1221e97b7bf5bc85f2482f0e84cfb36eba581","observation_id":"5c5e6c69-650d-4882-aaa5-87e6b52bbe80","resolution":{"observed_at":"2026-08-16T11:08:27.033380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-16T11:08:27.041280Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.041280Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:ecc84b8eb30ae63525a812f68f177152c31a33b0589411e595e0e83fb42f9b40","observation_id":"786957e3-11ee-4bd9-8cf6-b17ab453974b","resolution":{"observed_at":"2026-08-16T11:08:27.041280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.047544Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.047544Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:ecbe954d668c1d533343ba2015f9934b508badd8adfcb77f1bf9aac704a64ad8","observation_id":"944effd2-5832-4a98-a42d-1168409c548c","resolution":{"observed_at":"2026-08-16T11:08:27.047544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:30.565733Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"eb1d46f8-e1d9-4df3-a307-bf48a788058f","year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.055284Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:c080410d98927c167dc00f8a06369fc4401b6dbc9126d1a5508d31c5a81b53d1","observation_id":"32f29f2b-c9a0-4b7c-921d-153931ba86ab","resolution":{"observed_at":"2026-08-16T11:08:30.694755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04682","last_updated":"2025-01-08T18:42:48Z","snapshot_observed_at":"2026-08-10T21:24:31.639820Z","submitted_at":"2025-01-08T18:42:48Z","title":"Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04682","snapshot_observed_at":"2026-08-16T11:08:27.062988Z","title":"Towards system 2 reasoning in llms: Learning how to think with meta chain-of-though","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.062988Z"},"links":{"cited_paper":"/paper/2501.04682","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:56906781f97cd530201f13bcbfbd94b361e06e7155786e09a4fa13b4a14f4b4a","observation_id":"13d59eb0-efc0-4df1-b3e2-b9aa560dd2f3","resolution":{"observed_at":"2026-08-16T11:08:27.062988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.078801Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.078801Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:3a80d5da6629c6017836d5da9e97e6564b6a6f899fd308e986f35cc1abaca2b3","observation_id":"a7b19a6c-a234-4bdc-ae53-5b648bc62361","resolution":{"observed_at":"2026-08-16T11:08:27.078801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:30.421319Z","title":"Neurosymbolic ai: the 3rd wave","venue":null,"work_id":"3f7642b4-b155-4309-bcb9-a95351dfc32d","year":2012},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.086596Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:05b2530ff210061b8e9c460f6b95c75f4221a79c6b727c5eb6c978a1824fefa2","observation_id":"e6a74663-37b9-4855-9319-3a2c3aa1ec46","resolution":{"observed_at":"2026-08-16T11:08:30.453558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.093328Z","title":"A simple neural network module for relational reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.093328Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:03be56d8caf5c436e41da993a0b627e60f1feb345dfa1a3c8b2f311a0d4250c2","observation_id":"9d08a5c9-624c-448b-99f9-32434f31f4a2","resolution":{"observed_at":"2026-08-16T11:08:27.093328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:30.274349Z","title":"Openai o1 system card, 2024","venue":null,"work_id":"9dcebbcf-f484-4359-aaf9-246982bcbcc2","year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.101824Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:40319e5b42f72762cda96a266dbd8d17490e010ea58c765f6b8ee93647ef3875","observation_id":"97572626-9b5c-4b01-8063-0926d91a566f","resolution":{"observed_at":"2026-08-16T11:08:30.352691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:30.207904Z","title":"Openai o3 mini system card, 2024","venue":null,"work_id":"40349e59-5d7c-47c4-890b-3626ed4cf2fc","year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.111018Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:15d7d195ef42010f50a3c1185d5ae592d73e3a409b4e8153737b825bb184d4b6","observation_id":"6cc56a61-3388-4dce-a4a6-828a2c935406","resolution":{"observed_at":"2026-08-16T11:08:30.256718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.118353Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.118353Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:20647f94c2509f8d3921c2cc8c18054fd9184c6b749f303f0331b4fe67304872","observation_id":"66bfd8a0-6bde-405b-a898-8e781124fff6","resolution":{"observed_at":"2026-08-16T11:08:27.118353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:08:27.125584Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.125584Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:4d3addee05f1b1eff787ebfa7d36ed4c86b748dc8c140d98a56813447c4d10c5","observation_id":"3fa5a002-6426-4f1f-831d-0a6aaf77bba8","resolution":{"observed_at":"2026-08-16T11:08:27.125584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03671","last_updated":"2025-05-28T05:08:18Z","snapshot_observed_at":"2026-08-13T22:18:26.874624Z","submitted_at":"2025-02-05T23:31:39Z","title":"Advancing Reasoning in Large Language Models: Promising Methods and Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03671","snapshot_observed_at":"2026-08-16T11:08:27.135194Z","title":"Advancing reasoning in large language models: Promising methods and approaches","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.135194Z"},"links":{"cited_paper":"/paper/2502.03671","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:88fc59691ce2cb4b20ab98e6eb7ec05eceb61d9bc2012e6dfa71254210e883be","observation_id":"29e29159-c387-401a-ac6e-a105ab72a4c6","resolution":{"observed_at":"2026-08-16T11:08:27.135194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:08:27.145988Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.145988Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:4285164f2d8881b4ed916bef32160d091a4a6c2d4d5705cf4d0a6dad4445b3bc","observation_id":"b230e105-f40e-4ff2-841c-8136172dd967","resolution":{"observed_at":"2026-08-16T11:08:27.145988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T11:08:27.152376Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.152376Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:69294d4460c1660d572a80cf205cdce2ceffb5d343821abaadd78bdf7eda3f28","observation_id":"24e21779-dfdd-4895-b1b4-90719cd3759b","resolution":{"observed_at":"2026-08-16T11:08:27.152376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T11:08:27.160516Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.160516Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:f7cff76eaacf8010ed8407288c088e60f253751d0c58dde71a139022624af0d7","observation_id":"82536658-847e-4cb7-b819-fb84870c44b8","resolution":{"observed_at":"2026-08-16T11:08:27.160516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-16T11:08:27.165982Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.165982Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:c1e4dc682d7f061e38a5ffd964d3dc8194539a5214fb64f9ed97791312f031eb","observation_id":"9204ca91-0a5e-4a88-8c70-8adb6cb214de","resolution":{"observed_at":"2026-08-16T11:08:27.165982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-16T11:08:27.176304Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.176304Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:42baff14bb6ed19a479cafd3a3ae1eadf950f72130c86cd88feb532361878ce2","observation_id":"bf725a04-e15f-44d4-a024-f57cc3f71d37","resolution":{"observed_at":"2026-08-16T11:08:27.176304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-11T10:35:06.989614Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-16T11:08:27.183147Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.183147Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:d94b2e56bf809fa9d49c2b2232265cfaab9ab059686cc122017a61911024982c","observation_id":"740f52cd-73f3-4f59-a006-42bdbc301f89","resolution":{"observed_at":"2026-08-16T11:08:27.183147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.198025Z","title":"Did aristotle use a laptop? a question answering benchmark with implicit reasoning strategies","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.198025Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:a928275cdb9c9327af31c5171e6322837b2c28d525a4cdee0e39599fc92d35fa","observation_id":"3a88ce35-5293-4571-ab1c-c47953128198","resolution":{"observed_at":"2026-08-16T11:08:27.198025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:30.071647Z","title":"Chemlit-qa: A human evaluated dataset for chemistry rag tasks","venue":null,"work_id":"188aef01-f96f-45e7-ba3e-b989e2f6e032","year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.205317Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:b1ca9ddfe96458a2dacd4719fac1490399cc729d47717d9f0cefd519bb179146","observation_id":"06b0d660-6999-4e5d-bc64-5b22630fae49","resolution":{"observed_at":"2026-08-16T11:08:30.156864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16772","last_updated":"2024-06-26T15:00:04Z","snapshot_observed_at":"2026-08-16T13:40:03.753824Z","submitted_at":"2024-06-24T16:31:12Z","title":"OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16772","snapshot_observed_at":"2026-08-16T11:08:27.211322Z","title":"Olympicarena medal ranks: Who is the most intelligent ai so far? arXiv preprint arXiv:2406.16772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.211322Z"},"links":{"cited_paper":"/paper/2406.16772","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:623f6b58c1ff105e3df067c319596201d37286c40a1e08923055dfd5d144cdd2","observation_id":"e907d867-c733-4885-97e2-288143e5a7a0","resolution":{"observed_at":"2026-08-16T11:08:27.211322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.228224Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.228224Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:9b48d4975491139c132a1c434a2b960b7af2d343ffc2d1d2ab8024f22f2b0532","observation_id":"d7f7b64c-6296-4cbc-bb26-b4ab59c56f40","resolution":{"observed_at":"2026-08-16T11:08:27.228224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.929462Z","title":"Large language models for reticular chemistry","venue":null,"work_id":"97e98dac-3535-4d92-9042-1603eb678040","year":2025},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.234683Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:a85260abfde560a439334352bb4d7da39121690541c6fed5afc99e35481b525e","observation_id":"e8236d33-6d50-4e29-9cec-efee71ba2911","resolution":{"observed_at":"2026-08-16T11:08:30.002936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.900089Z","title":"Multi-hop question answering.Foundations and Trends® in Information Retrieval, 17(5):457–586, 2024","venue":null,"work_id":"e941953c-b5da-4ec8-8149-c1d92b651cf6","year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.241942Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:d6f5158ed0a7e1e9b099c248db70612a0c334fe4f431232a99b96a1328c6e965","observation_id":"36a26e47-c694-4748-9e8d-ca759c55071e","resolution":{"observed_at":"2026-08-16T11:08:29.907012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.776630Z","title":"Constructing datasets for multi-hop reading comprehension across documents","venue":null,"work_id":"225bd7e4-180f-468e-a18b-a45a29bb8172","year":2018},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.249274Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:64bd9bd7bfa4564e8c725512abba027297c6b837352c8d7b5f45a5c6736e9737","observation_id":"b5031814-288e-4a46-a47c-b1f0504b416d","resolution":{"observed_at":"2026-08-16T11:08:29.862076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.255231Z","title":"Musique: Multihop questions via single-hop question composition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.255231Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:a13a4b835cab1a9af47b7e83710a8990d5cf6c62d1fb35d698cd965f4fb42707","observation_id":"9d0f70dd-d8b9-4988-9160-e4680425be07","resolution":{"observed_at":"2026-08-16T11:08:27.255231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15391","last_updated":"2024-01-27T11:41:48Z","snapshot_observed_at":"2026-08-13T01:06:03.395715Z","submitted_at":"2024-01-27T11:41:48Z","title":"MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15391","snapshot_observed_at":"2026-08-16T11:08:27.261607Z","title":"Multihop-rag: Benchmarking retrieval-augmented generation for multi-hop queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.261607Z"},"links":{"cited_paper":"/paper/2401.15391","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:d4b34717d3845ec940c61953df5f8c836b12d339c6c9499efb2c4d7068dbf052","observation_id":"dbc7d224-0086-49fc-94a0-00d046a57c52","resolution":{"observed_at":"2026-08-16T11:08:27.261607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.627910Z","title":"A framework for evaluating the chemical knowledge and reasoning abilities of large language models against the expertise of chemists","venue":null,"work_id":"f35572b4-55e3-4c00-bf9b-da12208d674b","year":2025},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.269213Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:5f238a6622a53403db8eb9c5fdd20ac6cbbe4277f170b9b6bd1c2249c41468cd","observation_id":"3e491458-4e77-48f0-840e-19e2a3c7e46a","resolution":{"observed_at":"2026-08-16T11:08:29.702468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10511","last_updated":"2022-11-18T21:27:13Z","snapshot_observed_at":"2026-08-16T16:14:59.008404Z","submitted_at":"2022-11-18T21:27:13Z","title":"Knowledge Graph Generation From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10511","snapshot_observed_at":"2026-08-16T11:08:27.275286Z","title":"Knowledge graph generation from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.275286Z"},"links":{"cited_paper":"/paper/2211.10511","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:5b1ce5a5168ab806c6c9e7e0559fbca662122ecaedcb80f28c0eb6fd02f29ad7","observation_id":"8ccf9fa0-2b60-46a4-ae87-028672acace6","resolution":{"observed_at":"2026-08-16T11:08:27.275286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03868","last_updated":"2024-10-02T05:51:53Z","snapshot_observed_at":"2026-08-16T14:03:28.087003Z","submitted_at":"2024-04-05T02:53:51Z","title":"Extract, Define, Canonicalize: An LLM-based Framework for Knowledge Graph Construction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03868","snapshot_observed_at":"2026-08-16T11:08:27.280841Z","title":"Extract, define, canonicalize: An llm-based framework for knowledge graph construction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.280841Z"},"links":{"cited_paper":"/paper/2404.03868","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:a052865aff653e208c3083bc7a2cd1a246ad2be0c455017463e29e9531772e78","observation_id":"52d9b364-0a8c-4870-afbd-052a4e0e89e6","resolution":{"observed_at":"2026-08-16T11:08:27.280841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05682","last_updated":"2018-10-12T19:01:32Z","snapshot_observed_at":"2026-08-14T18:15:27.393198Z","submitted_at":"2018-10-12T19:01:32Z","title":"Building Dynamic Knowledge Graphs from Text using Machine Reading Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05682","snapshot_observed_at":"2026-08-16T11:08:27.287652Z","title":"Building dynamic knowledge graphs from text using machine reading comprehension","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.287652Z"},"links":{"cited_paper":"/paper/1810.05682","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:8193cd69de07047269526461d9d0dbf2d977be5e268f34de0c78757ae9ae35bd","observation_id":"0c10439b-070b-4430-866b-dc528a1dd822","resolution":{"observed_at":"2026-08-16T11:08:27.287652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21708","last_updated":"2024-07-31T15:56:06Z","snapshot_observed_at":"2026-08-16T13:29:29.891560Z","submitted_at":"2024-07-31T15:56:06Z","title":"CEAR: Automatic construction of a knowledge graph of chemical entities and roles from scientific literature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21708","snapshot_observed_at":"2026-08-16T11:08:27.295596Z","title":"Cear: Automatic construction of a knowledge graph of chemical entities and roles from scientific literature","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.295596Z"},"links":{"cited_paper":"/paper/2407.21708","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:0781914806be64ac9077152630fc32dba51cc22ed6ff32ae275cde5b5700be3b","observation_id":"ba8d481d-d409-4b24-8b71-6407539fcf87","resolution":{"observed_at":"2026-08-16T11:08:27.295596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.607339Z","title":"Coarse-to-fine knowledge graph domain adaptation based on distantly-supervised iterative training","venue":null,"work_id":"b87f636a-e53d-4354-98f8-c423d30ab7e1","year":2023},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.301310Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:885b80d3f8d372e8cb9266ed2ee8405ef677f30395403f7c91eb8bc002ee86d3","observation_id":"a1ac075f-247c-4ed7-bd18-ba773281e3b5","resolution":{"observed_at":"2026-08-16T11:08:29.614194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.421744Z","title":"Nilinker: attention-based approach to nil entity linking","venue":null,"work_id":"437bfc03-6332-4324-bfbc-21e72c2687f4","year":2022},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.307601Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:1d51ea24e62ab062caa80ba917de754f53166b9f6693907c7960735f0b003d25","observation_id":"5576a2ae-05d5-4cc1-b051-9616aaf09c2f","resolution":{"observed_at":"2026-08-16T11:08:29.537106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:27.313344Z","title":"Domain-specific language model pretraining for biomedical natural language processing, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.313344Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:167bc9923106ecc2618e74da443b6f0b39feac691826150698b4a8116652a066","observation_id":"da72f682-ae47-4430-aec0-92ac7fb792b6","resolution":{"observed_at":"2026-08-16T11:08:27.313344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.360813Z","title":"Pubchem in 2021: new data content and improved web interfaces","venue":null,"work_id":"af956406-1017-4823-a0b3-e9c3bc8c5cd1","year":2021},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.318415Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:d60b69c8b023af20ce8c8cabe1142e3b5a0ab5defaa10178d2c3953dc8d5d000","observation_id":"7fb675f9-8468-4f99-8af4-6e5a5aa47793","resolution":{"observed_at":"2026-08-16T11:08:29.372348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14891","last_updated":"2024-09-16T17:15:52Z","snapshot_observed_at":"2026-08-16T13:40:51.478593Z","submitted_at":"2024-06-21T06:26:38Z","title":"Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14891","snapshot_observed_at":"2026-08-16T11:08:27.323673Z","title":"Generate-then-ground in retrieval-augmented generation for multi-hop question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.323673Z"},"links":{"cited_paper":"/paper/2406.14891","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:5a2214c938203e94d057252a44fb5a3bd4209c1ab743d4d407328bde78f8315d","observation_id":"2436015d-32bf-4163-bba8-422f32711f77","resolution":{"observed_at":"2026-08-16T11:08:27.323673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11875","last_updated":"2024-08-20T09:29:31Z","snapshot_observed_at":"2026-08-16T13:25:17.140545Z","submitted_at":"2024-08-20T09:29:31Z","title":"Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11875","snapshot_observed_at":"2026-08-16T11:08:27.341341Z","title":"Hierarchical retrieval-augmented generation model with rethink for multi-hop question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.341341Z"},"links":{"cited_paper":"/paper/2408.11875","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:65bb1674a47399d7760eae8f8e398b6d53c5a5242131a63cf3d82e79c3db9d08","observation_id":"32c19761-3314-44f5-9941-174a5c16880e","resolution":{"observed_at":"2026-08-16T11:08:27.341341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12442","last_updated":"2025-05-26T03:17:07Z","snapshot_observed_at":"2026-08-16T17:16:23.196808Z","submitted_at":"2025-02-18T02:24:42Z","title":"HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12442","snapshot_observed_at":"2026-08-16T11:08:27.361060Z","title":"MeOH\" to","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.361060Z"},"links":{"cited_paper":"/paper/2502.12442","citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:3a8f72527e6aa17a4837e52617069d86aa326d9d4e6eef4c20e8faeb5513fc27","observation_id":"421bf404-e7fa-49fc-851e-293c94ef9bd2","resolution":{"observed_at":"2026-08-16T11:08:27.361060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.193903Z","title":"If an entity appears in the text but has no meaningful chemical relationship with another entity in the set, ignore it","venue":null,"work_id":"0b747da4-9d9f-4c0a-825a-4ccd66744809","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.379975Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:0b1d19a9c1c3bbc9cbf5568f29832ad330f462b035ccc11c4bf5b531b3440a47","observation_id":"a1a2e9e7-84bb-4fd1-993c-d390a5c8f5d1","resolution":{"observed_at":"2026-08-16T11:08:29.292668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.169707Z","title":"reacts with,","venue":null,"work_id":"90545697-5856-480f-aaa9-3e986e3ccf6e","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.385205Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:cdb7ebc6f5268b69553f1a8762e3ab7e7781d0468b0ad1f6770623e695f3e212","observation_id":"f1c16554-379c-4678-a088-4ba9c7626a5b","resolution":{"observed_at":"2026-08-16T11:08:29.177310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.030972Z","title":"Avoid observations, opinions, and findings","venue":null,"work_id":"d4b457be-ae7b-46f8-97d1-6db7ddf4cc7d","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.391936Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:f65257aec85cfe94a7d7f600a52264b68fc0f36c8646ff8dabc8c8a247964f4c","observation_id":"798ee359-8162-46fb-bcad-67cfede7a0ae","resolution":{"observed_at":"2026-08-16T11:08:29.133824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:29.007814Z","title":null,"venue":null,"work_id":"ab4e27fa-590a-4800-8337-651ec5a51adb","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.413495Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:6f23af1518d3623549c8087bb37f48523427a56b2c8755b080ede777be782787","observation_id":"43c2180b-0fd6-48b7-b3cf-fe615e51a8b6","resolution":{"observed_at":"2026-08-16T11:08:29.013438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.844426Z","title":"is,\" \"are,","venue":null,"work_id":"047f9d2c-f1dd-496e-b4ea-637ae9f34bf6","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.457183Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:3a83237086f12b0c407d1dd4305b3ecd829211c94517a8fffe605e28c403a7b0","observation_id":"ce6a1cbe-346f-4bc0-b870-e256db6e8ae0","resolution":{"observed_at":"2026-08-16T11:08:28.936126Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.790722Z","title":null,"venue":null,"work_id":"2596b8fc-e4d8-45c4-b5e9-79f5f37645b1","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.464119Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:4e3f64a47e4269d7c8ff101ae3ceda984d823cd2f72103dadec07ee4386929c7","observation_id":"92e7b5b1-7d25-4811-bb54-ede837e6e937","resolution":{"observed_at":"2026-08-16T11:08:28.830681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.674185Z","title":null,"venue":null,"work_id":"06f6c515-04b7-4c9c-998e-8f0127ae996e","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.469176Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:08433e13da3abd108b735b13fba667a117a28c418ea5a0b86f27eca4a6b62a4a","observation_id":"2399d8b1-ad29-420e-9761-98510f168c3a","resolution":{"observed_at":"2026-08-16T11:08:28.737345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.575926Z","title":null,"venue":null,"work_id":"80c9a8ac-fd0c-4d34-9476-a4f4e8ab0fd9","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.474935Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:174250c677c9741a268d53213aebbcb34d9121c6784e044680dcd654d28ec115","observation_id":"cc2f68e7-ea64-42c1-a70d-759ebd42b168","resolution":{"observed_at":"2026-08-16T11:08:28.625815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.481038Z","title":"Path (multi-hop chain of reasoning): carbon dioxide → formic acid → carbonylation reactions * Source 1 and source 2 are coming from different documents","venue":null,"work_id":"114ba557-97b5-4d31-b256-0fbd5f5d90e9","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.480439Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:3f5aa9e5aa8c854a69b8bf0cda9928e4e43163c09a7fefd2ec1e37f9d3e6acd6","observation_id":"553dea26-92c7-4f1a-b04b-e8b0689bdf64","resolution":{"observed_at":"2026-08-16T11:08:28.560799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.459245Z","title":null,"venue":null,"work_id":"c36c12df-5c8b-448d-bac1-d748089b7643","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.565772Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:7251de8ba0fce3fa143bcae007bd6b23a14d1f61523dfb3b30e67e1e2ea4d268","observation_id":"243384e8-1122-4e3f-a7ae-2c24014fd39b","resolution":{"observed_at":"2026-08-16T11:08:28.465748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.353159Z","title":null,"venue":null,"work_id":"da1c80fa-6181-43a0-b89f-ca3371b69492","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.645073Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:3cc3f97a2165beec9add5934c3524e289e1fb5faa90efa651f6e05ecef5de46c","observation_id":"034087ee-1c86-4b52-985c-2fd3ea838638","resolution":{"observed_at":"2026-08-16T11:08:28.390841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.335328Z","title":null,"venue":null,"work_id":"c854109b-34c8-44fa-8ba3-59e57a04dc12","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.676452Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:8ad7b84e80d2a826b025e4ede2a2216f4deb4e81f2e015571d8e02071e2d1735","observation_id":"178c6e3d-e52b-4415-a339-25f1f22d0379","resolution":{"observed_at":"2026-08-16T11:08:28.340057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:28.262616Z","title":"Path (multi-hop chain of reasoning): solution → graphene → membranes→ nitrogen→ Cr3(Cr4Cl)3(BTT)82 *Sources 1–4 are extracted from four different documents","venue":null,"work_id":"ea9ef530-00d9-469a-bfc9-b91e85589ddd","year":null},"citing_paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:27.681538Z"},"links":{"citing_paper":"/paper/2504.16414"},"observation_digest":"sha256:346c0ea8f8ea6dd690ea54b7ce9a6d2bcc7820fd97fc451fb0364d4fc84bc12b","observation_id":"6a04d0a5-cf6c-430a-ae55-36855dfef0b2","resolution":{"observed_at":"2026-08-16T11:08:28.270081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16414","last_updated":"2025-08-06T11:20:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T17:16:29.664799Z","submitted_at":"2025-04-23T04:36:19Z","title":"Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 3 inbound Pith citation observations for arXiv:2504.16414."}