{"as_of":"2026-08-11T00:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec4778cf2382c74172ee92741a7107ffb6bd111527c04292f330ecdc1dd6cac6","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:30:31.148470Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13300/citation-record","integrity":"/paper/2507.13300/integrity","json":"/paper/2507.13300/citation-record.json","paper":"/paper/2507.13300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.863012Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.863012Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:32878947250953c69d3f709cd73caad5a27424428cd3dda8c3a4e8755cb2c780","observation_id":"a639b420-0009-4b18-9092-cfeb21672a31","resolution":{"observed_at":"2026-08-06T16:30:30.863012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.867039Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.867039Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:1858c6cf62d71059238210a82974d89e3777232f97ba3efd191a6667d83e3538","observation_id":"f011d55d-8f72-4317-aec8-67d9cde1df15","resolution":{"observed_at":"2026-08-06T16:30:30.867039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01788","last_updated":"2025-03-21T14:49:10Z","snapshot_observed_at":"2026-08-08T03:04:39.404837Z","submitted_at":"2024-02-02T02:41:28Z","title":"LitLLM: A Toolkit for Scientific Literature Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01788","snapshot_observed_at":"2026-08-06T16:30:30.874417Z","title":"Laradji, Laurent Charlin, and Christopher Pal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.874417Z"},"links":{"cited_paper":"/paper/2402.01788","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:fe5f9abb52d7b694cb8f0342d4b6a04aa0eccb68b9ef364a329f13423b110b52","observation_id":"f62fbbe1-67c3-4ba0-9888-9dbece2476eb","resolution":{"observed_at":"2026-08-06T16:30:30.874417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T16:30:30.878617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.878617Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:e9b47fc578d6e808e064596a12100a42146cd5247d07fc579ed477724c5509ba","observation_id":"1e0f122c-bade-4270-9f43-b2e7b4882fb0","resolution":{"observed_at":"2026-08-06T16:30:30.878617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.882304Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.882304Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:35862a7aa8d5e28869ddfc72949537ca50d8ecdf1311d24bed20c39d8287c418","observation_id":"c5f3c8dd-ddfc-4b47-9730-c0127cfe2a50","resolution":{"observed_at":"2026-08-06T16:30:30.882304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.885445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.885445Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:50eef09cf3bae5a486c1588d25dd0baedb932eb6be69cd4f171c1d4357f306f5","observation_id":"a99d8233-c32a-458a-a8d9-a266c4f16682","resolution":{"observed_at":"2026-08-06T16:30:30.885445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01903","last_updated":"2025-08-05T16:19:40Z","snapshot_observed_at":"2026-08-08T04:30:09.801268Z","submitted_at":"2025-07-02T17:19:20Z","title":"AI4Research: A Survey of Artificial Intelligence for Scientific Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01903","snapshot_observed_at":"2026-08-06T16:30:30.888470Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.888470Z"},"links":{"cited_paper":"/paper/2507.01903","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:8a8578708b85eeac88e2cd2870fe09f1d0fd75193f070904eb5fc5a14f89142a","observation_id":"4300e2b8-afb0-47d2-9086-758216bafeca","resolution":{"observed_at":"2026-08-06T16:30:30.888470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.891644Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.891644Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:cc36c7cea9c43718363e84a3ea61ee8864dfc292263e3de198af5d9654b8de56","observation_id":"806d738b-fb99-454e-b8b4-287598e09d3c","resolution":{"observed_at":"2026-08-06T16:30:30.891644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04259","last_updated":"2024-01-08T22:24:17Z","snapshot_observed_at":"2026-08-07T22:46:31.467173Z","submitted_at":"2024-01-08T22:24:17Z","title":"MARG: Multi-Agent Review Generation for Scientific Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04259","snapshot_observed_at":"2026-08-06T16:30:30.895146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.895146Z"},"links":{"cited_paper":"/paper/2401.04259","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:91c4859073281cf174bbf63882093c2ba61b0e7b70a5aa93ace1d522a9c7a234","observation_id":"2d8c2b77-5c02-4ba8-a27f-920a0e0d3738","resolution":{"observed_at":"2026-08-06T16:30:30.895146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.997967Z","title":"Smith, and Matt Gardner","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.997967Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:40050a697bdae46ab93d9823862183c88d4b73ead510d3b6c05f65930f1bdc97","observation_id":"c7fc8dbc-2a70-4e48-b4b7-58745b49fab2","resolution":{"observed_at":"2026-08-06T16:30:30.997967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T16:30:31.001582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.001582Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:f253e4d1ded68daa6c9af67c5ce446627387f30c9976b7a089dca077315d6332","observation_id":"9193c18d-bee3-486d-9062-18ffdb7b4672","resolution":{"observed_at":"2026-08-06T16:30:31.001582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:30:31.005307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.005307Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:16c6961717420fb6d95dc9abc5bdf2d7d2c2541001575c9a3fdc064da17f3269","observation_id":"7417691f-2df2-4db1-a102-e9ec3e23dcbc","resolution":{"observed_at":"2026-08-06T16:30:31.005307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16253","last_updated":"2024-10-03T02:57:49Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-24T01:30:22Z","title":"LLMs Assist NLP Researchers: Critique Paper (Meta-)Reviewing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16253","snapshot_observed_at":"2026-08-06T16:30:31.008892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.008892Z"},"links":{"cited_paper":"/paper/2406.16253","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c38d0811187f349ec059336a90e9e9bd3c6d32673ef97aaca694245a22a0a4e5","observation_id":"1ee6742d-998c-47f2-9df6-b13f388f3c8d","resolution":{"observed_at":"2026-08-06T16:30:31.008892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.012316Z","title":"Fabbri, Wojciech Kry \\'s ci \\'n ski, Bryan McCann, Caiming Xiong, Richard Socher, and Dragomir Radev","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.012316Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:472ee9be986e7a70f56cb40760e8fc2b0f9293b15bac78397715c44ad23d3609","observation_id":"437f1899-b34d-40ac-b34b-7e818cbf294b","resolution":{"observed_at":"2026-08-06T16:30:31.012316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.818705Z","title":"Sengamedu, and Christos Faloutsos","venue":null,"work_id":"49ffbbcf-986f-480c-abf3-e6ccaf5b1056","year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.015875Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:8d7ce6e09c65b1b6c271bbd708c00e4c41c676174441de28236053c08b197016","observation_id":"083ce5ba-32b1-41d0-ba6a-70f0f2857533","resolution":{"observed_at":"2026-08-06T16:30:31.822196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T16:30:31.019280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.019280Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:bfec7104e1c418bd122a1e8640de301652794158f7fe8ff0d5b0434481096162","observation_id":"5d8e6790-81d9-416a-a3a5-397944bb2b61","resolution":{"observed_at":"2026-08-06T16:30:31.019280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T16:30:31.022702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.022702Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:3da7f9c0f6996fbbce76f63d5192000e656f947d3671411b0cfb3a82e646fb7a","observation_id":"5bff5dd6-063f-4307-b1f1-4df0fd3d6c46","resolution":{"observed_at":"2026-08-06T16:30:31.022702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.807075Z","title":null,"venue":null,"work_id":"5c905b06-51fa-42a0-869b-903548b0dbed","year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.026139Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:b241c37810237d163e130b980a47b907118bb9d0afde92878b627bb1b7fe24d3","observation_id":"4ce7d73f-2297-4606-859d-76ffa23b4283","resolution":{"observed_at":"2026-08-06T16:30:31.811334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.029330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.029330Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:14c39ef208db8b20e68e6f7e5cfba0fa45078ff8b7e73b71a3c44953b5e46f55","observation_id":"4833b901-f4ff-4c94-9853-57b9bafc2ea0","resolution":{"observed_at":"2026-08-06T16:30:31.029330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.032766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.032766Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:832e5261180a7dffd92e7c20c55d428803e668ea8a8dedbaf34b5a1e6ff010a3","observation_id":"85bf35d1-8570-41fd-9c0c-a0c74d35e5c0","resolution":{"observed_at":"2026-08-06T16:30:31.032766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.036070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.036070Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:16d526f2dcb5bc28a341584ebbd5b58817d3d781f62438f4013a97fec1cb0c44","observation_id":"185b38a5-74db-4f83-b4fb-eea0ac12af20","resolution":{"observed_at":"2026-08-06T16:30:31.036070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09835","last_updated":"2024-08-21T13:36:30Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T12:03:21Z","title":"ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09835","snapshot_observed_at":"2026-08-06T16:30:31.039397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.039397Z"},"links":{"cited_paper":"/paper/2311.09835","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:bdd451c87aca893c2fd8334926cb0d21ad4aac1edf0fc28c7ef6771986e93e81","observation_id":"c6f21ed6-1294-43ac-9006-709465b70578","resolution":{"observed_at":"2026-08-06T16:30:31.039397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.042531Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.042531Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:eb6351579fc66c26125a7f06e97d7ce0e757901ad2d1671c85429c009a58bb32","observation_id":"665073b8-e824-4ccf-b649-b982a6ed0339","resolution":{"observed_at":"2026-08-06T16:30:31.042531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.794783Z","title":null,"venue":null,"work_id":"ab132e53-7c05-44d8-b77b-9dd81f1730bb","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.046147Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:35aab338352f0d5ca5dfcf1c9a966b105bf22251bd20d9b6880f9ea1f9ebd884","observation_id":"f0f220d6-e3a8-4051-87ac-fe2221f36dcc","resolution":{"observed_at":"2026-08-06T16:30:31.798588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-06T16:30:31.049248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.049248Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:71af6c134358dc6cf61c0177eb9067a8e569cfc01b92c01583a57147823706b6","observation_id":"25cdec61-3801-45a5-a4a7-23e2d8b87f94","resolution":{"observed_at":"2026-08-06T16:30:31.049248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13610","last_updated":"2024-02-21T08:26:43Z","snapshot_observed_at":"2026-07-06T17:33:17.224327Z","submitted_at":"2024-02-21T08:26:43Z","title":"Data-driven Discovery with Large Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13610","snapshot_observed_at":"2026-08-06T16:30:31.052687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.052687Z"},"links":{"cited_paper":"/paper/2402.13610","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:8c6c3b8fec9f59c7ca13c945e235292b591feba680431159650c8f54168a6410","observation_id":"29b932a9-8b9e-4da5-9616-39c6dfbc5871","resolution":{"observed_at":"2026-08-06T16:30:31.052687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.783850Z","title":null,"venue":null,"work_id":"724cfed7-d096-4121-8578-8d3ca877713b","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.055903Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:7878ea4cbdef9577dd116f4660ae2e363da2cb8306eaf49b979241fe87b78552","observation_id":"60c78680-721c-4a0d-89bd-42765d2a061b","resolution":{"observed_at":"2026-08-06T16:30:31.787440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T16:30:31.059038Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.059038Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:6afa13cf3bc41bf1f25f8b070ccc4e2b235fcbce3c9542c6d0e0c203ca243c3f","observation_id":"808d6a98-936f-4299-b0e2-f39aab016ff8","resolution":{"observed_at":"2026-08-06T16:30:31.059038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.062412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.062412Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:1d83af4dc3e90c1f39a3e8c48459909f5afbad31fa064a4e5060b8d3d103e750","observation_id":"688d34cc-d254-4706-ab4e-4408e45bc378","resolution":{"observed_at":"2026-08-06T16:30:31.062412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.767178Z","title":null,"venue":null,"work_id":"e84dfe6c-9fb9-4061-b14d-7fe7d2302397","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.065403Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:b0a074057fdefc59ea40e539ff982aeb375396df630780addbf43375a3af7718","observation_id":"8f0da463-dfff-4cca-86f1-0e4f962c02e8","resolution":{"observed_at":"2026-08-06T16:30:31.770380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.755658Z","title":null,"venue":null,"work_id":"cd3db86b-20f1-4360-876c-61f53a060508","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.068701Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:00cd9ebae5ff9e91cceb0c6f7a069befc0176b1260861995f93457482a6f3073","observation_id":"a0f174d5-69ae-4218-8f7f-464315482aa1","resolution":{"observed_at":"2026-08-06T16:30:31.759968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.744205Z","title":null,"venue":null,"work_id":"d6566e0e-6571-4d6b-8d5a-ca80191881b4","year":2022},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.071806Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c8a2c89b3f37b0c2c27db2d51e44f40417839a7e9b8e2a407d468fec14c5eaab","observation_id":"fce17fcd-67f8-4626-92bf-62c5ddc75395","resolution":{"observed_at":"2026-08-06T16:30:31.748859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.075285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.075285Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:87f7634047679896f037caf9f86dc2b4ee31e6905cd3e7843fcb580b3c932e9b","observation_id":"0e27f756-18d3-408c-ab87-faeb6d0df65f","resolution":{"observed_at":"2026-08-06T16:30:31.075285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13062","last_updated":"2024-07-17T05:26:03Z","snapshot_observed_at":"2026-08-08T21:26:41.879451Z","submitted_at":"2023-05-22T14:23:46Z","title":"Table Meets LLM: Can Large Language Models Understand Structured Table Data? A Benchmark and Empirical Study","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13062","snapshot_observed_at":"2026-08-06T16:30:31.078561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.078561Z"},"links":{"cited_paper":"/paper/2305.13062","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:d694e47205f109b261a4cd1d22b34cd77583f688117dfb6e484c7fd6ae9becd6","observation_id":"f1399d7f-bb78-4f69-acec-02d4b62a02d0","resolution":{"observed_at":"2026-08-06T16:30:31.078561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05688","last_updated":"2024-06-09T08:24:17Z","snapshot_observed_at":"2026-08-07T20:42:13.596156Z","submitted_at":"2024-06-09T08:24:17Z","title":"Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05688","snapshot_observed_at":"2026-08-06T16:30:31.082021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.082021Z"},"links":{"cited_paper":"/paper/2406.05688","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:85c8f8266d8dea733fe31110c24b8e8dc33d58217d60f83acd9bbd0481d2eccf","observation_id":"ddecfe4f-6646-4ec9-be3e-e20959d4e546","resolution":{"observed_at":"2026-08-06T16:30:31.082021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T16:30:31.085794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.085794Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:76857f32a0768869cf3d79d98b6ca8b83f01a885c16bc7b2dc05bcb644b537dd","observation_id":"96dbbd43-b39a-4731-8ece-5fe516d7e906","resolution":{"observed_at":"2026-08-06T16:30:31.085794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T16:30:31.089625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.089625Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:bc0d8eb52a03b97a667a73593613348236a691d38a671dfc3b2474c9786a287d","observation_id":"c70b9c7c-b688-4624-9d70-de818087afb0","resolution":{"observed_at":"2026-08-06T16:30:31.089625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15569","last_updated":"2025-06-18T15:43:26Z","snapshot_observed_at":"2026-08-10T09:35:06.514315Z","submitted_at":"2025-06-18T15:43:26Z","title":"SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification","version":1},"cited_work":{"arxiv_id":"2506.15569","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.15569","snapshot_observed_at":"2026-08-06T16:30:31.395488Z","title":"SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification","venue":"cs.CL","work_id":"e3cfa393-d249-47ba-96ed-f652bc4ddd43","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.093234Z"},"links":{"cited_paper":"/paper/2506.15569","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:9687ba54e1e51dc3a63ba9548aee458ec7a9bdaf2d76b3de09db87d2c8063a30","observation_id":"9586f3c8-ffe0-4981-932a-9520f2580e60","resolution":{"observed_at":"2026-08-06T16:30:31.399169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14259","last_updated":"2024-06-03T21:15:28Z","snapshot_observed_at":"2026-08-10T20:43:24.840241Z","submitted_at":"2023-05-23T17:12:08Z","title":"SciMON: Scientific Inspiration Machines Optimized for Novelty","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14259","snapshot_observed_at":"2026-08-06T16:30:31.097289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.097289Z"},"links":{"cited_paper":"/paper/2305.14259","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:90c89dc7cb4887ffcd0de7eabd0b1660eb67a12158ed278c5bfbff7bb8abd333","observation_id":"19a818ec-0e27-4e39-886a-f8ac522d13db","resolution":{"observed_at":"2026-08-06T16:30:31.097289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06364","last_updated":"2024-04-09T15:01:51Z","snapshot_observed_at":"2026-07-06T17:57:48.153936Z","submitted_at":"2024-04-09T15:01:51Z","title":"SurveyAgent: A Conversational System for Personalized and Efficient Research Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06364","snapshot_observed_at":"2026-08-06T16:30:31.101369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.101369Z"},"links":{"cited_paper":"/paper/2404.06364","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:d86aad3934fe30adfe73e59458f6f82ceb2681d4c4d5289a225a28f5e5850044","observation_id":"da8c7d2f-da3d-4060-b1ab-d90fe9923a1c","resolution":{"observed_at":"2026-08-06T16:30:31.101369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.727021Z","title":null,"venue":null,"work_id":"53981183-9afe-4695-81cf-7be8cc2fc3fd","year":2022},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.105540Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:3c4ae8deec44577e5775e91a4e786ab624daba4a65c8be32fb3753c2424e9157","observation_id":"2b409e93-3539-4596-9a51-bfa40875a554","resolution":{"observed_at":"2026-08-06T16:30:31.730606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03866","last_updated":"2024-03-06T17:16:44Z","snapshot_observed_at":"2026-07-06T17:40:33.769700Z","submitted_at":"2024-03-06T17:16:44Z","title":"KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03866","snapshot_observed_at":"2026-08-06T16:30:31.111256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.111256Z"},"links":{"cited_paper":"/paper/2403.03866","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:34c7cdfdd0734532428f93476ca2ff98881d8c109c76755521c885c40220d457","observation_id":"5d53540b-a46a-4849-98c9-a0370e2977e5","resolution":{"observed_at":"2026-08-06T16:30:31.111256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02694","last_updated":"2025-07-03T15:04:38Z","snapshot_observed_at":"2026-08-10T06:22:48.065889Z","submitted_at":"2025-07-03T15:04:38Z","title":"Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers","version":1},"cited_work":{"arxiv_id":"2507.02694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02694","snapshot_observed_at":"2026-08-06T16:30:31.350050Z","title":"Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers","venue":"cs.CL","work_id":"cb782d20-b525-4ae6-8a0f-b18f8dbab0c8","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.115395Z"},"links":{"cited_paper":"/paper/2507.02694","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:f6f7d35f83748529b7210211b0394d2c1439815c7a50ca6c4d523f736e85cc5f","observation_id":"725bddb8-efc5-4e3d-9f2f-b603cf1cc2e0","resolution":{"observed_at":"2026-08-06T16:30:31.354775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T16:30:31.119728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.119728Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:e5fb1db6419719c92a886de16d0c8d285a85bc481e599a7d0ee239ab6db8cf53","observation_id":"428c9335-fac2-40f6-9ff1-21fe7f418772","resolution":{"observed_at":"2026-08-06T16:30:31.119728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-06T16:30:31.123653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.123653Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:d3c533b349a0deee6201054697cd4b2e85ee3c0ae6a77fbca31ba7411c67ac11","observation_id":"f86dadd1-e385-4c20-bacc-35486fc1a6cb","resolution":{"observed_at":"2026-08-06T16:30:31.123653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.127880Z","title":"Griffiths, Yuan Cao, and Karthik R Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.127880Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:fd8f47b914e47e0e2fc420eaa96b173781f543e84804e952d9676c3d79a6ddd2","observation_id":"1957df79-f98e-4708-a777-28755761d020","resolution":{"observed_at":"2026-08-06T16:30:31.127880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.131703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.131703Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:f555e32f51ff1467886ded26f4eaccbe922029d99cb3596c97964c1f73dee97a","observation_id":"8a19b5a3-592f-4cd4-9ae9-fe986ef0618a","resolution":{"observed_at":"2026-08-06T16:30:31.131703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"cited_work":{"arxiv_id":"2507.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10787","snapshot_observed_at":"2026-08-06T16:30:31.307464Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","venue":"cs.CL","work_id":"75842fb0-7584-4f24-b8c6-d3e30f6bec84","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.136261Z"},"links":{"cited_paper":"/paper/2507.10787","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:a949db25a5627bc24824957f2ff66cc8f9ea4063d7b6df437d2411c45f9e5fd9","observation_id":"ead4df80-43c5-4fa2-9cd1-94d2e2f83fb5","resolution":{"observed_at":"2026-08-06T16:30:31.315034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.140179Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.140179Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:0535ec8a3b923f5c5c2831d5574ce96685337db7eaca377b211cae3e63a69148","observation_id":"a10a905c-0f4f-43c5-908f-2607ed074f1d","resolution":{"observed_at":"2026-08-06T16:30:31.140179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.703345Z","title":null,"venue":null,"work_id":"ce8cd54d-8226-40ac-8a6b-4082a15eb171","year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.144243Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c822f42d2987d903ace2043a9e9330d0307fa3d576e057aa766d0c4e4c9d661f","observation_id":"c5de9c4c-c617-430d-aa44-2ee374e800c4","resolution":{"observed_at":"2026-08-06T16:30:31.707216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04326","last_updated":"2024-12-18T19:00:00Z","snapshot_observed_at":"2026-07-06T17:56:18.931340Z","submitted_at":"2024-04-05T18:00:07Z","title":"Hypothesis Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04326","snapshot_observed_at":"2026-08-06T16:30:31.148470Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.148470Z"},"links":{"cited_paper":"/paper/2404.04326","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:5245f872563eec1cd1954870f9e38707be0e9b4d8db2391664df9c682201e0ba","observation_id":"87a32eb7-089c-40a5-b0f8-85786feeb8a2","resolution":{"observed_at":"2026-08-06T16:30:31.148470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T20:46:03.376161Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2507.13300."}