{"as_of":"2026-08-10T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27ad5cb8eecd7b800457db228ecde751d8c362116c3f6fd760edfdaa218a7d49","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:42.348441Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15715/citation-record","integrity":"/paper/2507.15715/integrity","json":"/paper/2507.15715/citation-record.json","paper":"/paper/2507.15715"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:46.685750Z","title":"Kurtz, Edwin A","venue":null,"work_id":"20186372-1f93-4203-abd6-0e1240ab9459","year":2015},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.327954Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:264d1774ae0b9bf668ff6ee817cb4c9b54fb8010f22fbde2c8ad94ee184fde47","observation_id":"27c96f69-cd38-4040-a144-6b5fa93f0f7c","resolution":{"observed_at":"2026-08-06T15:29:46.780248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:46.494730Z","title":"Henneken, Carolyn S","venue":null,"work_id":"24c632f1-d25c-4fc3-9c8a-88c03a500758","year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.353537Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:24aaeb531daf327036a29e89f7be6f47990db7f9b96dcadd95abb737f3b29905","observation_id":"e857067f-c455-44c1-8017-c896aefbafe8","resolution":{"observed_at":"2026-08-06T15:29:46.590827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14199","last_updated":"2024-11-21T15:07:42Z","snapshot_observed_at":"2026-08-10T13:24:48.678844Z","submitted_at":"2024-11-21T15:07:42Z","title":"OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14199","snapshot_observed_at":"2026-08-06T15:29:37.422914Z","title":"Openscholar: Synthesizing scientific literature with retrieval-augmented lms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.422914Z"},"links":{"cited_paper":"/paper/2411.14199","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:b227addff9b330e1ddc758f0107cadf9288fbe3266b5db9ace0ea46806a4b490","observation_id":"16e9845e-ce20-4707-ab47-19d22826bbe0","resolution":{"observed_at":"2026-08-06T15:29:37.422914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:37.501898Z","title":"Search B ots: User engagement with ChatBots during collaborative search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.501898Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:61b0c23fb908127046ba0b6f71481cd52d618bd1290e90aeb0e6be1727cdc027","observation_id":"7b3b0184-0ec3-48f0-bbe2-5efbd72a176d","resolution":{"observed_at":"2026-08-06T15:29:37.501898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:37.620210Z","title":"Embedding search into a conversational platform to support collaborative search","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.620210Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:b6353b4618ba450ef53acf34414069fc71e9114ef972ff732f4750b9fd209eb3","observation_id":"9b256564-1ae3-4dc9-ac4e-53ef4e34de2a","resolution":{"observed_at":"2026-08-06T15:29:37.620210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3512913","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"The effects of system initiative during conversational collaborative search","venue":"Proceedings of the ACM on Human-Computer Interaction","work_id":"56bc5e06-208a-4e7f-9cb3-aebff4120450","year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.707455Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:4cace157a7cc686a64c3b079766e421f2e5b2a8455adc9dc28ad6ef976c90748","observation_id":"857cfe90-fb18-485b-8def-5517ff44a169","resolution":{"observed_at":"2026-08-06T15:29:43.102800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03492","last_updated":"2025-06-27T09:33:10Z","snapshot_observed_at":"2026-08-08T15:57:08.214263Z","submitted_at":"2024-10-04T15:04:28Z","title":"Towards Reproducible LLM Evaluation: Quantifying Uncertainty in LLM Benchmark Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03492","snapshot_observed_at":"2026-08-06T15:29:37.798046Z","title":"Blackwell, Jon Barry, and Anthony G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.798046Z"},"links":{"cited_paper":"/paper/2410.03492","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:2db6ea8c7b0a00d7c4e96fc24b41b2604104fcd3393c8c0d6f686f6b450be86b","observation_id":"f7e1caf3-44f0-4c07-86a0-d19a3b528224","resolution":{"observed_at":"2026-08-06T15:29:37.798046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:37.857577Z","title":"Bowman and George Dahl","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.857577Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:c12ebc020820ce18dc0e8b5233e0c5a8d479ec442b751ce3339ec106c328e9c7","observation_id":"874cf6a4-dc96-4f38-9d90-68df6f0ff5e0","resolution":{"observed_at":"2026-08-06T15:29:37.857577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:37.975077Z","title":"Toward algorithmic accountability in public services: A qualitative study of affected community perspectives on algorithmic decision-making in child welfare services","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:37.975077Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:dc700990361841be5e41c283c08c18d5be1c20800c5ae756e13ca80cfb6fc206","observation_id":"49e8f034-f8d8-4ee5-8e89-cc9f404679d3","resolution":{"observed_at":"2026-08-06T15:29:37.975077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:46.258465Z","title":null,"venue":null,"work_id":"16be886f-f7ba-4ae0-a6ae-87da0a32dfeb","year":2020},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.086420Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:6b67398c960c0ed05430b0ca36f3ceeea7363a656ec20d92e1b4ec0c88ac130e","observation_id":"74b9716d-7221-49e5-aa41-abd3c7533141","resolution":{"observed_at":"2026-08-06T15:29:46.374142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.206098Z","title":"Fabbri, Wojciech Kry \\'s ci \\'n ski, Bryan McCann, Caiming Xiong, Richard Socher, and Dragomir Radev","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.206098Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:41b2417754fe8f0b8a189c7fe6338eadf6036a15b75014f1289f8e56e8cf8aff","observation_id":"043b933d-e42e-4251-ad1e-b29e00ad287c","resolution":{"observed_at":"2026-08-06T15:29:38.206098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.333778Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.333778Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:c50f9f495d778fc5123ca3a9faefbe86b7fa547598143a58d1371c0b152a8895","observation_id":"6570ef50-b6b5-4676-b30c-279824ba7822","resolution":{"observed_at":"2026-08-06T15:29:38.333778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.435601Z","title":"Enabling large language models to generate text with citations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.435601Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:760c2d8a366419fdcbef40bb8bab81578103744660d95682541030e902125a3b","observation_id":"266e21d3-c56b-44e6-9fb6-0e17a90ecfb5","resolution":{"observed_at":"2026-08-06T15:29:38.435601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:45.991214Z","title":"What can large language models do in chemistry? A comprehensive benchmark on eight tasks","venue":null,"work_id":"5f3ba28e-91a4-4993-ae0a-74d4cf42cbce","year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.538154Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:371c0bc046bf537c8429727e3b18d20630edae15517d8c6e70575881f8b78989","observation_id":"456fe5da-355b-4c50-8d98-531913e588bb","resolution":{"observed_at":"2026-08-06T15:29:46.087564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.632350Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.632350Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:27e11a0e36ec9bfe400ca6b8a175fe8eda0e2f5ecef1613f9803b0022715b70e","observation_id":"29d230c2-2941-40ff-8f67-5c12f3144f92","resolution":{"observed_at":"2026-08-06T15:29:38.632350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.737079Z","title":"Iyer, Mikaeel Yunus, Charles O’Neill, Christine Ye, Alina Hyk, Kiera McCormick, Ioana Ciucă, John F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.737079Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:6730323a16922b5366988708a5cac79b867366bd312f3d47d021cf8095a93c17","observation_id":"bf012bce-e408-49c0-86dd-64eb54026ca1","resolution":{"observed_at":"2026-08-06T15:29:38.737079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.791678Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.791678Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:efabeb9b38f71ecf71e18574eb37b522e59a97c7f5559f80381fcf7df837a8e4","observation_id":"13f31780-8ae0-4420-8746-a8aeabd65f56","resolution":{"observed_at":"2026-08-06T15:29:38.791678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:38.893061Z","title":"On scientific understanding with artificial intelligence","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:38.893061Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:d541d7e62f5e2cf2257fb2bdb0bc2260fd1b5f5e393e6c728656fc0109d75e3e","observation_id":"7eb8b2d2-134b-47ff-aa79-48e18b31b379","resolution":{"observed_at":"2026-08-06T15:29:38.893061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.005780Z","title":"Wikibench: Community-driven data curation for AI evaluation on W ikipedia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.005780Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:eee357aee6037c8c18ee9a4db4afc7599b156e16f8f2dc6fd6d1da43098848c8","observation_id":"f701a313-32ec-485f-a132-4e78c62403b5","resolution":{"observed_at":"2026-08-06T15:29:39.005780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.128709Z","title":"Chapter 8 - interviews and focus groups","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.128709Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:10cee8304f339c7d2a67797015918ab5e157c08bf254c1ae9d966ae56ce8ed48","observation_id":"690c2d37-96c5-4c25-842a-3e23044ae119","resolution":{"observed_at":"2026-08-06T15:29:39.128709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.222337Z","title":"H alu E val: A large-scale hallucination evaluation benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.222337Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:1a9412bd639c0c5c98f301aad373b97c58352c5d7d4c3282c2a20e28d1bbcdda","observation_id":"0218d1d6-2b04-4562-bc11-17f6776dba69","resolution":{"observed_at":"2026-08-06T15:29:39.222337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:45.795523Z","title":null,"venue":null,"work_id":"daf1fc5f-d3a8-4431-854d-0f12be77b247","year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.305544Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:dca830169b4022b50448faa951dafe70c4f4ace25607db84a8ca16f3e62be40f","observation_id":"04ef06a9-e284-49af-b016-443301616f0d","resolution":{"observed_at":"2026-08-06T15:29:45.873366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-08-06T15:29:39.408794Z","title":"Rethinking model evaluation as narrowing the socio-technical gap","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.408794Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:14db4ac51ab3fc4ee96c81f8b21bef35cd71bd7b70d4e05f95d212d5420192d6","observation_id":"64e7b96d-dc3b-424a-bdb2-ee5f5deb5e4b","resolution":{"observed_at":"2026-08-06T15:29:39.408794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.516481Z","title":"Vera Liao, Daniel Gruen, and Sarah Miller","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.516481Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:fcc5a9c52e228e6a5d35e40c13960c43836138df6bbe220c926c596db90490bd","observation_id":"a92f3370-7547-4c92-97ad-5a0957c5af95","resolution":{"observed_at":"2026-08-06T15:29:39.516481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.620818Z","title":"S elf C heck GPT : Zero-resource black-box hallucination detection for generative large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.620818Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:2ee39f337347bb6c325815f0a39f010a40f52cf166f376257e992ac227802564","observation_id":"a8b993fe-9673-47a8-aa2b-6b9d3d39ce79","resolution":{"observed_at":"2026-08-06T15:29:39.620818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.788439Z","title":"Mathewson, Jaylen Pittman, and Richard Evans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.788439Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:f6c06b602160859d1806488eddb2ec4bece5435bde4abdd68967ab5b61be574c","observation_id":"f96673d3-1578-4deb-aa67-acf7f07d0710","resolution":{"observed_at":"2026-08-06T15:29:39.788439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:39.917055Z","title":"Wolf, Josh Andres, Michael Desmond, Narendra Nath Joshi, Zahra Ashktorab, Aabhas Sharma, Kristina Brimijoin, Qian Pan, Evelyn Duesterwald, and Casey Dugan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.917055Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:c424444f55fb1d22c831b9527f850aecba13baff4356fbee49539a1d03913160","observation_id":"23dff6a3-e837-4a45-ab51-6548962615c2","resolution":{"observed_at":"2026-08-06T15:29:39.917055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:45.590713Z","title":null,"venue":null,"work_id":"9594d21d-4536-40ce-bbf4-25f76aa4baa1","year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.039345Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:5adce1c41720f58705dfe0c3384cc13eb7f98f6f5b2369555a2635f42d89da7f","observation_id":"0dc0bdb0-4283-4bf8-a8fe-4d6e40d4b2e3","resolution":{"observed_at":"2026-08-06T15:29:45.676716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:40.182493Z","title":"Rodriguez Mendez, Thang Bui, Alyssa Goodman, Alberto Accomazzi, Jill Naiman, Jesse Cranney, Kevin Schawinski, and Roberta Raileanu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.182493Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:b5a36c0331679f4b4ece46168c24ebf0de670316a2e22e30546158a4cefa0159","observation_id":"a529e512-12a9-4686-aae0-4702e446ffb3","resolution":{"observed_at":"2026-08-06T15:29:40.182493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:40.252325Z","title":"emr QA : A large corpus for question answering on electronic medical records","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.252325Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:c10c0b9cec8905e458dba8775051a1f98ae652d685b907606f4709eee62c80a7","observation_id":"2ed222ae-9815-4590-82e8-c0b06816356b","resolution":{"observed_at":"2026-08-06T15:29:40.252325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:45.363428Z","title":"B io R ead: A new dataset for biomedical reading comprehension","venue":null,"work_id":"7ff54958-a3dd-4fd6-b633-2ca9c40ac17a","year":2018},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.375448Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:69ee7924b2194ae3458baf8ada4c20c70adbb4847dbaab9882dc70d7a5a17ee7","observation_id":"340bbaff-2ae5-4607-9b65-9f4e20bfe3f5","resolution":{"observed_at":"2026-08-06T15:29:45.468781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:40.489331Z","title":"B io MRC : A dataset for biomedical machine reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.489331Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:5a4af9af65985d75656d2d60bc5842ece5e87a5339a61ce4e8a4d1752989b0cc","observation_id":"e74bfa0e-789f-4503-9ab5-483edc04a799","resolution":{"observed_at":"2026-08-06T15:29:40.489331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:45.169310Z","title":"Exploring temperature effects on large language models across various clinical tasks","venue":null,"work_id":"8d935326-d2dd-4df6-a92c-1aa96fa20896","year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.584441Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:05874c2d8331fb46d7712e510c13dfcdc57abcbcb383aab56e26f3996ce47d1b","observation_id":"c7ff9d22-4084-4f89-bdd1-f30853b47950","resolution":{"observed_at":"2026-08-06T15:29:45.268357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:40.688976Z","title":"Smith, Huiling Liu, Kevin Schawinski, Kartheik Iyer, Ioana Ciucă, and UniverseTBD","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.688976Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:de852c6454297e9a59e44710dcf09b8be1006731c688d0c2fca0ac9fbc663848","observation_id":"3314d704-20c7-4a91-8284-519ee72dda91","resolution":{"observed_at":"2026-08-06T15:29:40.688976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:40.862940Z","title":"Bender, Alex Hanna, and Amandalynne Paullada","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.862940Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:d467dcf29d8f819adcf599e5f3158cdb28431cc08f08e058683722a1055f3dbc","observation_id":"4fca715d-5d5d-4316-a7e7-c0c8c5af6b18","resolution":{"observed_at":"2026-08-06T15:29:40.862940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:40.975379Z","title":"The effect of sampling temperature on problem solving in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:40.975379Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:2d7efb4f99ea2665ac74dcd6442662d53e19df4e80a5fcf548c510d027df6137","observation_id":"db18018f-e43b-4cf7-8f0a-1e5d630aa9bd","resolution":{"observed_at":"2026-08-06T15:29:40.975379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-demos.10","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Improving evidence retrieval for automated explainable fact-checking","venue":null,"work_id":"b3b26a59-0637-4244-8204-97d9feab416d","year":2021},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.040347Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:c408ee43a39dd8f8f6872124ec53ac03317c8b803dabaef9986be9169e7da485","observation_id":"44a2d16e-6a6f-4b4e-b5e5-73306be032ec","resolution":{"observed_at":"2026-08-06T15:29:42.860122Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:41.097841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.097841Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:6631c982063e412a571404f0734d3899ad47934735a26d12850d4ae642d76d0c","observation_id":"187fe219-bbef-4d96-8112-24a864213317","resolution":{"observed_at":"2026-08-06T15:29:41.097841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10457","last_updated":"2024-07-15T06:12:17Z","snapshot_observed_at":"2026-08-09T20:09:37.618565Z","submitted_at":"2024-07-15T06:12:17Z","title":"The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10457","snapshot_observed_at":"2026-08-06T15:29:41.138123Z","title":"The good, the bad, and the greedy: Evaluation of llms should not ignore non-determinism, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.138123Z"},"links":{"cited_paper":"/paper/2407.10457","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:d43b3e57be8c779e80f5660377b65436f8d679cf055c71b3bf0b005e30e6ec6d","observation_id":"71985320-c1e8-4ecf-a5dc-8468c119c5d6","resolution":{"observed_at":"2026-08-06T15:29:41.138123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:41.201818Z","title":"Scieval: a multi-level large language model evaluation benchmark for scientific research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.201818Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:111acfa781ec2ef8bae16a1647ce2ec9c69211972528f2dac95689b594afa707","observation_id":"3aa554d2-c2d9-4573-ac49-0400e7b08b79","resolution":{"observed_at":"2026-08-06T15:29:41.201818Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41746-023-00896-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Nestor, Ali Soroush, Pierre A","venue":"npj Digital Medicine","work_id":"f2f73553-3a9e-489b-8807-2011408b0d51","year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.320038Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:cf0339f21cdafd79e8de1c54a75b2defdd3f9d8455027e0023722c56f1896a82","observation_id":"5dd25c18-98f3-4b28-91af-f17b7e0950cd","resolution":{"observed_at":"2026-08-06T15:29:42.679016Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:41.418093Z","title":"FEVER : a large-scale dataset for fact extraction and VER ification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.418093Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:abf1b5b114e787e48359d2f75c6757ab7596ffa6fe2290176acd62ff0087bbd3","observation_id":"6d21ebef-9c75-4bf2-8a6d-fe3d9e583d95","resolution":{"observed_at":"2026-08-06T15:29:41.418093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3512941","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Group chat ecology in enterprise instant messaging: How employees collaborate through multi-user chat channels on slack","venue":"Proceedings of the ACM on Human-Computer Interaction","work_id":"f29ece69-534f-44d5-87bf-2ceb71b1132a","year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.479622Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:6b9aa525740f2c6d6d5c10526fe90359983260b7ac24a6135af652fd8f35b1ef","observation_id":"c21746c8-56d1-4ecc-b42f-5a61afa09ddd","resolution":{"observed_at":"2026-08-06T15:29:42.523254Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:41.581642Z","title":"Evaluating large language models on academic literature understanding and review: An empirical study among early-stage scholars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.581642Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:2c22a3110f391eac40a20ddb401e477e20cdc95b7b8192c3ff282249ea1ff28d","observation_id":"643ed9c8-a501-4895-bf7a-81bef5ad4cce","resolution":{"observed_at":"2026-08-06T15:29:41.581642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:41.655835Z","title":"as an ai language model, i cannot","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.655835Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:d39b3a8b376f608db2b117db38a05c328d18fe7ce6124f4ed64e77867caec9a3","observation_id":"194c1acc-3bff-422b-b52c-c2e22d164b3c","resolution":{"observed_at":"2026-08-06T15:29:41.655835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20389","last_updated":"2024-05-30T18:00:21Z","snapshot_observed_at":"2026-08-06T11:37:46.403991Z","submitted_at":"2024-05-30T18:00:21Z","title":"Designing an Evaluation Framework for Large Language Models in Astronomy Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20389","snapshot_observed_at":"2026-08-06T15:29:41.746197Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.746197Z"},"links":{"cited_paper":"/paper/2405.20389","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:0606e97e3f52c9cb4409eb94e48a327465bed3aab4af772533a1de28bdf857e5","observation_id":"b5cda476-4e8d-475d-a1c2-9704ddabbf1e","resolution":{"observed_at":"2026-08-06T15:29:41.746197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:41.830639Z","title":"C-pack: Packed resources for general chinese embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.830639Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:2a579d59e46c4f43bc2155eb2a8fa9b559210cbf6cf4afa36be163c3a5861e13","observation_id":"347b5cc6-f90b-465a-87da-5b86b931a88a","resolution":{"observed_at":"2026-08-06T15:29:41.830639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:44.923753Z","title":"AI as an active writer: Interaction strategies with generated text in human- AI collaborative fiction writing","venue":null,"work_id":"8a4ff0ab-6137-4842-82e3-320fb793bd30","year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.891915Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:bb7f790df83fde50844cb226a61b100a266fe8655340958bd22100f269cc49ad","observation_id":"844b0afc-4d00-46e9-a8b5-eb4d4912d025","resolution":{"observed_at":"2026-08-06T15:29:45.034922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16139","last_updated":"2023-07-30T06:06:35Z","snapshot_observed_at":"2026-07-06T16:00:16.896971Z","submitted_at":"2023-07-30T06:06:35Z","title":"User-Controlled Knowledge Fusion in Large Language Models: Balancing Creativity and Hallucination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16139","snapshot_observed_at":"2026-08-06T15:29:41.990196Z","title":"User-controlled knowledge fusion in large language models: Balancing creativity and hallucination, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:41.990196Z"},"links":{"cited_paper":"/paper/2307.16139","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:791acdd15a9d72e95215a5eb537206718127082daa99b8ae28f14cdf79d0c49c","observation_id":"01bbfc41-c32a-45ea-bb2a-0b9b7c493064","resolution":{"observed_at":"2026-08-06T15:29:41.990196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:44.711130Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":"5d637b44-afc2-431f-bc74-a6c57b82ddc9","year":2020},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:42.057541Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:4450b54ea1b4325bdbf40ebebfe526f84ef69a19a475a9344e633ef741833b00","observation_id":"b2bde327-f37d-4162-9d84-bf16ed863ac6","resolution":{"observed_at":"2026-08-06T15:29:44.830578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:44.487817Z","title":"WildChat : 1 M C hat GPT interaction logs in the wild","venue":null,"work_id":"e37c2337-f4bf-4a4d-a2ba-863d50d44f76","year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:42.106650Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:35137ea0dd10537a82a1091ae97c23dc53d2659903f0c84a6d3d222daa5c1d04","observation_id":"40a5499e-16cf-4445-8e8f-cd3dde3432f5","resolution":{"observed_at":"2026-08-06T15:29:44.598764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:42.197073Z","title":"Deconstructing NLG evaluation: Evaluation practices, assumptions, and their implications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:42.197073Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:c1968561952a3f4e3ab993e646a13b1156bb395f4e96b8e8d841a541a6e9d1f0","observation_id":"67552ce0-5813-426e-a34d-c33fa787ac2b","resolution":{"observed_at":"2026-08-06T15:29:42.197073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:42.298617Z","title":"Navigating the grey area: How expressions of uncertainty and overconfidence affect language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:42.298617Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:f3c8c2db415036c58dd60c7f5a8596f42ff61043f15cee7cc441bd68e14c8569","observation_id":"e98031c2-bf97-47b0-a7f9-a425c93788b5","resolution":{"observed_at":"2026-08-06T15:29:42.298617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:44.255086Z","title":"Relying on the unreliable: The impact of language models ' reluctance to express uncertainty","venue":null,"work_id":"8f22da04-510d-49dc-a357-836144282b5d","year":2024},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:42.348441Z"},"links":{"citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:62c99a662a22b01fba27f9a214f1b5849b14626b8ff6ba65ce438604523e21e2","observation_id":"fe456e7f-3a03-4119-ac9b-93293c239cc1","resolution":{"observed_at":"2026-08-06T15:29:44.375318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":4,"verified_fuzzy":9},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.15715."}