{"as_of":"2026-08-21T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d631b7aa990b347fc7c701707a99e589822c5da68692ffc6fae1407a3da46c79","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:19.995889Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:17:25.648174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:20:49.429444Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.18710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18710","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V ., Mack- intosh, A., Portela, M","venue":null,"work_id":"c4300ceb-e853-4cff-a471-1cbbbbceaafc","year":null},"citing_paper":{"arxiv_id":"2604.06385","last_updated":"2026-04-07T19:16:50Z","snapshot_observed_at":"2026-08-15T15:42:29.678929Z","submitted_at":"2026-04-07T19:16:50Z","title":"Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:55:17.077281Z"},"links":{"cited_paper":"/paper/2506.18710","citing_paper":"/paper/2604.06385"},"observation_digest":"sha256:d33bacdb792d4c7b4aaf5148578fce011bf4b23667372dca40f21f472551a42c","observation_id":"b77a933a-aeb1-469a-ac90-b173740e58cf","resolution":{"observed_at":"2026-05-10T22:20:49.432408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18710","snapshot_observed_at":"2026-08-05T04:17:25.648174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-19T02:55:58.574864Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.648174Z"},"links":{"cited_paper":"/paper/2506.18710","citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:8e2c2dbed1bea024d42f66e542edde81de5b87e48b05e588ac0550d910835dce","observation_id":"da3fb9dd-9cfb-47b3-acdd-2272bc508f34","resolution":{"observed_at":"2026-08-05T04:17:25.648174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18710/citation-record","integrity":"/paper/2506.18710/integrity","json":"/paper/2506.18710/citation-record.json","paper":"/paper/2506.18710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.683582Z","title":null,"venue":null,"work_id":"738d7196-9e1f-43df-a864-c283a991aa86","year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.479564Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:7729b5aa343b8132042182a76e42731af0beb0367fa55aab7996bff0654aee95","observation_id":"24bb187b-f29c-4585-9952-440af2095de3","resolution":{"observed_at":"2026-08-06T23:20:23.826962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-16T13:50:06.099874Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-06T23:20:17.558649Z","title":"Biderman, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.558649Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:2b3bc6714d338da771bbe4b4979d49a70351763930ab0fa8316d6ec9e104177e","observation_id":"cc8a224a-e939-4fd1-b83f-b674ead897e9","resolution":{"observed_at":"2026-08-06T23:20:17.558649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16338","last_updated":"2023-07-30T23:15:28Z","snapshot_observed_at":"2026-08-16T15:12:07.954333Z","submitted_at":"2023-07-30T23:15:28Z","title":"Distractor generation for multiple-choice questions with predictive prompting and large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16338","snapshot_observed_at":"2026-08-06T23:20:17.679991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.679991Z"},"links":{"cited_paper":"/paper/2307.16338","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:45c3989417e59e264451c6918a20a19ff8b45b5dc07da20c024b581058c585ea","observation_id":"cb00ef13-f91c-4a82-ac67-dd4dde68a7a1","resolution":{"observed_at":"2026-08-06T23:20:17.679991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.396749Z","title":"Sastry, A","venue":null,"work_id":"cbb75213-e78b-433e-8b8a-4b8e55b3eb71","year":1901},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.780784Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:62ed3b179fb70badee47e702cbfa3ea3e0a4b53a29d0c9ddca94bc5ea002c197","observation_id":"bea6d80c-6936-4123-94e9-6be154b57933","resolution":{"observed_at":"2026-08-06T23:20:23.535094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.171456Z","title":"Chang, X","venue":null,"work_id":"a17a64f3-e544-4ec7-b40c-8b621abe6420","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.859253Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:b3bfdb6d40dedb255804c6fa914c2e1020ecc1fb2911e439ea93e22b93a14b17","observation_id":"1624f01f-6c72-46a0-89fb-34ca3ca107d9","resolution":{"observed_at":"2026-08-06T23:20:23.277396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-06T23:20:17.947382Z","title":"Chiang, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.947382Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:4c2f6213ca43d818019b50a23ca4152a4370a319bd1fd884dce1fb4a6c50a14c","observation_id":"c9655ea1-32ec-4989-b546-a732b26c6c9d","resolution":{"observed_at":"2026-08-06T23:20:17.947382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.003422Z","title":null,"venue":null,"work_id":"39cd9ce7-b700-4010-bf73-f3286c6f7944","year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.025882Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:68031c718a68f77b66a28a198e01463b0fe864a6cfb56170e6058ae98d640fd2","observation_id":"ab6aa314-1541-4c9d-94fb-38a70c8ef7fc","resolution":{"observed_at":"2026-08-06T23:20:23.093985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-08-20T11:16:58.983924Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T23:20:18.098093Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.098093Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:9270f64d56648c3b271fe7a19c8a6c87ee65cdc488adee5ed9ce70db2fe1278d","observation_id":"b0f66b31-b1ae-4858-8d25-f3f518ecbbc3","resolution":{"observed_at":"2026-08-06T23:20:18.098093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19470","last_updated":"2024-11-11T02:27:54Z","snapshot_observed_at":"2026-08-19T06:50:57.472059Z","submitted_at":"2024-06-27T18:21:32Z","title":"Changing Answer Order Can Decrease MMLU Accuracy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19470","snapshot_observed_at":"2026-08-06T23:20:18.169890Z","title":"Gupta, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.169890Z"},"links":{"cited_paper":"/paper/2406.19470","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:9d20f3be417453bd45fee8fd6f8342fcba4433cb0fb72288f1e1b34851c8637e","observation_id":"b6d1f93e-e3dd-4009-9000-70e8e9a4973f","resolution":{"observed_at":"2026-08-06T23:20:18.169890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:20:18.291469Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.291469Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:d6a297d01bdf0ea8cc6fd413728e3547243c1ffd17e4fd601e5af19f3aafce59","observation_id":"f814db51-67bd-4305-8466-5d994260db4c","resolution":{"observed_at":"2026-08-06T23:20:18.291469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:18.383691Z","title":"Kasenberg, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.383691Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:6f21036c006ebc6130e2d162e682ae2c056918f82712b6b336313c7104091e30","observation_id":"a7977192-8b60-4100-8ec4-7b10630d5d89","resolution":{"observed_at":"2026-08-06T23:20:18.383691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10242","last_updated":"2025-03-13T10:34:43Z","snapshot_observed_at":"2026-08-16T12:50:25.479061Z","submitted_at":"2025-03-13T10:34:43Z","title":"MinorBench: A hand-built benchmark for content-based risks for children","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10242","snapshot_observed_at":"2026-08-06T23:20:18.494890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.494890Z"},"links":{"cited_paper":"/paper/2503.10242","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:19580a67aca6571fb7fff796cdf50fe2307f74ae3edc182b0bf63663e19e5020","observation_id":"a825aa2b-cc49-4c4d-bcc5-922451871eec","resolution":{"observed_at":"2026-08-06T23:20:18.494890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:22.715463Z","title":null,"venue":null,"work_id":"ee34a961-30e4-4744-9a78-713256e5381d","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.550027Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:82d260da7f30ec5232dca26a8d509884bd9e9ba10847514a832d8a545de8a69a","observation_id":"5ebea77e-c4d2-444b-ba25-befa5559ed01","resolution":{"observed_at":"2026-08-06T23:20:22.906863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:18.624386Z","title":"Macina, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.624386Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:29a3c541dc8c5da34aaa582b5305195612faf1245018eb87bbc193f967fe4f8c","observation_id":"c44b9237-e4a4-420a-a847-6a0db5c20830","resolution":{"observed_at":"2026-08-06T23:20:18.624386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09880","last_updated":"2024-10-14T02:11:29Z","snapshot_observed_at":"2026-08-20T13:45:09.934614Z","submitted_at":"2024-02-15T11:08:10Z","title":"Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09880","snapshot_observed_at":"2026-08-06T23:20:18.697366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.697366Z"},"links":{"cited_paper":"/paper/2402.09880","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:e93b9bb9515727ad707bceb4dc5723ca320f3cdb06dc1c24df714938c1f63ff4","observation_id":"2f1c3676-d795-4007-a5ca-e4cf5528221d","resolution":{"observed_at":"2026-08-06T23:20:18.697366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:22.391227Z","title":"Miller and K","venue":null,"work_id":"2e74a152-f05a-4fd5-accc-9eb3db5723a3","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.788322Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:730c81b612aaf509150d95063a9d2b8952a004c0ea4a7272d95035b3784ab31b","observation_id":"2ec590f1-abd5-4724-a830-c2b6fc3b6637","resolution":{"observed_at":"2026-08-06T23:20:22.542405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:22.127742Z","title":"Nancy, D","venue":null,"work_id":"39e3d2c2-26bc-4da1-baca-7daf30bdbb3f","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.858576Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:efa1c6af094ac47d7cbf70bd49be66a60aca61d34eb01eeb34827c389be12fc0","observation_id":"66338182-1251-4ef6-9821-3d7cb07ade13","resolution":{"observed_at":"2026-08-06T23:20:22.232468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11483","last_updated":"2023-08-22T14:54:59Z","snapshot_observed_at":"2026-08-19T22:01:31.805341Z","submitted_at":"2023-08-22T14:54:59Z","title":"Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11483","snapshot_observed_at":"2026-08-06T23:20:18.894389Z","title":"Pezeshkpour and E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.894389Z"},"links":{"cited_paper":"/paper/2308.11483","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:2c1646fad308ba92be89acac88542cf2ae12d4540759a8220160948b235447a8","observation_id":"dcd55ea8-78ac-492d-8336-9986fa188871","resolution":{"observed_at":"2026-08-06T23:20:18.894389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.853546Z","title":null,"venue":null,"work_id":"5e785445-6deb-4302-bd96-57af8078acb6","year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.941933Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:5e40862d97ad2f24f9bfaa21bfc544f342567a2deee1b7c81a653fa83f704a91","observation_id":"f8c1cade-0438-4809-ab45-d0ef468f386b","resolution":{"observed_at":"2026-08-06T23:20:21.989970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T23:20:19.015163Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.015163Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:cc895cc1635ee00f354846bc64c5850a38feabef7b0af692fcb521b97b5d9b5b","observation_id":"79513115-4e9f-4085-9aa8-aa8a4158768d","resolution":{"observed_at":"2026-08-06T23:20:19.015163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/tea.21676","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":null,"venue":"Journal of Research in Science Teaching","work_id":"706e5422-a8f1-4309-901d-6bdafe3ee58d","year":2021},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.083382Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:b97936b93fd5a36692e98ae00ac437487847bc9faf9a4a20066aa463c299d889","observation_id":"2f14bc13-72fa-4de4-9d86-c1a26c846bcf","resolution":{"observed_at":"2026-08-06T23:20:20.188179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16429","last_updated":"2025-08-22T16:22:07Z","snapshot_observed_at":"2026-08-15T15:41:17.704012Z","submitted_at":"2024-12-21T01:34:05Z","title":"LearnLM: Improving Gemini for Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16429","snapshot_observed_at":"2026-08-06T23:20:19.149082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.149082Z"},"links":{"cited_paper":"/paper/2412.16429","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:48c4014b58c22bbb3165d076a245aebbb961c3ba66c63d19ed7fae62f83694fb","observation_id":"f8914a9b-4d96-4faf-8417-c8c5e8d0b485","resolution":{"observed_at":"2026-08-06T23:20:19.149082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24477","last_updated":"2025-05-30T11:26:32Z","snapshot_observed_at":"2026-08-17T11:14:23.993370Z","submitted_at":"2025-05-30T11:26:32Z","title":"Evaluating Gemini in an arena for learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24477","snapshot_observed_at":"2026-08-06T23:20:19.262891Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.262891Z"},"links":{"cited_paper":"/paper/2505.24477","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:4fb5edafdf1545fa304f653dc845348884538bdda572e76040e5684e6d717692","observation_id":"80662d06-63a6-4f2f-bbd1-0c5299a439b6","resolution":{"observed_at":"2026-08-06T23:20:19.262891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-06T23:20:19.346836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.346836Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:8e7a4cc5f183a5b828555358a4bbdf9f36986bb5a79235b5b3f7e09133f8e46c","observation_id":"256efb3c-ade7-419c-8204-c485a7f13395","resolution":{"observed_at":"2026-08-06T23:20:19.346836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18105","last_updated":"2024-04-01T18:47:45Z","snapshot_observed_at":"2026-08-18T16:51:53.899885Z","submitted_at":"2024-03-26T21:04:29Z","title":"Large Language Models for Education: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18105","snapshot_observed_at":"2026-08-06T23:20:19.392025Z","title":"Largelanguagemodels for education: A survey and outlook.arXiv preprint arXiv:2403.18105, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.392025Z"},"links":{"cited_paper":"/paper/2403.18105","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:18367efce631fa0355ea71cd19ae49bb7caff5c13e5fbbef848687781a2c00c0","observation_id":"2210cf71-da4c-40ff-9f41-bf3ab00f527c","resolution":{"observed_at":"2026-08-06T23:20:19.392025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14499","last_updated":"2024-07-04T12:51:29Z","snapshot_observed_at":"2026-08-16T14:16:16.163983Z","submitted_at":"2024-02-22T12:47:33Z","title":"\"My Answer is C\": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14499","snapshot_observed_at":"2026-08-06T23:20:19.476553Z","title":"my answer is c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.476553Z"},"links":{"cited_paper":"/paper/2402.14499","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:0a4b39ea787374be35bb7f5d88db9da98c47203815794c15004f2c520f875b7f","observation_id":"c0bf046d-b888-472b-94a8-13ab792af7b1","resolution":{"observed_at":"2026-08-06T23:20:19.476553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-20T16:26:42.002863Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T23:20:19.533268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.533268Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:6a5f13db728228862ccfc71a121f62cf2beb4bd820ffe0c42fe749107dd9f6ba","observation_id":"77f20ff9-76b7-42cc-85f2-bcabae8501c1","resolution":{"observed_at":"2026-08-06T23:20:19.533268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T23:20:19.618219Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.618219Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:d1ca6647ea8849778ac12ff406fbfc2a473e65261a3f1078335307f481b8c60d","observation_id":"d81164cd-622c-4e6f-8ba6-db336f662f38","resolution":{"observed_at":"2026-08-06T23:20:19.618219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.671956Z","title":"Zheng, H","venue":null,"work_id":"b4fceaa0-b562-4967-a31f-aa90bd1ec45a","year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.682163Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:34611d7a4640cfb9673c229c97ee4ad7ede96c284287291aa015df3eff603753","observation_id":"6d599a70-0eef-4cc6-9f62-cbc8081f806e","resolution":{"observed_at":"2026-08-06T23:20:21.782219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.332770Z","title":"Wheredoyouthinkthereismoreplasticine?","venue":null,"work_id":"0ef0a26e-a2d6-457c-a217-4fb0f3e5e50c","year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.753332Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:c5f53129af85cd2d3bf88d3ee98060f7f4dc2f697fc15b7ee4418d63a955f30b","observation_id":"fe32bd1a-bcbb-4f4d-8740-b4e7ef7995f3","resolution":{"observed_at":"2026-08-06T23:20:21.493176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.025318Z","title":"Question","venue":null,"work_id":"1f4aba2e-b7cb-4cb6-8662-87f4992e7e31","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.816947Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:b0d46fc4a7bd4335a54974c71231d33c7148267f13dd8eb7c6c6dbb11c9b664e","observation_id":"0846e8bf-2909-4ddd-af7e-d10ca4ffaa55","resolution":{"observed_at":"2026-08-06T23:20:21.120052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.877454Z","title":"The text is as follows: —– paragraph —–","venue":null,"work_id":"71e0139d-66e4-43a9-b7b3-4b648e01c1c3","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.868065Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:75c98b715457fb2407bf656c03c8eb424f915dc1802e9f68c5bec7e53bbee3dd","observation_id":"a8232885-ba20-49c7-8ce3-03c1bca6a1c9","resolution":{"observed_at":"2026-08-06T23:20:20.945282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.770754Z","title":"question","venue":null,"work_id":"1dd708ff-9c42-409f-a963-f5a795de0490","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.914280Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:3c40d1983cff799e3e6ed61198f9b8e12706e9e102634ef60d684cb933b9f1e6","observation_id":"99315814-de92-45c3-9951-84e64ec29d9f","resolution":{"observed_at":"2026-08-06T23:20:20.827125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.646692Z","title":"question","venue":null,"work_id":"3e914b39-a565-4091-9d42-e2d69f69c9c7","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.995889Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:ab7e3fd8bb6bd1bff5e857e81a6309f0cee40ac3d36d329e414a21d6db0d49a4","observation_id":"7278ccc6-e8be-452c-8a1c-6b0307cd8019","resolution":{"observed_at":"2026-08-06T23:20:20.698192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T15:41:51.266947Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2506.18710."}