{"as_of":"2026-08-10T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56d9c54f6bcf366fdb82bb028b57fdd58502c2bbc121e4c763e5af7fd7d3a4db","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:25:20.526555Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05797/citation-record","integrity":"/paper/2608.05797/integrity","json":"/paper/2608.05797/citation-record.json","paper":"/paper/2608.05797"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-07T23:25:20.458447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.458447Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:68cd74f7a2dd3eee2da4b0d0c4f6c54de55efe5f917371d3864317e850dc455b","observation_id":"e0bba2fe-0bb1-491b-834e-ac0d945a7719","resolution":{"observed_at":"2026-08-07T23:25:20.458447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.889632Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":"2db94ef6-570c-469a-b2b5-eae744e67b11","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.403156Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:c6f15780733310cec2f535cffadb7f09fa21b6d3023069cbc7901afb36dc5c75","observation_id":"3a9ab401-4ba1-4e9c-b875-53a64c9060c8","resolution":{"observed_at":"2026-08-07T23:25:21.893612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.864848Z","title":"Demystifying prompts in language models via perplexity estimation","venue":null,"work_id":"96664588-8520-402b-be7d-948835b328cf","year":2023},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.419707Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2e8d5f310f6623a25ee40ec8a4ddc8997019e82fd718996f39fedae8718e946e","observation_id":"78735c52-245e-4f5a-84b6-7a589b4e3369","resolution":{"observed_at":"2026-08-07T23:25:21.868696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:25:20.423485Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.423485Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:45f766ec6151941e578700a904fa60cb11485ef295b0b8b80ab85c0caa116129","observation_id":"a34605f4-7e0a-4eb8-8c5d-973f3a906b82","resolution":{"observed_at":"2026-08-07T23:25:20.423485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.431316Z","title":"A rosetta stone for ai benchmarks.arXiv preprint arXiv:2512.00193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.431316Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:0eadd0cf8e6b0209f18ad3a40d8512d73b600051708a9d4fc062fb414201138c","observation_id":"e95e670e-c795-4c33-a69c-fdad96b649c1","resolution":{"observed_at":"2026-08-07T23:25:20.431316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T23:25:20.438878Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.438878Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:3daf9f851546bdf51b6ccc5617a853ae0030a325fda1d08ed0ca94aa0316902b","observation_id":"e6404e38-164e-44a2-ad34-aeff77ee642e","resolution":{"observed_at":"2026-08-07T23:25:20.438878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10677","last_updated":"2023-09-27T01:15:49Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T15:02:58Z","title":"Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10677","snapshot_observed_at":"2026-08-07T23:25:20.442787Z","title":"Estimating contamination via perplexity: quantifying memorisation in language model evaluation.URL https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.442787Z"},"links":{"cited_paper":"/paper/2309.10677","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:cdf9bcff24207dca55fb886db2250adfc6d7e08c0ac45d8b152539d277789dcd","observation_id":"a9a3e6b1-6af2-40f7-8702-d757e1c18d07","resolution":{"observed_at":"2026-08-07T23:25:20.442787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07267","last_updated":"2026-07-02T11:08:50Z","snapshot_observed_at":"2026-08-09T01:10:19.210165Z","submitted_at":"2026-02-06T23:36:11Z","title":"BRIDGE: Predicting Human Task Completion Time From Model Performance","version":2},"cited_work":{"arxiv_id":"2602.07267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07267","snapshot_observed_at":"2026-08-07T23:25:21.497337Z","title":"BRIDGE: Predicting Human Task Completion Time From Model Performance","venue":"cs.AI","work_id":"6ecb5ee2-ec08-4bc3-ab51-00d6460a9a08","year":2026},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.446641Z"},"links":{"cited_paper":"/paper/2602.07267","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:f5bfc532c01b8e429814dde218324814f8be5600826801254d203fc53ca5c43e","observation_id":"0d40531c-cc6b-4a43-af1f-56815b822072","resolution":{"observed_at":"2026-08-07T23:25:21.501974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14868","last_updated":"2026-05-08T13:05:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-16T16:01:27Z","title":"Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.14868","snapshot_observed_at":"2026-08-07T23:25:20.450375Z","title":"Goldilocks rl: Tuning task difficulty to escape sparse rewards for reasoning.arXiv preprint arXiv:2602.14868,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.450375Z"},"links":{"cited_paper":"/paper/2602.14868","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:d69ac98de0208e2c56ecc8bc677fbeac12e60033734941a0d11954ac0183c0e8","observation_id":"52501f48-9867-4a49-9d26-9ebe4f115ba3","resolution":{"observed_at":"2026-08-07T23:25:20.450375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-07T23:25:20.466023Z","title":"Gdpval: Evaluating ai model performance on real-world economically valuable tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.466023Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:dc40e5a751d2535298be1773f874dafbf653bbb3afa4df6775eb0e0b3bd6b1f7","observation_id":"d0953aa5-4aa1-4722-8080-8571348054dc","resolution":{"observed_at":"2026-08-07T23:25:20.466023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T23:25:20.470081Z","title":"Humanity’s last exam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.470081Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:73594102e62f0158cba9d6c7a14c2558377698ecb845392bdbd1ce3e319bd089","observation_id":"96e45a33-36d2-4edf-9b49-4e1945035ed4","resolution":{"observed_at":"2026-08-07T23:25:20.470081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04664","last_updated":"2020-05-28T20:51:40Z","snapshot_observed_at":"2026-08-09T01:09:42.786424Z","submitted_at":"2020-03-10T12:38:31Z","title":"Automatic Curriculum Learning For Deep RL: A Short Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04664","snapshot_observed_at":"2026-08-07T23:25:20.474015Z","title":"Auto- matic curriculum learning for deep rl: A short survey.arXiv preprint arXiv:2003.04664,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.474015Z"},"links":{"cited_paper":"/paper/2003.04664","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:1164986a9a793847700d0c2be9a5919321e4b1bcbe0f3c3dc9f7807a03eec7ae","observation_id":"c6b5a2d5-e75f-492d-a705-1f756d3bd4c2","resolution":{"observed_at":"2026-08-07T23:25:20.474015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02309","last_updated":"2023-12-04T19:45:06Z","snapshot_observed_at":"2026-08-10T09:59:02.425947Z","submitted_at":"2023-12-04T19:45:06Z","title":"Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators","version":1},"cited_work":{"arxiv_id":"2312.02309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.02309","snapshot_observed_at":"2026-08-07T23:25:20.960410Z","title":"Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators","venue":"cs.AI","work_id":"5b62da78-db34-4f1b-b9f7-232c4c937b2b","year":2023},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.485277Z"},"links":{"cited_paper":"/paper/2312.02309","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:0d3b657553bc312482efdb726c1939701413fc2f839146c9af925d4668e9e5ab","observation_id":"174efcb9-77d6-4e48-86a6-76dfe68948ad","resolution":{"observed_at":"2026-08-07T23:25:20.966619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13335","last_updated":"2025-03-17T16:15:02Z","snapshot_observed_at":"2026-08-07T16:57:21.932530Z","submitted_at":"2025-03-17T16:15:02Z","title":"Reliable and Efficient Amortized Model-based Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13335","snapshot_observed_at":"2026-08-07T23:25:20.489045Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.489045Z"},"links":{"cited_paper":"/paper/2503.13335","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:60fbbfbc20abd4d7c224108c397e521e3f3be67eea6a36821b6d7f8d0b0242b4","observation_id":"16b42bd2-0ff4-4ff3-a43f-fda7207f427b","resolution":{"observed_at":"2026-08-07T23:25:20.489045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-07T23:25:20.498536Z","title":"Benchmark data contamination of large language models: A survey.arXiv preprint arXiv:2406.04244,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.498536Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2b0621beb122968c88e0465b4fa8c49707c2358bb89b093854031909b5c50bd8","observation_id":"a9d53eba-cd6f-4842-b84f-b86fbc306157","resolution":{"observed_at":"2026-08-07T23:25:20.498536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.503466Z","title":"An illusion of progress? assessing the current state of web agents.arXiv preprint arXiv:2504.01382,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.503466Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:ef55d343f294caac3c5e0e14ea8848ae51bf1ab4ebdce131313fff732d072fb8","observation_id":"0c8d5afb-8c2e-454f-9cf2-273d3799e70d","resolution":{"observed_at":"2026-08-07T23:25:20.503466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T23:25:20.507412Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.507412Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:5dce1c82746aae350973ab8aab7baa107db3696a28c9840ffcbc65ce1ab9757e","observation_id":"708b96d4-f535-475c-b762-3cec4bfe223d","resolution":{"observed_at":"2026-08-07T23:25:20.507412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.847510Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models","venue":null,"work_id":"d1e25354-b8c3-46e5-a734-d10984f9ea2d","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.511381Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2e8eed717c6a712fe8b77a553eca4aa69e7001d4e1a616e3700200ba7f7e309d","observation_id":"311b4df5-1aed-4769-ae55-d894cc6527ca","resolution":{"observed_at":"2026-08-07T23:25:21.851248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.515298Z","title":"Edis: Diagnosing llm reasoning via entropy dynamics.arXiv preprint arXiv:2602.01288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.515298Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:3b69eb12d38ffb1bc4de499c73665047604bd1b0da5e9208c1c65a41d0b5fbe4","observation_id":"05eabc8a-2683-4b64-944c-a0883605f3e2","resolution":{"observed_at":"2026-08-07T23:25:20.515298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.835730Z","title":null,"venue":null,"work_id":"fc7708fc-b61a-4b4b-a065-b8f0a5d1cfa8","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.518691Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:0a4ddd24b9995e3bf9b3e21347ae3ffbe2bd66c012684e7e13caff4603212e94","observation_id":"2911df35-45ae-4891-8e95-dc49273de9e2","resolution":{"observed_at":"2026-08-07T23:25:21.839752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.824174Z","title":"A.2 IRT fitting details The IRT model is fit on the observed binary entries of the agent-task response matrix","venue":null,"work_id":"d40a3251-b00c-4ed3-84cd-587f0ff90612","year":2009},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.522497Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:5d5600486baebed445a4ab05b9ca1acb00c9ca779a03d5736b051bc8283c4161","observation_id":"43ab6abf-30d6-46cc-aa29-6f637b18a21b","resolution":{"observed_at":"2026-08-07T23:25:21.828224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.811285Z","title":null,"venue":null,"work_id":"fcabc337-4535-40ce-bb25-942c8a105d35","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.526555Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:1887aa644aae9ea17949f7f57fd4032749fb43cfa7887bcd31385d1fea74fdd4","observation_id":"f09895f7-b821-4cbf-aa18-3855e666cc36","resolution":{"observed_at":"2026-08-07T23:25:21.815890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17354","last_updated":"2025-03-21T17:54:01Z","snapshot_observed_at":"2026-08-07T16:45:51.002633Z","submitted_at":"2025-03-21T17:54:01Z","title":"HCAST: Human-Calibrated Autonomy Software Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17354","snapshot_observed_at":"2026-08-07T23:25:20.478107Z","title":"Hcast: Human-calibrated autonomy software tasks.arXiv preprint arXiv:2503.17354,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":1960,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.478107Z"},"links":{"cited_paper":"/paper/2503.17354","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:bae293815924daaed2dce6331628e3174a2cffe0d164b9475ebfbe165a5f1b1e","observation_id":"448f91d0-4001-4474-ba87-47060b70a1fc","resolution":{"observed_at":"2026-08-07T23:25:20.478107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-01T07:23:06.300790Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-07T23:25:20.492888Z","title":"Re-bench: Evaluating frontier ai r&d capabilities of language model agents against human experts.arXiv preprint arXiv:2411.15114,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.492888Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:fc21cc759ddd36ae41c22fccad6b400365e2385360f03ea3ce5af58d453cc13b","observation_id":"fd24008f-7d94-46d1-b45c-723447228ba8","resolution":{"observed_at":"2026-08-07T23:25:20.492888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-07T23:25:20.454221Z","title":"Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces.arXiv preprint arXiv:2601.11868,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.454221Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:8871cdc1f475011383fb6dac107b0339f4f49f919ab92e4d6024ea18b9d5b682","observation_id":"4287b8ed-1894-4439-9cc8-db77e16e5bd2","resolution":{"observed_at":"2026-08-07T23:25:20.454221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12284","last_updated":"2024-06-08T10:08:25Z","snapshot_observed_at":"2026-08-09T21:46:30.105453Z","submitted_at":"2024-02-19T16:51:29Z","title":"Refining Minimax Regret for Unsupervised Environment Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12284","snapshot_observed_at":"2026-08-07T23:25:20.394203Z","title":"Refining minimax regret for unsupervised environment design.arXiv preprint arXiv:2402.12284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.394203Z"},"links":{"cited_paper":"/paper/2402.12284","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:9f84f6787588a162c82a815c9fb47ed036c7dab53128d39fd50527f56886cbd8","observation_id":"aa97920f-3c40-4c05-9308-fa9bbbfcba3b","resolution":{"observed_at":"2026-08-07T23:25:20.394203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.434930Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.434930Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:e7048ac821c77ba3205dd89f6e8ba40415e232cbc83d4597f1476d0d5e6382de","observation_id":"73b60335-e28b-496b-b9b9-fc4add245555","resolution":{"observed_at":"2026-08-07T23:25:20.434930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15149","last_updated":"2026-04-16T15:30:10Z","snapshot_observed_at":"2026-07-06T23:02:44.990811Z","submitted_at":"2026-04-16T15:30:10Z","title":"LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15149","snapshot_observed_at":"2026-08-07T23:25:20.427524Z","title":"Llms gaming verifiers: Rlvr can lead to reward hacking.arXiv preprint arXiv:2604.15149,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.427524Z"},"links":{"cited_paper":"/paper/2604.15149","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:5803dedb1481cd4cb3f5e907f3b141b3aac78aa3d92d1d352a4578e3fa1c56c2","observation_id":"fe6ff6e8-8897-44bf-9a39-46a31b45b999","resolution":{"observed_at":"2026-08-07T23:25:20.427524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00594","last_updated":"2026-07-20T11:38:10Z","snapshot_observed_at":"2026-08-06T22:51:32.576291Z","submitted_at":"2026-04-01T07:59:59Z","title":"Agent psychometrics: Task-level performance prediction in agentic coding benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00594","snapshot_observed_at":"2026-08-07T23:25:20.415444Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.415444Z"},"links":{"cited_paper":"/paper/2604.00594","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:8bea91dbb359fcd4ea889caea3e4fcb52a90b34322c809ea039d45d6454513db","observation_id":"3a2f6e1b-4f0c-4f52-8d32-bb4b8e9c97af","resolution":{"observed_at":"2026-08-07T23:25:20.415444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.876618Z","title":"Gen- eralization or memorization: Data contamination and trustworthy evaluation for large language models","venue":null,"work_id":"89576cf5-a31f-491a-94bb-3e5109086c03","year":2024},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.411400Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2b3a11b3344aa3f3d215842b678f1721702e4bdba20097cdb51f66d8cdb81b6f","observation_id":"e07f15b2-fd35-44d4-8798-77fedaa9da41","resolution":{"observed_at":"2026-08-07T23:25:21.881241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.481760Z","title":"Soft contamination means benchmarks test shallow general- ization.arXiv preprint arXiv:2602.12413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.481760Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:7a9c099eee2d1cdc7e2e8e142bbc72a7b4dfadcbf50217182457db3338d2ca6a","observation_id":"b96fd2cc-786b-4f1f-806b-5527f438c682","resolution":{"observed_at":"2026-08-07T23:25:20.481760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-07T23:25:20.407209Z","title":"Swe-bench pro: Can ai agents solve long-horizon software engineering tasks?arXiv preprint arXiv:2509.16941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.407209Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2f59f4a2ae1a238b307afded8b4cdf990dbeab946516ad07221343329602ec48","observation_id":"c1dd55f9-450c-4c5f-9925-693c8860ec52","resolution":{"observed_at":"2026-08-07T23:25:20.407209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06192","last_updated":"2026-03-11T18:00:18Z","snapshot_observed_at":"2026-08-03T13:42:05.563208Z","submitted_at":"2026-03-11T18:00:18Z","title":"The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?","version":1},"cited_work":{"arxiv_id":"2604.06192","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06192","snapshot_observed_at":"2026-08-07T23:25:21.764616Z","title":"The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?","venue":"cs.CL","work_id":"202f47fe-2e6f-4361-8843-779353826c92","year":2026},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.398733Z"},"links":{"cited_paper":"/paper/2604.06192","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:3de83aa40c5eb408a8621ccb8baef61a6d908e5d40c67fb512754ebbea4d7a0d","observation_id":"25939d38-e636-4860-88cd-3a9c09926ee3","resolution":{"observed_at":"2026-08-07T23:25:21.774648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.462141Z","title":"Attention head entropy of llms predicts answer correctness.arXiv preprint arXiv:2602.13699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.462141Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:65c33b437013dc7d1fa9d1465565107af01996cde1ec7036c0f6f21fa19fd09c","observation_id":"a2a1c9aa-b064-4145-a9b9-eb1f5ed5b890","resolution":{"observed_at":"2026-08-07T23:25:20.462141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22750","last_updated":"2026-04-29T17:20:11Z","snapshot_observed_at":"2026-07-06T23:09:05.682387Z","submitted_at":"2026-04-24T17:54:47Z","title":"How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22750","snapshot_observed_at":"2026-08-07T23:25:20.389296Z","title":"How do ai agents spend your money? analyzing and predicting token consumption in agentic coding tasks.arXiv preprint arXiv:2604.22750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.389296Z"},"links":{"cited_paper":"/paper/2604.22750","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:0106a2f1be0a9e4d262c2e5d5a4db92e2724a138c2667eb3728674ff4579dd87","observation_id":"a0bd2f59-d334-4cf0-b7c9-ef94231b0540","resolution":{"observed_at":"2026-08-07T23:25:20.389296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:11:34.411494Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.05797."}