{"as_of":"2026-08-18T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5b8675c8a0d0934b719303ed65f46813f2ded40e4c74fc82402d923cda13eb4","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:16:44.745332Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25891/citation-record","integrity":"/paper/2607.25891/integrity","json":"/paper/2607.25891/citation-record.json","paper":"/paper/2607.25891"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:36.475036Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:36.475036Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:64b2fb8ce1be16d8a8534242d19cb8e9bd7214c28b90f8e12854e541f9aa832e","observation_id":"46581d87-8e8d-4046-9ba4-e1e59e9a9808","resolution":{"observed_at":"2026-08-01T01:16:36.475036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:36.569303Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:36.569303Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:50c63b47cc14ef2287e73552039b239ea48479f9fd5eedcb9a0059e7ffee0322","observation_id":"2ab8fc9d-d76c-4c77-80f2-6288e743dddc","resolution":{"observed_at":"2026-08-01T01:16:36.569303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:36.719278Z","title":"Chandra and Dexter C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:36.719278Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:98c9d819bfb9277b88eb54f45a21d6cae5bf3ea3fa2dec0147d658f048bacb4a","observation_id":"e32b7f49-5878-48a8-b3c0-36cc888258c5","resolution":{"observed_at":"2026-08-01T01:16:36.719278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:36.827465Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:36.827465Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:f5795d2a4a4072daf20b3d6179be56cd5ec08e5763e7355bf83a67830200acc1","observation_id":"85330b08-790a-4b9c-bcc2-b376cc722961","resolution":{"observed_at":"2026-08-01T01:16:36.827465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:36.948246Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:36.948246Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:d0997237a35da7e8db1a3cdad56b68ab41f8e9803d25bfe0a668b94397332c62","observation_id":"cea7d29b-79ff-4348-8fb1-a5d4bc32edcf","resolution":{"observed_at":"2026-08-01T01:16:36.948246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.082510Z","title":"Tetreault , title =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.082510Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:7e3fc6058a1929cdc0fddf84aa8b02d4f2239d20b941184b98a679d99a335ec5","observation_id":"7fcb6200-70c4-4a03-8e64-a332e1e9f658","resolution":{"observed_at":"2026-08-01T01:16:37.082510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.205068Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.205068Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:018b2954cb7f9f3c2b5841c8553b3d01889642eaed353c41cc41c69eb5ab694d","observation_id":"e24ed402-f6a7-4f65-9cbb-b91d2ee277eb","resolution":{"observed_at":"2026-08-01T01:16:37.205068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.312803Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.312803Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:ba02883aa25d2b73ac5c10e6fb6391b08a4d399bc19cf547130cccd94fb74e26","observation_id":"b2c32395-cb0c-461d-be7d-f10671d6ce31","resolution":{"observed_at":"2026-08-01T01:16:37.312803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.431478Z","title":"Artificial intelligence , volume=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.431478Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:60b6c82102af661418b8b495ae01432ba53e6f1700a3433b0cdb22c7915b63eb","observation_id":"cf73d9f0-5d7f-4e20-aeed-35b4cc1758ff","resolution":{"observed_at":"2026-08-01T01:16:37.431478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.529325Z","title":"Proceedings of the 26th annual international conference on machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.529325Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:bb7f404f16a8d5df17827157920ceb7783e437b32e502226c246a9f864bb53b6","observation_id":"cf54bf4c-d45d-42c9-bb65-15d0ca82597b","resolution":{"observed_at":"2026-08-01T01:16:37.529325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.649227Z","title":"European review , volume=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.649227Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:e8276dc654530a4ee2690e3230c089ddf38f75cd620d61a7959ed8235abe3fb6","observation_id":"7b64b8b7-e98d-4df6-a31d-7a2353828d8e","resolution":{"observed_at":"2026-08-01T01:16:37.649227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-01T01:16:37.775959Z","title":"arXiv preprint arXiv:2211.09110 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.775959Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:be2ed3aa4f89ab668453cb4a344663c34854f8881ce8dbd2893f524752449918","observation_id":"53756ebb-72cd-4238-9a02-60437a2a0877","resolution":{"observed_at":"2026-08-01T01:16:37.775959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:37.917327Z","title":"Transactions on machine learning research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:37.917327Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:efb94cd7c6d7e9e7b1498842258340ee478e1afc1861a704725a1dbc19a6e92a","observation_id":"c1a48a17-ca2d-43fe-bbec-24a24ba720dd","resolution":{"observed_at":"2026-08-01T01:16:37.917327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.109333Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.109333Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:32eb6606bcf12ad5ab98f130c9d5f384e91db4da942bcf65829ebb53e5ecaa9d","observation_id":"fa8f175c-9de4-4518-a90c-990e589b531d","resolution":{"observed_at":"2026-08-01T01:16:38.109333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.244977Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.244977Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:8c1f8acd609315c2aa38ce1a39ea268b2db74e14be48b1e6905db9f7d1a9b5e0","observation_id":"519f51a7-ad8c-4841-b8a0-575081e80ec6","resolution":{"observed_at":"2026-08-01T01:16:38.244977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.404180Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.404180Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:961887e440bd1ab99f5df09d54cce9653813d4ef5f4e306ad3f13610bd06c254","observation_id":"d42e12d5-9683-482f-ab88-addb8f03d484","resolution":{"observed_at":"2026-08-01T01:16:38.404180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.530465Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.530465Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:26c023d659fed82a23ec6450e4cda6f9b84645467167c0dcec6a33d3bc839e03","observation_id":"eebce607-2b36-4efa-8aa0-91a0ccefe655","resolution":{"observed_at":"2026-08-01T01:16:38.530465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.666506Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.666506Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:da2b75e8e2955d7960c5e5696bc8ad5d7d0fc685d9bf9f1cf40d54c0f054bece","observation_id":"aefcacba-5bbf-40bc-a0da-8839cd0262f5","resolution":{"observed_at":"2026-08-01T01:16:38.666506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.868080Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.868080Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:9b7ff75374a5f0a9f47c1fb771fcb8a5f28bede44891b93237fb525fcdf76875","observation_id":"b2f7f192-4743-4349-af04-dbde1b14e897","resolution":{"observed_at":"2026-08-01T01:16:38.868080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:38.989463Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:38.989463Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:94fc3d80b05d16a16d4970952d61ec0cdb26bc1532fee896134173dfff6fe142","observation_id":"90e525d3-1070-4f6a-aeed-76b7e3cc4dfe","resolution":{"observed_at":"2026-08-01T01:16:38.989463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:39.107435Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.107435Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:1e49579ea32bc10ccf283c18c00c9297928e74aad2c84ab6313c58873bbabe2a","observation_id":"db10f6c6-f609-4a44-932d-1fccb4857394","resolution":{"observed_at":"2026-08-01T01:16:39.107435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:39.228610Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.228610Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:a566a4e8eb168724c1898262b7e1c2b8ed865c4d1fd765d1d82642b44f419594","observation_id":"3c1d2c5f-1596-412d-ab97-be968503e7e4","resolution":{"observed_at":"2026-08-01T01:16:39.228610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:39.385010Z","title":"arXiv preprint arXiv:2512.00193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.385010Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:e463063ab55edd803bd24a19ddf6ca28631745d8e58e39989d5af3f012c7e367","observation_id":"e37c1b6e-fd70-4f75-8d18-e9cc6b6f3936","resolution":{"observed_at":"2026-08-01T01:16:39.385010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-01T01:16:39.552307Z","title":"arXiv preprint arXiv:2510.04374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.552307Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:0b8f13ca2dc42c41d8d5b0dc6e3e3e438e0aa191aad24f8a548f1cc448406b58","observation_id":"fbdb6039-17c7-43eb-a23d-eb79473e9420","resolution":{"observed_at":"2026-08-01T01:16:39.552307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.21652","last_updated":"2026-04-21T23:10:09Z","snapshot_observed_at":"2026-08-15T00:13:20.164830Z","submitted_at":"2025-10-24T17:10:26Z","title":"AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.21652","snapshot_observed_at":"2026-08-01T01:16:39.660640Z","title":"arXiv preprint arXiv:2510.21652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.660640Z"},"links":{"cited_paper":"/paper/2510.21652","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:066f3dc49502ff96bc2ddb8b8ae9cf38f940b35d836deac4af946b2e2f45d578","observation_id":"ade5ab9e-ec58-4f31-92c9-b4da01308258","resolution":{"observed_at":"2026-08-01T01:16:39.660640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:39.751266Z","title":"Nejm Ai , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.751266Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:7ec38b4f6496e1e56e6d1e875cbb882c1ef03c74aaca518dcab1aaa2e54408ce","observation_id":"06815f9c-6e99-48e8-a6b7-df063dd62961","resolution":{"observed_at":"2026-08-01T01:16:39.751266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:39.871402Z","title":"arXiv preprint arXiv:2510.01179 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:39.871402Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:55fdb9fd32572ecb35560232c4288051fabab2e1d3470bc747f5da7564f704a2","observation_id":"cafb9dca-d042-40b9-a4a8-dc341552ca59","resolution":{"observed_at":"2026-08-01T01:16:39.871402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:40.027504Z","title":"arXiv preprint arXiv:2510.11977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.027504Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:a6fb120b20354bba0f21c6176a8a4df13b4ab1dd6d9a10587ae535c8e69c0731","observation_id":"91a2615d-bf68-4dfc-bd76-9b3bdc8b9ebe","resolution":{"observed_at":"2026-08-01T01:16:40.027504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:40.162543Z","title":"arXiv preprint arXiv:2504.08942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.162543Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:ec4d34a4d19f406d443ad95028f5812fa56085ee8bc452849282e1bd39659162","observation_id":"f23209f0-9bef-4e60-9bf1-e0d99c8b1f71","resolution":{"observed_at":"2026-08-01T01:16:40.162543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:40.246180Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.246180Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:6ab5b20edf084e4b0cf18a5c1bfb37e0e44389cdfe12e881b297afeb46cdec6f","observation_id":"a4fae78a-021d-41fd-8b60-76ea3998d4b1","resolution":{"observed_at":"2026-08-01T01:16:40.246180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07267","last_updated":"2026-07-02T11:08:50Z","snapshot_observed_at":"2026-08-17T17:58:26.135851Z","submitted_at":"2026-02-06T23:36:11Z","title":"BRIDGE: Predicting Human Task Completion Time From Model Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07267","snapshot_observed_at":"2026-08-01T01:16:40.391615Z","title":"arXiv preprint arXiv:2602.07267 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.391615Z"},"links":{"cited_paper":"/paper/2602.07267","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:4008b7c48152ea74e3c47748722e41b0fb519ebdc4c9637684ab1d9584d67253","observation_id":"4a41b906-500d-4a8e-9307-c28464719bed","resolution":{"observed_at":"2026-08-01T01:16:40.391615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00594","last_updated":"2026-07-20T11:38:10Z","snapshot_observed_at":"2026-08-06T22:51:32.576291Z","submitted_at":"2026-04-01T07:59:59Z","title":"Agent psychometrics: Task-level performance prediction in agentic coding benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00594","snapshot_observed_at":"2026-08-01T01:16:40.536168Z","title":"arXiv preprint arXiv:2604.00594 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.536168Z"},"links":{"cited_paper":"/paper/2604.00594","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:f2760e76b4c7e6035806cf07b5c7515abc2e41d32d73d011b098e68f5b70707b","observation_id":"4a6c34b1-c406-47cd-84c9-179298f79b7e","resolution":{"observed_at":"2026-08-01T01:16:40.536168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-13T03:19:29.377723Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-01T01:16:40.660412Z","title":"arXiv preprint arXiv:2504.12516 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.660412Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:4e6b717ea3abe04dd5b2dff772a196aabb6a3b66136836b45df47b32ecdd27dd","observation_id":"904bb9b5-f3c7-407c-99b1-82d7593aa744","resolution":{"observed_at":"2026-08-01T01:16:40.660412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:40.829077Z","title":"arXiv preprint arXiv:2504.01382 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.829077Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:67e26a16a73df38ff6daf056bcfd52e29f446710b60a3959fdee7ec4d62e6ba8","observation_id":"26483cf4-4e26-4e2a-8d08-c34f8327240d","resolution":{"observed_at":"2026-08-01T01:16:40.829077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-01T01:16:40.991584Z","title":"arXiv preprint arXiv:2601.11868 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:40.991584Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:5c92a53750eebc2072e55dad00a3946c930aaf3b3951da3c770481a76aaef65e","observation_id":"78b07d04-784c-42b3-9ceb-af35334b471a","resolution":{"observed_at":"2026-08-01T01:16:40.991584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:41.103271Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.103271Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:51d490268e7f909225b3576a84c07006699362390f1e011dd77b2e088cc33395","observation_id":"de281f76-dc74-4996-95c9-a50b2c526798","resolution":{"observed_at":"2026-08-01T01:16:41.103271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:41.252122Z","title":"Science , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.252122Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:dbfd79d677dbb41ac38cdaf9ec08bab0d9b7de95d7e20dca4059ed7f1499f571","observation_id":"e14beca2-3a3b-40a1-ac65-8dea3083fdbe","resolution":{"observed_at":"2026-08-01T01:16:41.252122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-01T01:16:41.424525Z","title":"arXiv preprint arXiv:2508.20453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.424525Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:ab527fdec733d79f246afec89e317f3367f91b2a6df02f0d143da732b6946cbd","observation_id":"b5a9827f-7b4c-4ecd-8acb-40f1444fed33","resolution":{"observed_at":"2026-08-01T01:16:41.424525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:41.540118Z","title":"2026 , month =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.540118Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:f78e6f1423252f24bb969028413c04fa0e3ef1e352a1edd203896190febf38b2","observation_id":"ab1fdf3f-c8eb-4ebe-b59c-4f78f7251326","resolution":{"observed_at":"2026-08-01T01:16:41.540118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:41.659262Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.659262Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:e772df24977240d560329668e8e2791925acf27a33d6b31364e36f5f5d3ba06f","observation_id":"85e30411-ee93-4502-aca4-202850ebdd99","resolution":{"observed_at":"2026-08-01T01:16:41.659262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-14T06:47:20.702111Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-01T01:16:41.785644Z","title":"arXiv preprint arXiv:2505.23836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.785644Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:fb10d19647eec37ecfc60ba4f57fd09acec8a668aabc358e3b69a8a9ca5b57ae","observation_id":"b0cd2c7f-7416-43b1-b555-412c771768e6","resolution":{"observed_at":"2026-08-01T01:16:41.785644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:41.857835Z","title":"arXiv preprint arXiv:2510.20487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.857835Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:cb4425fb7d90ae13efead5f8966757a59c4f216dd8eb4c2b43155fba3966bb2e","observation_id":"bb1ba9fd-bef2-4ea4-8162-2837a754da22","resolution":{"observed_at":"2026-08-01T01:16:41.857835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21654","last_updated":"2026-05-17T22:54:07Z","snapshot_observed_at":"2026-08-15T21:09:52.541176Z","submitted_at":"2025-11-26T18:27:17Z","title":"EvilGenie: A Reward Hacking Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21654","snapshot_observed_at":"2026-08-01T01:16:41.965556Z","title":"arXiv preprint arXiv:2511.21654 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.965556Z"},"links":{"cited_paper":"/paper/2511.21654","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:f0e8c4e83c035aaac06ac975c7813959078446d6b23fe0119fec1267fef38358","observation_id":"b9d1bed9-4c79-4f9f-a706-db8a27067138","resolution":{"observed_at":"2026-08-01T01:16:41.965556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.032619Z","title":"arXiv preprint arXiv:2603.29357 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.032619Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:d052fb5d4301b38ec6e6270ccb1b3872c2170c4b72ba1f0e5d96f7255942e152","observation_id":"b7ea2aab-3b04-4cb0-b699-368860664b26","resolution":{"observed_at":"2026-08-01T01:16:42.032619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.099988Z","title":"arXiv preprint arXiv:2501.12851 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.099988Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:564acbc01c59d38c4b5e30644e683b70b6e517335c0df6d61b6ecc97c8af4a9c","observation_id":"ab308f08-cb10-406a-a7ca-eeb4e68b61d3","resolution":{"observed_at":"2026-08-01T01:16:42.099988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-08-12T09:12:28.700231Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-08-01T01:16:42.187549Z","title":"arXiv preprint arXiv:2602.12670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.187549Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:274692059a74bff9175d0fe7b7d03f89eea337e2d928d90f1cafb99235d7b1e1","observation_id":"4305631f-142a-44b1-a5b2-abb3f4e3e024","resolution":{"observed_at":"2026-08-01T01:16:42.187549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.278285Z","title":"arXiv preprint arXiv:2602.11898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.278285Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:f36342974f05d719c3413446477df2cdb8f52a9fddd5ac04423ca05aad3c2b77","observation_id":"1d7b63d3-56f8-4d61-8d8f-7ac15ec548f2","resolution":{"observed_at":"2026-08-01T01:16:42.278285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.391585Z","title":"arXiv preprint arXiv:2603.00039 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.391585Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:0b69139806b83703b6b6fd09a703a7dca11728ace2873e5f93a75b2d83d70157","observation_id":"96104ed5-f950-4f51-8432-bcdb227b4207","resolution":{"observed_at":"2026-08-01T01:16:42.391585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02964","last_updated":"2026-05-03T07:10:42Z","snapshot_observed_at":"2026-08-15T01:30:31.105334Z","submitted_at":"2026-05-03T07:10:42Z","title":"Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02964","snapshot_observed_at":"2026-08-01T01:16:42.463734Z","title":"arXiv preprint arXiv:2605.02964 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.463734Z"},"links":{"cited_paper":"/paper/2605.02964","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:0815f8dd171a00b4e6c8bbe738e413e5804b7671b4222d476310cf7eddd496b8","observation_id":"57fa29fc-3a04-4bee-82c6-fa28f8a84526","resolution":{"observed_at":"2026-08-01T01:16:42.463734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.548291Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.548291Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:ba0a2d9b2b3721e71a99f80e524b06566a3c56084eb993167d014f5d52de16b5","observation_id":"c080e142-93fa-4684-937a-6b9f6b2d2440","resolution":{"observed_at":"2026-08-01T01:16:42.548291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00828","last_updated":"2025-05-20T18:22:10Z","snapshot_observed_at":"2026-08-08T20:38:19.024001Z","submitted_at":"2025-05-20T18:22:10Z","title":"Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00828","snapshot_observed_at":"2026-08-01T01:16:42.610725Z","title":"arXiv preprint arXiv:2508.00828 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.610725Z"},"links":{"cited_paper":"/paper/2508.00828","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:7dc64611e8bc72d0aaf536c5b1218da7b04bcffa2bbe1aa364f062f54b673a9b","observation_id":"7b9074c3-e3ab-4c76-a185-367336ed36bb","resolution":{"observed_at":"2026-08-01T01:16:42.610725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.716188Z","title":"arXiv preprint arXiv:2603.11337 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.716188Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:4369b5086a571bfb9ba382cbd49015cf3dd40d89bc7f2d984f5b9e2ed4101aaa","observation_id":"e94bd8ce-e5aa-45a2-a116-0a7cd03e6088","resolution":{"observed_at":"2026-08-01T01:16:42.716188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.766509Z","title":"Proceedings of the 57th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.766509Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:8bdccf9b747d3699f074a1ea86f0ed98d7f1ac63bf335247ecb96ac4513dba39","observation_id":"c6d42f2b-2b93-403a-9e48-498f6e4de288","resolution":{"observed_at":"2026-08-01T01:16:42.766509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.840023Z","title":"Proceedings of the 47th international ACM SIGIR conference on research and development in information retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.840023Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:1145c3e5766985b830510a7f12cf3798675b89bafbf7f0b77366264fa63c84e1","observation_id":"78e35ee7-12ab-44fe-9858-9c69122b477d","resolution":{"observed_at":"2026-08-01T01:16:42.840023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.895192Z","title":"arXiv preprint arXiv:2602.18998 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.895192Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:c14a1208e137da70a62c45beb879dc1b003a85ffed5e678a18e22e774e28df1b","observation_id":"32a2c605-5174-44b2-a9ed-ca2db8e6da89","resolution":{"observed_at":"2026-08-01T01:16:42.895192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:42.956488Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:42.956488Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:05ebaad569c87a76cd0d845af8e73cee648e8bd513a8a7caa06a2f9b0bf30ef5","observation_id":"22f29d8e-d9ae-4ad5-b04a-1ca83db8c8fa","resolution":{"observed_at":"2026-08-01T01:16:42.956488Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-14T17:59:52.524740Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-01T01:16:43.002223Z","title":"Xu and Xiangru Tang and Mingchen Zhuge and Jiayi Pan and Yueqi Song and Bowen Li and Jaskirat Singh and Hoang H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.002223Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:7e4b128f397bb67f1184ce2517d6843b4f31383b3a2cfd77782bf986a0c17703","observation_id":"499f344b-03e0-48e6-baff-91c8fe323549","resolution":{"observed_at":"2026-08-01T01:16:43.002223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-01T01:16:43.071706Z","title":"arXiv preprint arXiv:2509.16941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.071706Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:db4e08d06007efdbe48a82318ed3a41878fce133d648b898312b292ef57ae2fe","observation_id":"b94c1de4-2969-41a7-a48c-f69e2c9a1ed5","resolution":{"observed_at":"2026-08-01T01:16:43.071706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:43.287907Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.287907Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:b29d351de0ac40b28f0c304c9a667d71e86c812947884fa138195a84ed14e380","observation_id":"a7283b37-3e4d-4b67-978f-ae258f77069a","resolution":{"observed_at":"2026-08-01T01:16:43.287907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-12T16:49:37.896696Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-01T01:16:43.437896Z","title":"arXiv preprint arXiv:2411.15114 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.437896Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:3c759e2f5c25217297525ff98fe50b2369ccbecb48b2a370b7bc9afdef6829b1","observation_id":"d6f79981-5a6c-4191-b434-dd3ce80357e7","resolution":{"observed_at":"2026-08-01T01:16:43.437896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:43.470488Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.470488Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:8237878b23e6e6ce47f551aba513590751af7e83e1d8f7bee4dd98f9b09a321a","observation_id":"bbb0cfc8-913d-49e1-95be-3fd226f741cc","resolution":{"observed_at":"2026-08-01T01:16:43.470488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:43.530795Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.530795Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:c8eaa61a1b5b2d4e3c83716b081edb72abb5ae393b0dfd047ec5b0e794852a3d","observation_id":"1c82b943-0a8a-4063-b193-cb041ddcc942","resolution":{"observed_at":"2026-08-01T01:16:43.530795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:43.570988Z","title":"arXiv preprint arXiv:2510.24591 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.570988Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:7f72b7ed8d2ace8b225e66eb81ebc33c5b8c3f335b0cf229542fdcacb2c29bf6","observation_id":"cf3d803f-66b1-4230-af64-ada4185f4c9f","resolution":{"observed_at":"2026-08-01T01:16:43.570988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-01T01:16:43.615848Z","title":"arXiv preprint arXiv:2501.14249 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.615848Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:af259901ec38229cc2f3c33dec08887862189934632abbf285432b19746e22cd","observation_id":"58042d9c-482e-49c5-861d-6fb646c04f91","resolution":{"observed_at":"2026-08-01T01:16:43.615848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:43.680491Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.680491Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:46d052b42e14b364783624f4218de9ca303cd89bff03645b6dd5b203530814fb","observation_id":"e92a957d-3aff-4fc2-8727-3ef6131ed222","resolution":{"observed_at":"2026-08-01T01:16:43.680491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04698","last_updated":"2024-10-07T02:30:07Z","snapshot_observed_at":"2026-08-16T13:12:04.641168Z","submitted_at":"2024-10-07T02:30:07Z","title":"MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04698","snapshot_observed_at":"2026-08-01T01:16:43.729205Z","title":"arXiv preprint arXiv:2410.04698 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.729205Z"},"links":{"cited_paper":"/paper/2410.04698","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:1c71ef45493ce89b3ae45ff9a19d1a796e884f13c6da4a12a054c3ae67698d4a","observation_id":"c21f4860-4bef-486b-8007-4edbb9b3ee7b","resolution":{"observed_at":"2026-08-01T01:16:43.729205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-16T12:21:08.901888Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-01T01:16:43.824531Z","title":"arXiv preprint arXiv:2506.23719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.824531Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:57b59673334d0e2776df974a71500d2a3ab59eb157335b6aa47ebd4b829108e0","observation_id":"476bc867-a9d9-4d3b-afc6-a0fe2646229b","resolution":{"observed_at":"2026-08-01T01:16:43.824531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:43.910710Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.910710Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:272fa9da46753ba16cb64f24cc4a6cf88b864e4911388b0d7db895af3e42b10b","observation_id":"f17af38c-46da-4f94-aca2-c5aade236882","resolution":{"observed_at":"2026-08-01T01:16:43.910710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.042349Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.042349Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:85f74797be08395baa5a427c5284449c5f82fee8a713428755a935e24193296b","observation_id":"45696fa1-cf31-4bed-9b5b-160e7362d445","resolution":{"observed_at":"2026-08-01T01:16:44.042349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.225491Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.225491Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:53f0b64a2c7acdd3c87eae4984d42ea8cd1b6390d4899f1ec2ea93bccc83ec2e","observation_id":"548095be-2341-4fae-8fbe-802c585d6963","resolution":{"observed_at":"2026-08-01T01:16:44.225491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.328177Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.328177Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:b0ccd0530668e300a20b1188f827c36c18f633015e48583e329c789382dda3a1","observation_id":"10359a18-e2ff-4d23-9f3c-997065ac5098","resolution":{"observed_at":"2026-08-01T01:16:44.328177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.396055Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.396055Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:ac9eb31eaa783ffc4592268a7783b105e3e98e5a468325135b5eba0a2a26143f","observation_id":"a2bee40e-9f8c-4324-be73-7204566c6ef4","resolution":{"observed_at":"2026-08-01T01:16:44.396055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-16T13:42:51.314941Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-01T01:16:44.479430Z","title":"arXiv preprint arXiv:2406.10229 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.479430Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:f9e228448c7a2825766a850315a6c098c35cf84117582ffbf4bd1283d42ed211","observation_id":"c82b8d54-7f25-4e7d-a7c0-596b29880703","resolution":{"observed_at":"2026-08-01T01:16:44.479430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03438","snapshot_observed_at":"2026-08-01T01:16:44.541597Z","title":"arXiv preprint arXiv:2512.03438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.541597Z"},"links":{"cited_paper":"/paper/2512.03438","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:bd4cd52245fc34e21c66d6efbe82859896cd4c988234290bb0548dd9c56c6fb8","observation_id":"258d5d9b-27fe-4947-ae63-2174fdc12742","resolution":{"observed_at":"2026-08-01T01:16:44.541597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.632140Z","title":"arXiv preprint arXiv:2602.03130 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.632140Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:27334dbd8a36acb415cc46ffc6d60f75e4f2f005862c1d1989dafb9e2fe330be","observation_id":"ca9838d5-8633-4455-b720-d7c6fe0e5d75","resolution":{"observed_at":"2026-08-01T01:16:44.632140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.701787Z","title":"2018 , organization =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.701787Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:0a36a4227f1a02e490f12938c19d33903ad277e4b72c197b1a200b91becb6ba1","observation_id":"3463d618-5ab9-48c1-8816-511de1716a65","resolution":{"observed_at":"2026-08-01T01:16:44.701787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:16:44.745332Z","title":"2022 , organization =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.745332Z"},"links":{"citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:15ca478dff79e7fcaab612bd2afe4c6004919f79165c3c57d9cd9013abe33408","observation_id":"9c18e650-0fb0-402d-85bd-01dfe56e24e6","resolution":{"observed_at":"2026-08-01T01:16:44.745332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2607.25891."}