{"as_of":"2026-08-18T07:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ebbef9bac6f07e3dc409b6c9d73a453993d986723dbc1ba951789a17ea4affc","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:16:32.198253Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11434/citation-record","integrity":"/paper/2608.11434/integrity","json":"/paper/2608.11434/citation-record.json","paper":"/paper/2608.11434"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.911176Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.911176Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:4b7829dc782d1ad745ee66b3d09241c4f5bb52d42339d2d72e2ed981314caed4","observation_id":"459565ae-63e7-4dd6-a812-ad3413836f2f","resolution":{"observed_at":"2026-08-15T14:16:31.911176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T14:16:31.917445Z","title":"arXiv preprint arXiv:2411.15594 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.917445Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:b0ec3f125d42c0f89ff1fd78c82ca243883d5d4d48ea285c73ce99628316e5ed","observation_id":"4c37776f-8270-447b-8722-155012e39f7b","resolution":{"observed_at":"2026-08-15T14:16:31.917445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-15T14:16:31.923269Z","title":"arXiv preprint arXiv:2412.05579 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.923269Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:746f6107b32f129477364b6b038bef48b532db7718f44c89adc139d67a97bbb0","observation_id":"859ba63b-7930-4f89-a197-ccde841f800a","resolution":{"observed_at":"2026-08-15T14:16:31.923269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10934","last_updated":"2024-10-16T17:54:12Z","snapshot_observed_at":"2026-08-16T13:09:29.535530Z","submitted_at":"2024-10-14T17:57:02Z","title":"Agent-as-a-Judge: Evaluate Agents with Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10934","snapshot_observed_at":"2026-08-15T14:16:31.928785Z","title":"arXiv preprint arXiv:2410.10934 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.928785Z"},"links":{"cited_paper":"/paper/2410.10934","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:be8dfaba441e2bef1f3e1be14e69aa93670e07ce65170bf979dd78108fe313d1","observation_id":"22ce04ac-f32a-4eea-8542-f17a247c9d6e","resolution":{"observed_at":"2026-08-15T14:16:31.928785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18370","last_updated":"2024-07-25T20:04:59Z","snapshot_observed_at":"2026-08-16T13:30:57.567381Z","submitted_at":"2024-07-25T20:04:59Z","title":"Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18370","snapshot_observed_at":"2026-08-15T14:16:31.934258Z","title":"arXiv preprint arXiv:2407.18370 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.934258Z"},"links":{"cited_paper":"/paper/2407.18370","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:1a8ef2b77d9d5262c03b910e31ddf9d1577b6316e7f3ae7e3083a0f93a954107","observation_id":"4159f734-2f57-418f-9a2e-69c61e1657ef","resolution":{"observed_at":"2026-08-15T14:16:31.934258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.939821Z","title":"arXiv preprint arXiv:2502.01534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.939821Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:6d3a207ef046942e47245866460bf91adcb28462cf28b7129f5b9d87db6843f7","observation_id":"d1fa04e0-638a-4413-8c14-96337f107169","resolution":{"observed_at":"2026-08-15T14:16:31.939821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-18T04:53:42.954410Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-15T14:16:31.945269Z","title":"arXiv preprint arXiv:2310.17631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.945269Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:13e3074eccd160d0dffddd4955cc02ee170dad4e090ff76386bc04a030d51ebd","observation_id":"59a8ad62-7e33-48fa-b8b8-bdeb29d4b960","resolution":{"observed_at":"2026-08-15T14:16:31.945269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-16T13:38:37.638259Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-15T14:16:31.951140Z","title":"arXiv preprint arXiv:2407.00215 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.951140Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:27041e984f216d6c1b4f981d8de9a8bbe5ea642b511af40bcd24b7fe028d1faf","observation_id":"04cf6c93-592c-4d2a-afaa-6fbdbd114091","resolution":{"observed_at":"2026-08-15T14:16:31.951140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.956961Z","title":"arXiv preprint arXiv:2504.08942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.956961Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:fad68ed18526be6c9d25b735deae9591fd659a1b1882c4f60253d33d41d679cf","observation_id":"53e2ec39-3c31-494c-baaa-6429e480fa76","resolution":{"observed_at":"2026-08-15T14:16:31.956961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-17T23:01:45.590632Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-15T14:16:31.962001Z","title":"arXiv preprint arXiv:2404.06474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.962001Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:b41835ea447bc5a7921ff2f12f0312eeb959c82751e23455064a8e22b5f5a744","observation_id":"032d1b18-e46a-41d3-90a3-a4e053a48ce1","resolution":{"observed_at":"2026-08-15T14:16:31.962001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.967653Z","title":"arXiv preprint arXiv:2503.02403 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.967653Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:f4197db7e56d6fbf6a375bcf1b7864c3a4e272f221bd576c1d68bf5774a3ff87","observation_id":"098aef06-4c47-4b4e-82b4-11f191ecb904","resolution":{"observed_at":"2026-08-15T14:16:31.967653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.972605Z","title":"arXiv preprint arXiv:2504.01382 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.972605Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:42ff3dd4c1c6a09d8fda34a0dab1116594bb3a9f35160d6a45162961ea75fb58","observation_id":"416e280a-2822-4573-b6ef-49d966f55767","resolution":{"observed_at":"2026-08-15T14:16:31.972605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.349967Z","title":"Agentic Reward Modeling: Verifying","venue":null,"work_id":"ccb6be5c-0d09-440a-8841-a0fb9b0a07b0","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.978148Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:a4da4402eab8a085982b158de72f30394d3d950e36de4ac7e912801446b402fe","observation_id":"785bddc2-7648-4494-be09-4673ab7c0821","resolution":{"observed_at":"2026-08-15T14:16:33.355751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21823","last_updated":"2026-04-15T09:19:46Z","snapshot_observed_at":"2026-08-17T16:49:52.540760Z","submitted_at":"2025-09-26T03:29:36Z","title":"ProRe: A Proactive Reward System for GUI Agents via Reasoner-Actor Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.21823","snapshot_observed_at":"2026-08-15T14:16:31.983082Z","title":"arXiv preprint arXiv:2509.21823 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.983082Z"},"links":{"cited_paper":"/paper/2509.21823","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:a0503483b3394669e4bc3cc97750820704ad3c73253b7a646a00c0f399bfdc16","observation_id":"8963812d-7c3d-4d88-8712-ca0ae5ca3e97","resolution":{"observed_at":"2026-08-15T14:16:31.983082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.988574Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.988574Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ce8673bfc456d5b21e27c1ef514db21ca91196b698f42608497d2e86df822c6b","observation_id":"84019af1-727f-40e6-a9ce-30c178af32cc","resolution":{"observed_at":"2026-08-15T14:16:31.988574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.321610Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"18d48ea1-2955-4a68-86c6-c2d791d92e8d","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.993527Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:172213683854182c4f103e8028218063a5157f4203999c9fd7ec9bcc686c319c","observation_id":"51f932d1-9049-4148-b46e-9b8eb2ec1d99","resolution":{"observed_at":"2026-08-15T14:16:33.326938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.305620Z","title":"2025 , eprint=","venue":null,"work_id":"8933a2f3-73d2-4db3-ba92-c0ae4bee7c6a","year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.998716Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:c4d626e44fe72764537a9a86215721e94b55d6e95ee389bedf2fa0033e492e90","observation_id":"f2883150-765b-44d4-bbb6-7f7d9e876b27","resolution":{"observed_at":"2026-08-15T14:16:33.310381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.289841Z","title":"Proceedings of the 30th ACM SIGKDD conference on knowledge discovery and data mining , pages=","venue":null,"work_id":"e1d0e92d-c783-4e22-a669-55531555e6c9","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.003906Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:36a81ac9174638b190a7f0deae3f453873da477c2d29cd5296683e144b172ce6","observation_id":"8ce83736-aed8-46d5-b7aa-a39987ff5fee","resolution":{"observed_at":"2026-08-15T14:16:33.295066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.008836Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.008836Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:c4219c7d111989c013b819056e6d8a05bcca7155874cdbda38d5b0ec0e43f821","observation_id":"c76913cf-4f77-4859-8e4d-d017b199c749","resolution":{"observed_at":"2026-08-15T14:16:32.008836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16660","last_updated":"2025-07-21T02:55:09Z","snapshot_observed_at":"2026-08-17T16:48:06.112317Z","submitted_at":"2024-04-25T14:56:32Z","title":"Benchmarking Mobile Device Control Agents across Diverse Configurations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16660","snapshot_observed_at":"2026-08-15T14:16:32.013673Z","title":"arXiv preprint arXiv:2404.16660 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.013673Z"},"links":{"cited_paper":"/paper/2404.16660","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:984f65caa036caa4d2de01040687144049cc873c99058af873a171e745762da0","observation_id":"20a63972-cfe0-4996-ad35-5a3959ff5151","resolution":{"observed_at":"2026-08-15T14:16:32.013673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.018875Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.018875Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:7b7fd1684cd6e3734b24ec56ed234e892b042a89ef49262031091cdd892a9fa7","observation_id":"0734db5b-9877-426b-a87b-8099740f23e8","resolution":{"observed_at":"2026-08-15T14:16:32.018875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.023625Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.023625Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:55db5558058d5854b749b8984e5d941b30854f0ac51a079c6cc600ece2b98f84","observation_id":"856bbb72-5629-41d5-9e79-8e999dc5a31e","resolution":{"observed_at":"2026-08-15T14:16:32.023625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.028406Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.028406Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:bb64e5a4ff21df13c7c5279efa6b4945dd8ee8513ea0c33c7bea9517c4ac7fa3","observation_id":"40982bc3-e1a1-48a3-a05a-b807dd17939d","resolution":{"observed_at":"2026-08-15T14:16:32.028406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.033137Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.033137Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:864a85392b2b72728f67d977d602466a4b230b7ce73bf36aeca409d59d1df716","observation_id":"c06a0372-89c0-4a33-8383-574f9f29d717","resolution":{"observed_at":"2026-08-15T14:16:32.033137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.038168Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.038168Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:3438db675a480a61229eb39f7d5f040afb9b859f02fe1cc07c54c5b13c7e85a0","observation_id":"3edaa242-13ea-49b3-ba36-5ac3246d2f18","resolution":{"observed_at":"2026-08-15T14:16:32.038168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.042790Z","title":"AgentBench: Evaluating","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.042790Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:81c408b43e54a8d7d94d7c339695701262a3336dc0ff090eda0a72718ae8260b","observation_id":"e6b39dcc-4d15-4b58-b11c-f377d615c79f","resolution":{"observed_at":"2026-08-15T14:16:32.042790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.047694Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.047694Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ca11a27b924e1f46a0bbbe60a3d2d843818137e08408684a406d4051ae43a2ee","observation_id":"44b90881-c4fa-42fd-9c9a-737df97b0901","resolution":{"observed_at":"2026-08-15T14:16:32.047694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.052364Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.052364Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:cf25e04aecfefe1542e0b2496a43ec781bfb88c49b3272044593129f82937419","observation_id":"174e94ea-8eff-427a-8fd1-b262c726d22e","resolution":{"observed_at":"2026-08-15T14:16:32.052364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.057692Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.057692Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:a6d555d601c32a5d0fe989e07d04ac0a1521aec10f82fc0102abc546a38f1a83","observation_id":"0d672b7b-1725-44eb-bf82-ced1257f74e2","resolution":{"observed_at":"2026-08-15T14:16:32.057692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.062580Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.062580Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:39ca103eff8d798de788f8a9545302bdaa6cce443e3fb11a07922080ebd5db6b","observation_id":"172e35b6-9782-4df1-82a2-1f2450f4ab0a","resolution":{"observed_at":"2026-08-15T14:16:32.062580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T14:16:32.067446Z","title":"arXiv preprint arXiv:2212.08073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.067446Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:215e77d5dfa22e13f33ed45c344678bf21f85bb590eb0850844bb0448031b409","observation_id":"6cbe5f76-0556-41be-a8aa-af24c2fe83a4","resolution":{"observed_at":"2026-08-15T14:16:32.067446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.073219Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.073219Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ad43be692765fc59725047f8a576f7899408ec09925ad72e171c12a95a872d51","observation_id":"e9bd76ce-9bd4-40ed-b964-3c170892c2a6","resolution":{"observed_at":"2026-08-15T14:16:32.073219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.079033Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.079033Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ad995644cae24f9f182544a09532d86f4921a04f095f009a2731abd5e750bf57","observation_id":"03355267-5ae0-4dfa-b3dc-df89f733b8ed","resolution":{"observed_at":"2026-08-15T14:16:32.079033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.083855Z","title":"arXiv preprint arXiv:2509.18119 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.083855Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ec60455078c8b1162c8d4b257e33eaad9ad5a9b3560f224aca09b55edd8be447","observation_id":"296ab333-57e0-4942-948f-8679fa6474f2","resolution":{"observed_at":"2026-08-15T14:16:32.083855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05720","last_updated":"2025-07-08T07:07:53Z","snapshot_observed_at":"2026-08-14T16:53:04.784753Z","submitted_at":"2025-07-08T07:07:53Z","title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05720","snapshot_observed_at":"2026-08-15T14:16:32.088344Z","title":"arXiv preprint arXiv:2507.05720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.088344Z"},"links":{"cited_paper":"/paper/2507.05720","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:fb8f61016404f3faa710add4fd43c00463602fda14d4e753d29c8465c68dd16a","observation_id":"0f56b061-3d55-465d-a1bf-fc66b6dc4e69","resolution":{"observed_at":"2026-08-15T14:16:32.088344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.093292Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.093292Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:5a6310b6b162cdaee90252d7be5d6872066de58abcea6bd93aa599cf0e2235e8","observation_id":"65c1156f-ba41-4315-a70f-56cb60bbc993","resolution":{"observed_at":"2026-08-15T14:16:32.093292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.098421Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.098421Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:bcca708445dfbfe936dfc39b4b3a523919c702e9e43d3777fccd983ee8b3582a","observation_id":"77aeb3c1-2a88-4476-9888-5e1845537f1c","resolution":{"observed_at":"2026-08-15T14:16:32.098421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.15922","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.464091Z","title":"arXiv preprint arXiv:2409.15922 , year=","venue":null,"work_id":"f0f2133f-fcac-40e3-8a17-9671f8d8140d","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.104134Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:fbfc3415a6aed8dc542094706c2a88612081c153f91c2f65abc021ac11903da5","observation_id":"fdc80167-d9ce-44c6-bdd7-9fc0bea76df0","resolution":{"observed_at":"2026-08-15T14:16:32.473314Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.109139Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.109139Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:af889e9dd127460d44ec0712500e4db2625415561526a00cc6b1c0ab215eef61","observation_id":"596d336c-524c-4359-956c-5136dfa0cb19","resolution":{"observed_at":"2026-08-15T14:16:32.109139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.113664Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.113664Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:2c4c7f7e969c3fdd12c66389c2e70bdaafca4876cf7de569dfbb26c6275b8dff","observation_id":"8ab4694e-adef-4b5b-a7e2-ad6578e1705d","resolution":{"observed_at":"2026-08-15T14:16:32.113664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.120720Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.120720Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:0759025361c4e04b97da948b46225c48504cf8810e4928501ab04761b3816c8e","observation_id":"42469195-bcff-40ab-b82e-fcd6fd95bd22","resolution":{"observed_at":"2026-08-15T14:16:32.120720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-08-16T21:34:35.147772Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-15T14:16:32.125755Z","title":"arXiv preprint arXiv:2501.12326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.125755Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:681d6e0b2a0e4d27705c784d57e45e5be6de1a0e9a18aa451b6daad1c9d76d16","observation_id":"467705c5-13bc-4cf1-bce6-df9e156c3a3c","resolution":{"observed_at":"2026-08-15T14:16:32.125755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.130803Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.130803Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:1dcb712f6257a1f7d1952c3a89bb9d4b79ac261328032eef2dff6edf8fef6164","observation_id":"da50c88c-d8e9-4378-ae52-fba1444e3721","resolution":{"observed_at":"2026-08-15T14:16:32.130803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07718","last_updated":"2024-07-23T06:19:28Z","snapshot_observed_at":"2026-08-02T12:09:24.340284Z","submitted_at":"2024-03-12T14:58:45Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07718","snapshot_observed_at":"2026-08-15T14:16:32.135869Z","title":"arXiv preprint arXiv:2403.07718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.135869Z"},"links":{"cited_paper":"/paper/2403.07718","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:713a9f32c4704a8984a8bfaef9552f4077d6835e5c8dc3ed406833c7ec18cf5d","observation_id":"813b31c9-9785-484a-896d-4cc80db9f165","resolution":{"observed_at":"2026-08-15T14:16:32.135869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02907","last_updated":"2025-02-05T18:56:51Z","snapshot_observed_at":"2026-08-17T16:47:51.121990Z","submitted_at":"2024-10-03T18:56:51Z","title":"NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02907","snapshot_observed_at":"2026-08-15T14:16:32.141202Z","title":"arXiv preprint arXiv:2410.02907 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.141202Z"},"links":{"cited_paper":"/paper/2410.02907","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:a97ffb86b143ca37e396cc43edd1b65896a7a85c3678cd433024d303e8591fc2","observation_id":"db4c014c-b9a1-4712-8858-0f5ad09dbf9d","resolution":{"observed_at":"2026-08-15T14:16:32.141202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.146221Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.146221Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:c3df90c3027c63af8cf11836cb2497cf9cfcd215bf1303a87b209b7f214f48ba","observation_id":"c169458d-480d-4331-b420-f2e2239d0b6c","resolution":{"observed_at":"2026-08-15T14:16:32.146221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-15T14:16:32.151042Z","title":"arXiv preprint arXiv:2406.12793 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.151042Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:4cc3a6650bbfbc4893c0aef052ce4f7f7a7a13b4199f9d9d4240c0b20fc4c706","observation_id":"65c21e3b-1e6f-475c-a3cf-39d8ca993a1e","resolution":{"observed_at":"2026-08-15T14:16:32.151042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T14:16:32.156301Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.156301Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:45bae2aa22f685bb0a1ff2614cc84696c64387b22197c36e099786c25b112e9b","observation_id":"c2ca3d5b-87f6-4e61-9d75-a6c634fbc8c9","resolution":{"observed_at":"2026-08-15T14:16:32.156301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T14:16:32.161977Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.161977Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:4d78a5d9afe93fea30e292e2f5b80a5bea9fe00553ab9755af94aac60dffe0c1","observation_id":"9d0df293-bc95-447d-9e23-29eba29c88e9","resolution":{"observed_at":"2026-08-15T14:16:32.161977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.058099Z","title":null,"venue":null,"work_id":"83dbd22f-b379-4602-9663-5a505de83548","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.167383Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:e3d141f01dc458737d5170473a0cc19288e8b839da4b61499e39f16e50c2b88e","observation_id":"2fa48a6d-d961-44df-b778-5fc06d7491e0","resolution":{"observed_at":"2026-08-15T14:16:33.063532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.040679Z","title":null,"venue":null,"work_id":"d286526e-f8ea-4206-96f8-38c7f17d8744","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.173421Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:5ce7df911331429a60a18e3a7f31a64cf6ab68329371ba2db80a02361b932f0e","observation_id":"ecc1b69f-87eb-4487-9980-26640e937fbd","resolution":{"observed_at":"2026-08-15T14:16:33.046366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.023088Z","title":"2025 , note=","venue":null,"work_id":"c85b3675-5380-4b30-80ac-728513fe9121","year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.178476Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:5da436897ea56119b113be74b54bde946c5cf4bc73b7712a608f5eab067234db","observation_id":"f791c250-faf3-4e16-b380-307aca291450","resolution":{"observed_at":"2026-08-15T14:16:33.027992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.183383Z","title":"2025 , note=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.183383Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:b439f3e3dd569c792ff95391423e9c67b255cf5f072423b45f9f48c6cb21812b","observation_id":"eb6527f1-0fa1-40b0-8443-0b67c865ece4","resolution":{"observed_at":"2026-08-15T14:16:32.183383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-15T14:16:32.188278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.188278Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:6b63fd5f85458144428dce0ab96da40f03f206ae043e7a9584808af7aa59b0f5","observation_id":"248cf1fe-a7ce-41c4-a806-0b0cc83d4ad2","resolution":{"observed_at":"2026-08-15T14:16:32.188278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.995559Z","title":null,"venue":null,"work_id":"b7324563-0af1-4446-bda0-daf5d152a8fa","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.193184Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:a10e55bdc591093bba10fdab74ca7ec0df2515532bd7c406465c2055ad9e3192","observation_id":"98d9f3cb-4d8f-45a5-83ab-d70e1bdd8a69","resolution":{"observed_at":"2026-08-15T14:16:33.001354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.978787Z","title":null,"venue":null,"work_id":"62b39d66-abb7-4f5f-ba9d-895432c7e1ae","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.198253Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:87b02cf49aefccad57c47a4cc2cdf0d5c95c50518e0d24495b7c89b1b1c28a95","observation_id":"347f05eb-0442-49f7-9010-a9d9604287db","resolution":{"observed_at":"2026-08-15T14:16:32.983736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T07:11:32.303688Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.11434."}