{"as_of":"2026-08-10T06:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fa4e69336943414bcaabcceee5774b46f4e6ab8691a38b003a78935a2e8079c","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:44:11.370038Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:18:05.812386Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T23:36:23.833135Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2502.18036","last_updated":"2026-04-22T02:19:48Z","snapshot_observed_at":"2026-08-02T22:41:05.099083Z","submitted_at":"2025-02-25T09:48:53Z","title":"Harnessing Multiple Large Language Models: A Survey on LLM Ensemble","version":6},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-23T02:22:28.649071Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2502.18036"},"observation_digest":"sha256:6c6a3b9489bb3e411065caef362165d34538f18603cb3a932aff0379636ce7d5","observation_id":"6f7e3875-428c-4ed4-b621-50872f0f1f46","resolution":{"observed_at":"2026-05-23T02:25:19.639009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2502.19559","last_updated":"2026-04-09T08:14:16Z","snapshot_observed_at":"2026-08-02T22:32:42.424177Z","submitted_at":"2025-02-26T20:54:51Z","title":"Stay Focused: Problem Drift in Multi-Agent Debate","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T01:48:50.818281Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2502.19559"},"observation_digest":"sha256:1d36534961d5b30c255fa70d6a0b89a85c6f5f837c50ace9f2aa7cc25c0d6e58","observation_id":"e11a7706-2c59-4529-9e59-ffa4b31752f0","resolution":{"observed_at":"2026-05-23T01:52:22.985691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-07T15:18:05.812386Z","title":"If multi-agent debate is the answer, what is the question?arXiv preprint arXiv:2502.08788, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17115","last_updated":"2025-05-30T08:59:59Z","snapshot_observed_at":"2026-08-09T17:43:27.801947Z","submitted_at":"2025-05-21T15:48:13Z","title":"Swarm Intelligence Enhanced Reasoning: A Density-Driven Framework for LLM-Based Multi-Agent Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:05.812386Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2505.17115"},"observation_digest":"sha256:1a67863b311294b23e363086614f415d7d120240781b8002e19d635a5593e969","observation_id":"c1c90507-3994-46eb-8568-002a362cdfe9","resolution":{"observed_at":"2026-08-07T15:18:05.812386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-07T14:12:36.790347Z","title":"If multi-agent debate is the answer, what is the question?arXiv preprint arXiv:2502.08788, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19797","last_updated":"2025-06-18T09:47:20Z","snapshot_observed_at":"2026-08-09T11:05:26.011113Z","submitted_at":"2025-05-26T10:29:42Z","title":"The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.790347Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2505.19797"},"observation_digest":"sha256:0732764c82f1224b48922a9bc58c7f42b70995827c8e2921e7de9fa4b68d7536","observation_id":"2768a49b-7467-44b5-8d34-d19c554ca877","resolution":{"observed_at":"2026-08-07T14:12:36.790347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-07T13:43:30.722967Z","title":"If Multi-Agent Debate is the Answer, What is the Question? [Internet]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21112","last_updated":"2025-05-27T12:32:42Z","snapshot_observed_at":"2026-08-08T14:40:13.457381Z","submitted_at":"2025-05-27T12:32:42Z","title":"Simulating Ethics: Using LLM Debate Panels to Model Deliberation on Medical Dilemmas","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:30.722967Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2505.21112"},"observation_digest":"sha256:b939f80bbbaef5b21517879b48f43b2775886ad0ea943ee7d662460849b7e9fd","observation_id":"d7df7c56-4a13-45dc-93da-c8d16445477e","resolution":{"observed_at":"2026-08-07T13:43:30.722967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-06T20:51:15.207238Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01701","last_updated":"2025-07-02T13:30:44Z","snapshot_observed_at":"2026-08-08T06:49:39.074205Z","submitted_at":"2025-07-02T13:30:44Z","title":"Exploring Advanced LLM Multi-Agent Systems Based on Blackboard Architecture","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T20:51:15.207238Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2507.01701"},"observation_digest":"sha256:befc93ed52540e60e783497290505222a8f30d43436813e718e423844852e115","observation_id":"3b26e55b-ebca-41e0-bdba-7d0029b7db6d","resolution":{"observed_at":"2026-08-06T20:51:15.207238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2510.07517","last_updated":"2026-04-09T17:03:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-08T20:29:46Z","title":"When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T08:50:53.486588Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2510.07517"},"observation_digest":"sha256:9e5649ab876e6c248270328b12e1957f14d3c2117f977333c9f2f9f1b92c09a6","observation_id":"0a6ee030-9940-4a84-92d4-9bdc53d78588","resolution":{"observed_at":"2026-05-18T08:51:08.438222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2512.13564","last_updated":"2026-01-13T09:33:57Z","snapshot_observed_at":"2026-08-06T08:27:07.254588Z","submitted_at":"2025-12-15T17:22:34Z","title":"Memory in the Age of AI Agents","version":2},"reference_index":269,"source":"arxiv_source","source_observed_at":"2026-05-11T18:18:19.911342Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2512.13564"},"observation_digest":"sha256:b03e2fd81af28bc8e3df75fb098f8bc10217509848dd4f5bd30e0cf56200497a","observation_id":"41b7c466-28c4-483a-94e9-91cbe6678037","resolution":{"observed_at":"2026-05-11T18:18:20.295083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2601.21464","last_updated":"2026-05-07T16:58:04Z","snapshot_observed_at":"2026-07-31T17:41:41.271363Z","submitted_at":"2026-01-29T09:41:14Z","title":"Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T10:04:44.379128Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2601.21464"},"observation_digest":"sha256:27e27c7463e10b6e014463b2d1b4e4b8cba04431520cd3465604bd45a1dbbfbc","observation_id":"6cb0f67e-bc6c-4355-8eda-052802172988","resolution":{"observed_at":"2026-05-16T10:07:43.356950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-02T22:58:13.089522Z","title":"Stop overvaluing multi-agent debate -- we must rethink evaluation and embrace model heterogeneity, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15382","last_updated":"2026-05-28T08:46:27Z","snapshot_observed_at":"2026-08-03T23:19:36.572742Z","submitted_at":"2026-02-17T06:31:53Z","title":"The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-02T22:58:13.089522Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2602.15382"},"observation_digest":"sha256:b5aa2d305c5b84540069cbec7dd2368b7794656353b0d03cb83d56718a0c7a64","observation_id":"615c1bca-7f2a-4ab4-bfe3-02bc5a00ce9c","resolution":{"observed_at":"2026-08-02T22:58:13.089522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2604.09679","last_updated":"2026-04-03T06:58:59Z","snapshot_observed_at":"2026-07-06T22:58:29.952947Z","submitted_at":"2026-04-03T06:58:59Z","title":"Heterogeneous Consensus-Progressive Reasoning for Efficient Multi-Agent Debate","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T18:52:00.129650Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2604.09679"},"observation_digest":"sha256:5c2cd2ffbf857666bce6cc6c53232a2a2d0902d68e4733f3599f752bd0c5cf84","observation_id":"f3eda0e7-7f57-4e25-b7d3-c1226c69d948","resolution":{"observed_at":"2026-05-13T18:53:08.265011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2605.01704","last_updated":"2026-05-05T16:21:16Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T04:12:21Z","title":"The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T15:52:43.274993Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2605.01704"},"observation_digest":"sha256:baa035f4f0a709a1a9700c63bfcfa32f9427fb2da357a26656630baee1ca704f","observation_id":"7273453e-ad28-4b5a-b173-fde4d4a84d65","resolution":{"observed_at":"2026-05-11T09:41:04.071892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2605.10754","last_updated":"2026-05-11T15:53:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T15:53:54Z","title":"The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T05:03:58.419364Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2605.10754"},"observation_digest":"sha256:fad1c699555d09bd7b2235791fe353af8e1f1262b81cb48dd869059d6dd0f1c4","observation_id":"b313d3dc-693f-43d4-9c81-5b2874619367","resolution":{"observed_at":"2026-05-12T05:41:25.852745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2605.12718","last_updated":"2026-05-12T20:26:41Z","snapshot_observed_at":"2026-08-02T04:56:08.043773Z","submitted_at":"2026-05-12T20:26:41Z","title":"CHAL: Council of Hierarchical Agentic Language","version":1},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-14T19:59:13.378797Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2605.12718"},"observation_digest":"sha256:95700216b9362f7c8ef975622b3df7714ff0fafcf12325c31c99bb190ad8024b","observation_id":"fd571dc4-2475-4907-bebb-92448d5e7920","resolution":{"observed_at":"2026-05-14T19:59:25.874239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2605.16895","last_updated":"2026-05-16T09:14:35Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T09:14:35Z","title":"The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T19:18:04.072730Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2605.16895"},"observation_digest":"sha256:e17e00098b3be7014d3c60d8a1755745f1b0b5de67f546d74e20702b624f774b","observation_id":"7cc9798b-1e3e-4a7e-809e-8a4cf6db45be","resolution":{"observed_at":"2026-05-19T19:22:44.827936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2606.00820","last_updated":"2026-05-30T17:41:11Z","snapshot_observed_at":"2026-07-06T23:41:30.158879Z","submitted_at":"2026-05-30T17:41:11Z","title":"Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T18:46:50.409655Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2606.00820"},"observation_digest":"sha256:33beff2f45ecaff465d186b4a236b82a4bd73e8af8d712df508eff4640959871","observation_id":"1519808c-070a-436a-a579-595f125e9c46","resolution":{"observed_at":"2026-06-28T19:52:35.921072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2606.02866","last_updated":"2026-06-01T20:29:47Z","snapshot_observed_at":"2026-08-09T19:09:15.706708Z","submitted_at":"2026-06-01T20:29:47Z","title":"When Helping Hurts and How to Fix It: Multi-Agent Debate for Data Cleaning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T14:05:49.696342Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2606.02866"},"observation_digest":"sha256:8c8af3b3797825730da8df2ce80f2d4fee2090bd63dbebf984203ed7881c7179","observation_id":"3bcdd37b-74a3-484d-b1a7-9df8213f7662","resolution":{"observed_at":"2026-07-01T23:36:23.836748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":"2502.08788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-07-01T23:36:23.833135Z","title":"If multi-agent debate is the answer, what is the question.arXiv preprint arXiv:2502.08788","venue":null,"work_id":"4b5260b1-5d46-42b0-ac28-2bc314ac76ae","year":2025},"citing_paper":{"arxiv_id":"2606.27409","last_updated":"2026-06-25T10:52:54Z","snapshot_observed_at":"2026-08-06T05:22:30.311457Z","submitted_at":"2026-06-25T10:52:54Z","title":"Delayed Verification Destabilizes Multi-Agent LLM Belief: Instability Thresholds and Optimal Corrector Placement","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T01:25:53.612641Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2606.27409"},"observation_digest":"sha256:64948beb39b1807f40485aeda0ce06885e9b1a62c86d21b24001fe01a81d8b87","observation_id":"a43c2fda-9e7e-46c0-95b8-9e55ac9a8d7a","resolution":{"observed_at":"2026-07-01T18:55:58.687109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-02T01:21:37.420392Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14713","last_updated":"2026-07-16T08:24:27Z","snapshot_observed_at":"2026-08-08T01:42:43.690528Z","submitted_at":"2026-07-16T08:24:27Z","title":"Does Multi-Agent Debate Improve AI Feedback on Research Papers?","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T01:21:37.420392Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2607.14713"},"observation_digest":"sha256:35baa35f3f599a16c6ef40cd5ed44e674b984f398f44b2152f8fb374eb176b8e","observation_id":"70cf8fac-3317-4531-9600-b68f9f01fd12","resolution":{"observed_at":"2026-08-02T01:21:37.420392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-01T23:25:45.412659Z","title":"arXiv preprint arXiv:2502.08788 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15442","last_updated":"2026-07-16T20:27:31Z","snapshot_observed_at":"2026-08-09T04:03:15.073090Z","submitted_at":"2026-07-16T20:27:31Z","title":"Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T23:25:45.412659Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2607.15442"},"observation_digest":"sha256:c3d9e01c65bfe7b3b9c293eec70f782f47d23401b7badee3e103fc6968402ff1","observation_id":"f8f1afe4-4561-44e4-bc7b-1fa6129b765f","resolution":{"observed_at":"2026-08-01T23:25:45.412659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08788","snapshot_observed_at":"2026-08-01T00:32:39.776888Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26212","last_updated":"2026-07-28T19:26:50Z","snapshot_observed_at":"2026-08-06T02:06:44.605975Z","submitted_at":"2026-07-28T19:26:50Z","title":"Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-01T00:32:39.776888Z"},"links":{"cited_paper":"/paper/2502.08788","citing_paper":"/paper/2607.26212"},"observation_digest":"sha256:f94335c0c8a973ab2ca7544cf693fb0e26d0e6075e8e0080b703fc90d2dafe2c","observation_id":"ef536534-5397-4a05-baf6-17bb41d7da75","resolution":{"observed_at":"2026-08-01T00:32:39.776888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08788/citation-record","integrity":"/paper/2502.08788/integrity","json":"/paper/2502.08788/citation-record.json","paper":"/paper/2502.08788"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.102878Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.102878Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:17dd2d89f6cb5f85f7bee133486818cff67faac4ed15e5d2d0a79128e43f231a","observation_id":"774f500d-0f99-4a53-8025-df0a1c6c460a","resolution":{"observed_at":"2026-08-07T23:44:11.102878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.109101Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.109101Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:dcb6eeecea675d06774339309c099fae437cb8d04789f6dd3112f5050a2e9a91","observation_id":"a0e9d6cc-e304-49a9-9e02-0419bbed8100","resolution":{"observed_at":"2026-08-07T23:44:11.109101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T23:44:11.114725Z","title":", Odena, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.114725Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:ad4f452fce8c12c54bb0a879adb98fd0547a46144edbce3bce377f7c3a3cb05c","observation_id":"5b353fbd-8dfc-46b6-824e-36443317d0b4","resolution":{"observed_at":"2026-08-07T23:44:11.114725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.295283Z","title":", Chen, W","venue":null,"work_id":"e57d72d1-94ee-43d9-b57b-952dd17ddf9a","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.120939Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:1c2f076928a81f03287ba51d08a003374f23deca5927fbe39f0bdff38e300bc3","observation_id":"d3574903-e39b-4961-a2d6-eeaef968c7ae","resolution":{"observed_at":"2026-08-07T23:44:12.299996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.280516Z","title":", Saha, S","venue":null,"work_id":"7790663d-6116-42dd-ae24-1f307c8761c1","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.126374Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:76a3cb029e8ece5bcb0d017fc8cd566794da38c98914d308cb9aa6301a60caf0","observation_id":"848adf5d-7c01-476d-a4ec-37298a64ab3f","resolution":{"observed_at":"2026-08-07T23:44:12.285247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.264695Z","title":", Tworek, J","venue":null,"work_id":"78993dbb-b309-4d05-9141-de10585fa88e","year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.131814Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:642e97d0a748f507f978b0ff08eb91ed5c77ee00e69d90ccee5b5a8593a87516","observation_id":"ef431af2-0f9c-4946-a2da-1c6011545715","resolution":{"observed_at":"2026-08-07T23:44:12.269751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.248264Z","title":", Zhang, S","venue":null,"work_id":"8de00752-a62d-4739-95d4-3b300e9bd50c","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.137380Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:f8e29434d339b39f94025a2415706b0ca6b48aaec72d10384b8ab3f1402a00e2","observation_id":"4b570b73-0552-479f-83f0-61e8f98e8610","resolution":{"observed_at":"2026-08-07T23:44:12.253156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.233135Z","title":null,"venue":null,"work_id":"f65e4e15-e563-49be-9ad7-56f2c0c05fad","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.142817Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:3f0b167cc7a79ecb95fefca7ac24c0cec2da87f49642bf4c3af960979c7265a2","observation_id":"8b455ea1-d4c0-4676-a7e5-adab38dc3465","resolution":{"observed_at":"2026-08-07T23:44:12.237941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07061","last_updated":"2024-07-10T15:57:21Z","snapshot_observed_at":"2026-08-08T09:15:54.707719Z","submitted_at":"2024-07-09T17:33:24Z","title":"Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07061","snapshot_observed_at":"2026-08-07T23:44:11.148428Z","title":", You, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.148428Z"},"links":{"cited_paper":"/paper/2407.07061","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:0c1a7d4aeb0ca29ff26627e1fbb35265e8e450922c89f81e1fe0f50cf7c64f51","observation_id":"27504505-4886-449d-ad64-ba16ec5fa5d5","resolution":{"observed_at":"2026-08-07T23:44:11.148428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-02T17:07:32.299595Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T23:44:11.154001Z","title":"and Lee, H.-y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.154001Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:1f250db9db6d408f9855c2719cbaa3c4f184c62a9816531e77f9ce15289803af","observation_id":"bbdd4d8d-e2d6-4a3b-a199-1cbd65dcac8e","resolution":{"observed_at":"2026-08-07T23:44:11.154001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T23:44:11.159376Z","title":", Cowhey, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.159376Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:1dbb3937b5abcb98a45ba5f017411580a6cdcc4785c56846528f7af9799bff5d","observation_id":"408b9f5d-5718-41b9-a657-b3128eb2a33f","resolution":{"observed_at":"2026-08-07T23:44:11.159376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T23:44:11.165029Z","title":", Kosaraju, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.165029Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:d6641218cd7e23f92e70f5a096b06c7ca6863c2d08920b7933839480b7b6080e","observation_id":"a869aee5-358a-4432-8fff-90a30b515ada","resolution":{"observed_at":"2026-08-07T23:44:11.165029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.217577Z","title":null,"venue":null,"work_id":"4a2f4392-3e33-42ae-b416-7054db23b192","year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.171069Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:8c630dfcbaa7da8e23e08554647c8d7844425c791b41b8ef30dd8e4902f51abc","observation_id":"43c0e292-1fe5-4503-9737-14f1abb69bd4","resolution":{"observed_at":"2026-08-07T23:44:12.222690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.202652Z","title":", ..., A","venue":null,"work_id":"314ac6da-9973-4e5d-a7ab-97f6d8925b08","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.176149Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:6899759821a3c8592cf335a2e12b991922aad9c27b172596761a34acfa03cabe","observation_id":"a02d2956-3e3f-4a34-b8a4-a0d66ebfafe5","resolution":{"observed_at":"2026-08-07T23:44:12.207412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11995","last_updated":"2023-08-23T08:33:14Z","snapshot_observed_at":"2026-07-06T16:09:25.044896Z","submitted_at":"2023-08-23T08:33:14Z","title":"Topical-Chat: Towards Knowledge-Grounded Open-Domain Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11995","snapshot_observed_at":"2026-08-07T23:44:11.181279Z","title":", Hedayatnia, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.181279Z"},"links":{"cited_paper":"/paper/2308.11995","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:e02450284217600f3ece8baf795b96fdfee9978ffa90ff89e778ea15e1313eb2","observation_id":"3476f28e-5df2-4527-b59d-f41d38f78f71","resolution":{"observed_at":"2026-08-07T23:44:11.181279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T23:44:11.186714Z","title":", Yang, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.186714Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:919be31b1aadd1e911b3593c256fd1f042f98ef8793423a6cb06df8e94fa80f4","observation_id":"42c86cee-5f34-4f58-a540-6de0f00b7f29","resolution":{"observed_at":"2026-08-07T23:44:11.186714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.187382Z","title":", Wang, T","venue":null,"work_id":"26bf19d6-e526-4cc6-9aec-8f6563bddb24","year":2020},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.191756Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:6e9938a06efe9dcb7c98b2c426ec7aedd718e68f5ca08dc2bf924e44ffa4fd5e","observation_id":"2b7eea40-cbd9-4366-982a-f1f523e03207","resolution":{"observed_at":"2026-08-07T23:44:12.192190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.171877Z","title":", Burns, C","venue":null,"work_id":"61255067-71a7-4185-a542-0ababd1a0875","year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.196708Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:91534e456c2fbbd090d8b38b167c5747db05667e2bbd24ee055d382e7f0487da","observation_id":"09d90741-603d-4704-98db-3e82b9e0fc2e","resolution":{"observed_at":"2026-08-07T23:44:12.176723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.156273Z","title":", Burns, C","venue":null,"work_id":"b0c6dcf9-975d-473c-b1e1-9a0d06439727","year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.201638Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:059f64820e5c348976ce7ce8d66abb766744b6fa75ad02ff0fdef7c6536b4bc5","observation_id":"f16fd984-a44a-4a20-b1ad-e7c69227c19a","resolution":{"observed_at":"2026-08-07T23:44:12.161189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.141419Z","title":", Burns, C","venue":null,"work_id":"8a3953b2-a2df-42f1-b371-0be78e2798de","year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.206851Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:69ab424f29edd8cdb37b157c7573b6580f94a5ed4df15b76fc62f41132ba5ead","observation_id":"7701c426-10da-4b13-93e2-ec1882daa011","resolution":{"observed_at":"2026-08-07T23:44:12.146125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.126072Z","title":"u gamer, D. , H \\","venue":null,"work_id":"135848d5-d268-4b8b-a7e8-d62583b9d526","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.211672Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:db9a8ee4e16552a28f1f3b436fd517d3eca35263d554efd5c036503065398930","observation_id":"173bd066-5a3c-4164-b334-440165d64261","resolution":{"observed_at":"2026-08-07T23:44:12.130925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.110707Z","title":null,"venue":null,"work_id":"b6d79f18-6984-4da9-93a3-c00b92fea473","year":2014},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.216525Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:a2525a18cf218161ba99b16d318ecbd80d320e67acef1f8c5857c9a9b1960a82","observation_id":"18ead5f3-c1ca-4027-8cbf-ed722cab7d72","resolution":{"observed_at":"2026-08-07T23:44:12.115425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.094782Z","title":", Hughes, J","venue":null,"work_id":"ac4f83b3-e4a1-4bf7-ba4c-b7feb4321b89","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.222208Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:180f2c0e24430422c75db5e8d40b82352de94bc9be0e3dbcea2d42d7d91007eb","observation_id":"202fc2b4-cd72-44d7-a34d-db50e03de569","resolution":{"observed_at":"2026-08-07T23:44:12.099851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.079033Z","title":", Hajishirzi, H","venue":null,"work_id":"e3bc4f34-39c7-4808-aaf0-73c6c579617c","year":2015},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.227302Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:98b1cddf24d77ab59693150c83a6cdf5c4a42fffe89978efe9381acbdc3bcff6","observation_id":"3f83f8c5-71e8-447f-9872-a10fb84828ab","resolution":{"observed_at":"2026-08-07T23:44:12.084038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.063391Z","title":null,"venue":null,"work_id":"6f1f3783-89d8-4554-9ce9-8457a30d79ab","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.232221Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:1c54b8531f5bc4d59f85cfd2ad7126f833d72f45efb3e76676f5e40292afeb27","observation_id":"5551b8f9-e6b5-4c5d-8626-a1e5b672673c","resolution":{"observed_at":"2026-08-07T23:44:12.068197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.048049Z","title":null,"venue":null,"work_id":"5f21fec0-b94d-43e2-b6ca-55775f8fffc4","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.237173Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:a8aacacb52e6400f762e8fabf5f8bfac374b0e032f99776c05689c8a1373ed1f","observation_id":"e8adc88f-6e3a-4c38-bcc4-4241282b53d2","resolution":{"observed_at":"2026-08-07T23:44:12.052829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-02T16:52:38.363314Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-07T23:44:11.242282Z","title":", Yogatama, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.242282Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:815ece0ee20d1483f07e7472b0c1a1362591c002c2ce67c5c2d30c0405cef24a","observation_id":"960a26bc-9da0-4a44-bbc0-a8922fb46150","resolution":{"observed_at":"2026-08-07T23:44:11.242282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T23:44:11.248860Z","title":", Feng, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.248860Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:e07c0d242edaa503db040bd2381d169c0abcaef6f285bd3c09262c839965636e","observation_id":"7824e0b8-dfb7-42b3-9cdd-70d53b4d1d26","resolution":{"observed_at":"2026-08-07T23:44:11.248860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.032670Z","title":", Tandon, N","venue":null,"work_id":"caf82264-6c36-40be-abe8-406e9066c3c2","year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.254115Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:babb269766fb89dfde6187f1c6b25c262be82ad9796c2c72f4784c887884b9f6","observation_id":"6f78949e-20a8-4fed-956f-c58650c1bfef","resolution":{"observed_at":"2026-08-07T23:44:12.037856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.017322Z","title":"and Eskenazi, M","venue":null,"work_id":"7aff0394-a3af-46df-91aa-08ae5fb4edf7","year":2020},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.259343Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:0b0335efec1b83e5e1bcb8c60817fd56c3c3cc361e04f2b943a03d52f800c3ee","observation_id":"02d27bc9-19fe-47b8-bb9f-0357247f42c8","resolution":{"observed_at":"2026-08-07T23:44:12.022173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:12.001124Z","title":"Gpt-4o-mini","venue":null,"work_id":"e01f33bb-8916-4e7e-8b53-46ecd9e5f514","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.265091Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:b2ce14c1b431c2d93d50db17d124d71c458b8c62edd39523eeea84a7420022bb","observation_id":"324a8c81-0443-43d4-aeda-841e492974da","resolution":{"observed_at":"2026-08-07T23:44:12.006224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.984099Z","title":"Introducing openai o1","venue":null,"work_id":"c64db97c-5364-48de-a662-9c17d6a55975","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.270193Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:9253cd8730ec3c2f112ac1f392f3c855251845c6997e4503e0060bf5db9dc002","observation_id":"2739fce7-0723-4c95-a474-4f49de14745a","resolution":{"observed_at":"2026-08-07T23:44:11.990034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-07T23:44:11.275304Z","title":", Bhattamishra, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.275304Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:653cfbef04efed68604ec9d1b6e6c5077d910ce8f92b54a6a8482552c75a64e7","observation_id":"d540979d-0a68-41e8-9ca1-7058637e9dfd","resolution":{"observed_at":"2026-08-07T23:44:11.275304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06272","last_updated":"2024-02-26T17:36:48Z","snapshot_observed_at":"2026-07-06T16:30:17.248747Z","submitted_at":"2023-10-10T03:06:38Z","title":"Let Models Speak Ciphers: Multiagent Debate through Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06272","snapshot_observed_at":"2026-08-07T23:44:11.280570Z","title":", Liu, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.280570Z"},"links":{"cited_paper":"/paper/2310.06272","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:ecc9fbea881ca5d357bc40275483a6530b301fef3f8a4eb87e646b02f1617148","observation_id":"b1eb5745-8377-4940-9dc3-7ff17618e175","resolution":{"observed_at":"2026-08-07T23:44:11.280570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07155","last_updated":"2025-03-17T00:22:42Z","snapshot_observed_at":"2026-08-07T19:31:15.812384Z","submitted_at":"2024-06-11T11:02:04Z","title":"Scaling Large Language Model-based Multi-Agent Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07155","snapshot_observed_at":"2026-08-07T23:44:11.285875Z","title":", Xie, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.285875Z"},"links":{"cited_paper":"/paper/2406.07155","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:b4c3bdf3827c433a98b940b1c5a2fee1d29510a777b0872259684987de6fd8b1","observation_id":"9a6f0698-3e75-4ef9-aa55-778ed35eb873","resolution":{"observed_at":"2026-08-07T23:44:11.285875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.967640Z","title":"and Roth, D","venue":null,"work_id":"b9de8339-2cc4-4276-b454-10177c59d376","year":2016},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.291385Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:7e9636d841fa7cc56d352fe97af25839590fb7b0c2f99ffbd5bf93c4b0720cf6","observation_id":"126dd360-ca97-4476-bf91-717585b90edd","resolution":{"observed_at":"2026-08-07T23:44:11.972895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.951515Z","title":", Suzgun, M","venue":null,"work_id":"9ffc33e8-7f7a-4fc9-aca5-89fe26d6df37","year":2022},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.296300Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:5210d2b9de751891742bdacb11fb6fe3d9a8b3abf1aebddb09912235fef8a190","observation_id":"67780e6d-5cd4-456e-a132-713ecaccf46f","resolution":{"observed_at":"2026-08-07T23:44:11.956713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.934243Z","title":", Cassano, F","venue":null,"work_id":"14b9a700-66fe-4b82-abae-44481b6537d7","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.301478Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:77e5c7ea2125d76a6f46007e3a75581fc281639c6a35f566bd74e183c34e456e","observation_id":"0c2dc3e5-f33c-4722-b389-bbb9a931a384","resolution":{"observed_at":"2026-08-07T23:44:11.940104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.916719Z","title":null,"venue":null,"work_id":"98e4614a-4f4e-473c-b78b-8a9b021332b7","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.306520Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:3813cf3f59146c8c7629ea8695369c3bc73cc2ddd6628a4b8c1a55bb596462e4","observation_id":"a0a5759a-658b-4191-b985-35b545eefba4","resolution":{"observed_at":"2026-08-07T23:44:11.921771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.900682Z","title":", Rastogi, A","venue":null,"work_id":"941ad616-fde3-4cc5-b009-9c2b17aa391b","year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.311656Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:3cdc904f271d8c56b89e80018ff867bd130e04e216f6a34322ae2f65e8551c24","observation_id":"ce437a98-f3d2-4e18-bccc-94bfb26cd9f8","resolution":{"observed_at":"2026-08-07T23:44:11.905681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T23:44:11.317910Z","title":", Rastogi, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.317910Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:1d50d4c84912b7022af5e71367bb2f3d01b1b4f01fbb5878b3f245be5206bb4a","observation_id":"3d7a31d7-28c7-4cd7-8422-8480b01ceed5","resolution":{"observed_at":"2026-08-07T23:44:11.317910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.772537Z","title":", Herzig, J","venue":null,"work_id":"66ffb87a-3106-44bc-b38a-803b3f422994","year":2019},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.323329Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:38b453dfd80108478d71bc7739a1e3437f9f263a62f0d993b481dc858bd99bc5","observation_id":"5e05c80d-f8f8-4c67-a681-8d90171e4e4e","resolution":{"observed_at":"2026-08-07T23:44:11.889496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18272","last_updated":"2024-02-28T12:04:05Z","snapshot_observed_at":"2026-08-09T17:44:03.239380Z","submitted_at":"2024-02-28T12:04:05Z","title":"Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18272","snapshot_observed_at":"2026-08-07T23:44:11.328347Z","title":", Wang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.328347Z"},"links":{"cited_paper":"/paper/2402.18272","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:29cbe1329ac0150f57f77d7551c618323f35bfea1e5c3b1e2b37c393af85ecfa","observation_id":"68b1c98f-5b57-4f05-ab3f-24d79c1ee675","resolution":{"observed_at":"2026-08-07T23:44:11.328347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.756412Z","title":", Wei, J","venue":null,"work_id":"6f22a931-4000-4092-a945-df0672fa37ea","year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.334364Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:2020fd69b99779659b353f3ead32a61595c581b333d6ff7ebb7b70fde3917f3f","observation_id":"3b1750c8-c45a-4324-ad9c-74828456fa57","resolution":{"observed_at":"2026-08-07T23:44:11.761354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.740287Z","title":null,"venue":null,"work_id":"a1fe2c69-8e82-4e1d-ae94-6fc8b4067168","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.339516Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:79de6e151b1a07e829cbd7e8bffb5c636337c49316ddfe69818913f2da3e1822","observation_id":"5c61d3d7-5e00-4da0-b44d-eaca23a937c1","resolution":{"observed_at":"2026-08-07T23:44:11.745408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.344478Z","title":", Wang, X","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.344478Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:9333d1a7bb4b311f0b4e79e15f491e4dd1110f71ca1a9de1afe1f3a4b3a8ced9","observation_id":"23e7e577-af12-436d-9e2d-4d1d8a7b2db5","resolution":{"observed_at":"2026-08-07T23:44:11.344478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.712775Z","title":", Ding, X","venue":null,"work_id":"286dc5b6-c7d7-4508-9064-0e7c9a62714a","year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.349513Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:5305a93c300677b22152602fb75e84ef5438df88087b7c07ab5f80f4f5197ac0","observation_id":"4c9b2148-20d7-46a2-b81e-91d88cf8205e","resolution":{"observed_at":"2026-08-07T23:44:11.718202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T23:44:11.354454Z","title":", Zhao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.354454Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:9e66add5fc0a743ffa98b2b1a52a16d14311177c6b5996e4d566c5b6ebe6d812","observation_id":"b0930e1b-8891-418d-8e37-bc2a2e6c2d4b","resolution":{"observed_at":"2026-08-07T23:44:11.354454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.695841Z","title":", Sun, Q","venue":null,"work_id":"ec90d6fb-51c6-4e6c-bb43-b13d7f7eebc0","year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.359947Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:f3ff6cd6be36e57be64f42ae3e4ae1908782aa1e93ff9be4b7b6e4c8a69f8096","observation_id":"fe015345-ea89-4cff-8927-9b97537f610e","resolution":{"observed_at":"2026-08-07T23:44:11.701022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.679226Z","title":null,"venue":null,"work_id":"f7e9e875-7497-4881-92fa-594ee3111dfb","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.365050Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:34c4dc5b4ba8cfe1ab6de27e968126b97afa331b4258d59329898ca2f0f4be6d","observation_id":"0054f503-f110-4082-bc5c-21b9a547d2b9","resolution":{"observed_at":"2026-08-07T23:44:11.684223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:44:11.661656Z","title":", Cui, R","venue":null,"work_id":"02bad043-3d04-4346-b1d9-475e32fbcc44","year":2024},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.370038Z"},"links":{"citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:96e512d1f06615fffbe93bac1b607452d5b95968cb8824ce54ae517632cce1da","observation_id":"94bdf6cd-2e9f-4c04-a7c5-0e8f1ef877d0","resolution":{"observed_at":"2026-08-07T23:44:11.667671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T09:16:14.134992Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 21 inbound Pith citation observations for arXiv:2502.08788."}